OpenAI је 6. октобра објавио велику збирку математичких радова насталих уз помоћ вештачке интелигенције. Она садржи рукописе, преглед наведених резултата и датотеке формалних доказа за неке од њих. објава OpenAI наводи да је резултате произвео интерни модел и да компанија планира радионице које би математичарима помогле да их разумеју. Објава пред математичаре ставља и обиман задатак процене: да одлуче којим резултатима се може веровати и који се могу користити.

Вештачка интелигенција може да произведе истраживачке резултате-кандидате брже него што садашње научне заједнице могу да их прихвате и обраде. Ова објава илуструје тај ризик; она није измерено сазнање о целом истраживачком систему. По мом мишљењу, институције треба да третирају проверу, објашњавање и независно праћење као значајан истраживачки рад и да за њега обезбеде људе и средства. Дужи списак резултата-кандидата не може да обави те послове уместо нас.

Велика промена

  • Шта се променило: Компанија може истовремено да представи истраживачкој заједници стотине математичких рукописа насталих уз помоћ вештачке интелигенције. Документи су доступни за увид, али тврдње и даље треба процењивати за сваки резултат посебно.
  • Зашто је то важно: Истраживачи који желе да се ослоне на неку тврдњу морају да утроше време на проверу њених претпоставки, доказа и места у досадашњем раду. Ако број резултата-кандидата расте брже од капацитета за проверу, важне исправке и корисне идеје могле би да остану затрпане у истом реду.
  • Шта треба пратити: Одлуке се сада тичу подршке независној провери и објашњењу, као и објављивању. OpenAI је обећао радионице; независна саветодавна група препоручује финансирање под вођством заједнице и јасно навођење порекла. Те одлуке ће одредити ко може да процењује и надограђује рад.

Шта број рукописа значи за рецензенте

У прегледу репозиторијума од 6. октобра налази се тврдња о Какајиним скуповима у четири димензије: сваки скуп који садржи јединични дуж у сваком правцу има Хаусдорфову димензију четири. Један рукопис из збирке излаже аргумент. То је математичка тврдња коју је објавила компанија и која је и даље под лупом. Не могу да утврдим да ли је тачна читајући преглед или бројећи радове.

У одвојеном увиду у фиксирани снимак репозиторијума од 6. октобра, BIG CHANGE је пребројао 722 рукописа у 372 породице резултата. Једна породица може да обухвати више сродних радова. Број описује датотеке у једној верзији збирке; не значи да је 722 открића независно потврђено. Тај ранији чланак показује како читалац може да прати рукопис до формалне тврдње и конфигурације за њену проверу. Овде је питање како једна област може да обезбеди довољно квалификованих читалаца за тај посао док низ тврдњи расте.

Формализација може да помогне. Рачунар може да провери да ли предложени доказ успоставља прецизно кодирани исказ под одређеним дефиницијама, зависностима и аксиомама. Ипак, неко мора да испита да ли се тај исказ поклапа са тврдњом коју читаоци мисле да рад износи, да ли су претпоставке прикладне и како се резултат односи према ранијим радовима. Неки радови у збирци немају формализације; Lean датотека за један исказ не рецензира цео рукопис. увид у репозиторијум објашњава ова ограничења, али не тврди да је покренут алат за проверу.

Септембарска објава о Навије–Стоксовим једначинама показује зашто ова разлика има последице шире од пописа репозиторијума. OpenAI је саопштио да је његов интерни систем пронашао конструкцију присилног слома са коначном енергијом која се односи на алтернативе C и D у званичној формулацији института Clay, и објавио рад и формализацију у Lean-у. Институт Clay је 11. септембра саопштио да је проблем „наизглед“ решен и да ће процена и признавање заслуга бити без журбе. У том одговору Clay није доделио награду. ранији приказ математичког следа догађаја у BIG CHANGE пружа технички контекст. Овде је поента у времену између објављеног резултата и промишљене процене.

Проверу треба финансирати и признати као засебан допринос

Независна саветодавна група за математику и вештачку интелигенцију тврди да објављивање започиње рад на људском разумевању. Њене препоруке од 29. септембра позивају лабораторије да провере литературу и навођење заслуга, обезбеде читљиве доказе, информације о употреби модела и неуспелим покушајима, као и формализацију кад је могућа. Траже и подршку, укључујући финансирање, за рад заједнице на разумевању и примени резултата. У свом одговору од 6. октобра, група је навела да њену саветодавну улогу не треба сматрати подршком поступку OpenAI нити оценом утицаја резултата.

Ту подршку бих учинио уобичајеним делом финансирања и вредновања истраживања. Уз тврдњу треба навести њену верзију, допринос вештачке интелигенције, претпоставке, пратеће материјале и начин за пријаву исправки. Независни стручњаци могли би да одреде приоритете према могућем значају тврдње и последицама грешке. Резултат од којег зависе други докази захтева другачији напор у провери од ограниченог прорачуна. Објашњења, репликације, неуспеле провере и пажљиве исправке треба да се рачунају као доприноси, чак и када не објављују први резултат.

Ово захтева више од институција, али не полази од претпоставке да су академици увек непријатељски настројени или спори. Математичка рецензија штити признавање заслуга и открива грешке; одговорна уздржаност је важна када ће резултат постати полазиште за даљи рад. Проблем капацитета настаје зато што стварање резултата-кандидата и стицање оправданог поверења у њега захтевају различите врсте рада. Обимна објава може да оптерети пажљиве институције чак и када оне свој посао обављају добро.

Практична примена може да провери вредност унутар свог домета

Компаније које развијају производе на основу истраживања могу рано да понуде практичне провере. Имплементација може да покаже да идеја помаже у одређеном задатку, а неуспела имплементација може да открије погрешну претпоставку. Таква запажања треба објавити уз методе и ограничења како би их други могли проверити. Сам комерцијални успех не доказује математичку теорему нити општу научну тврдњу.

Разлика зависи од дисциплине. У математици функционалан производ не решава доказ; стручна провера и, где је прикладно, формална верификација баве се тачном теоремом. У рачунарским наукама другима је потребно довољно кода, података и поставки да понове резултат и провере осетљивост. Биологија и медицина захтевају одвојене фазе доказа, од лабораторијског рада до студија на животињама и људима када је то применљиво. У физици теорија или симулација захтева посматрања или експерименте који испитују предвиђања. Компанија може да допринесе у било којој од тих фаза, али се доказ из једне фазе не може неприметно унапредити у доказ за следећу.

Ранији коментар BIG CHANGE о приватним открићима вештачке интелигенције и јавној науци разматрао је ко контролише приступ резултатима и алатима. Чак и када је објава јавна, остаје институционално питање: имају ли истраживачи време, независност и подстицаје да резултате-кандидате претворе у поуздано знање. Одговор треба да се види у финансираној репликацији, јавним објашњењима и признатим исправкама, а не само у следећем броју рукописа.

Извори и додатна литература