Novi pregled objavljen na arXiv-u 10. septembra i revidiran 22. septembra opisuje pet nivoa učešća AI-ja u unapređivanju AI sistema. Naslov rada, The Last AI Built by Humans, označava ambiciju, a ne događaj koji autori prijavljuju. Njihovi dokazi obuhvataju ograničene primere sistema koji menjaju delove sopstvenog razvojnog postupka. Ne dokazuju da sistem pouzdano stvara sve bolje naslednike iz generacije u generaciju.

Ta je razlika važna pri tumačenju tvrdnji o automatizovanom istraživanju AI-ja. Agent može da sprovodi eksperimente, čuva naučene lekcije i poboljša rezultat na testu, dok ljudi i dalje određuju cilj, kontrolišu testiranje i odlučuju koje izmene opstaju. Snažnija tvrdnja zahteva dokaz da je sistem unapredio metodu kojom pravi svoju sledeću verziju i da se ta izmenjena metoda pokazala boljom u pravičnom poređenju.

Velika promena

  • Šta se promenilo: Istraživači sada imaju precizniji način da opišu koliki deo ciklusa unapređivanja AI kontroliše — od sprovođenja dodeljenih izmena do promene postupka koji će se koristiti za kasnija unapređenja. Novi pregled organizuje postojeće radove; on ne najavljuje završenog autonomnog graditelja naslednih sistema.
  • Zašto je važno: AI laboratorije mogu da automatizuju sve više eksperimenata, a da time ne dokažu kako je svaki novi agent bolji u stvaranju sledećeg. Ta razlika utiče na tumačenje tvrdnji o performansama, kao i na odluke o ljudskom nadzoru i nezavisnom testiranju.
  • Šta pratiti: Presudni dokazi bili bi niz naslednih sistema napravljenih izmenjenom metodom unapređivanja, nasleđenom iz prethodne generacije, i testiranih na zaštićenim zadacima prema staroj metodi uz uporedive resurse. Radovi obuhvaćeni pregledom još nisu dokazali statistički pouzdano kumulativno poboljšanje po tom kriterijumu.

Pet nivoa opisuju kontrolu nad ciklusom unapređivanja

Rad najpre razlikuje izmenu pojedinačnog zadatka, koju naziva B0, od trajnog unapređenja. Model koji menja odgovor dok ne prođe proveru unapredio je taj odgovor. Ako se izmena ne prenese na kasnije, nezavisne zadatke, sam sistem nije stekao trajnu nadogradnju.

Na nivou 1, ljudi biraju cilj i proveru uspeha, a AI sprovodi izmenu, na primer primenjuje pravilo kvaliteta podataka koje je definisao čovek. Na nivou 2, AI bira i strategiju za zadati cilj, možda tako što utvrdi greške programerskog agenta i predloži izmene njegovih alata. Cilj i provera prihvatanja i dalje dolaze spolja.

Na nivou 3, sistem pomaže u izboru iskustva koje mu je sledeće potrebno, na primer zadataka za vežbu usmerenih na slabosti koje je otkrio. Nivo 4 dodaje povratne informacije iz kontinuirane upotrebe: sistem zadržava odobrene izmene memorije, pravila ili komponenti i nakon susreta s novim uslovima. Prema radu, oba nivoa zavise od kvaliteta povratnih informacija i pravila koja određuju koje izmene ostaju na snazi.

Nivo 5 predstavlja središnju ideju pregleda. AI menja postupak kojim se usmerava kasnije unapređivanje, na primer svoju politiku pretrage, evaluator ili agenta koji predlaže nasledne sisteme. Izmenjeni postupak mora da se sačuva i upotrebi u narednom krugu. I na ovom nivou, navodi se u radu, ljudi mogu da zadrže kontrolu nad opštim ciljem, zaštićenim proverama prihvatanja i resursima. Nivo opisuje delegiranu odgovornost, a ne garantovani napredak ili neograničenu autonomiju.

Postojeći sistemi pokazuju gde je granica

Studija o sistemu Darwin Gödel Machine navodi da se rezultat njenog programerskog agenta na podskupu SWE-bench-a poboljšao sa 20% na 50%, dok su varijante menjale kod agenta, a uspešne varijante ulazile u arhivu. Autori takođe navode da su održavanje arhive i pravilo za izbor varijante koja postaje roditeljska bili fiksirani. Pregled je koristi da pokaže zašto bolji potomci sami po sebi ne dokazuju da je i postupak njihovog odabira unapredio sebe.

A-Evolve-Training pruža uži primer nivoa 5. Sprovedena su četiri kruga naknadne obuke modela sa 30 milijardi parametara. Meta-agent je objedinio rezultate i izmenio istraživačku politiku koja je usmeravala naredne agente kada interni razvojni rezultat više nije pratio eksternu rang-listu. Studija navodi konačan rezultat 0,86, u poređenju sa 0,87 koliko je u to vreme ostvario najbolji ljudski učesnik. Nasleđena politika promenila je izbor kasnijih eksperimenata. Osnovni sistem radnih agenata i cilj takmičenja ostali su neizmenjeni. Ovo pokazuje izmenjeni istraživački postupak u okviru definisanog projekta, a ne autonomnu kontrolu nad svim delovima razvoja modela.

Rad HyperAgents proverava da li se unapređeni postupak za izgradnju agenata prenosi u novu oblast. Nakon 200 iteracija na ocenjivanju matematike, eksperiment koji je počeo sa prenetim unapređenjima postigao je 0,640 na svom skupu za testiranje, u poređenju sa 0,610 za eksperiment koji je počeo od početnog agenta. Autori navode da ta razlika nije bila statistički značajna. Rezultat podržava dalje proučavanje prenosa unapređenja, ali ne dokazuje njihovo pouzdano kumuliranje kroz uzastopne eksperimente.

Više aktivnosti ne dokazuje bolje unapređivanje

Pregled razlikuje ponovnu upotrebu izmenjenog postupka, koju naziva strukturnom rekurzijom, od efektivne rekurzije: izmenjeni postupak daje bolje nasledne sisteme uz uporedive budžete i nezavisnu procenu. Upravo zbog drugog kriterijuma ne bi trebalo pretpostaviti da se ono što sugeriše dramatičan naslov već dogodilo.

Postoji nekoliko načina da se aktivnost zameni za napredak. Sistem može da potroši više računarskog vremena na pretragu, da se prenauči na testu koji je više puta koristio ili da zadrži izmenu koja pomaže jednom zadatku, a kvari drugi. Ako menja i sopstveni evaluator, veći rezultati mogu biti posledica novog merila. Zato rad poziva da se zabeleži šta je promenjeno, pokaže da je izmenjena komponenta zaista usmeravala sledeći krug, uporedi sa starom komponentom uz izjednačene resurse i proveri zadržavanje i prenos unapređenja na nezavisne zadatke.

Autori izričito navode da trenutni rezultati podržavaju ograničene izmene sistema za unapređivanje, evaluatora i istraživačkih politika, dok „statistički pouzdano kumuliranje kroz generacije uz uporedive resurse ostaje otvoreno pitanje“. Izraz „poslednji AI koji su napravili ljudi“ označava cilj koji motiviše njihov okvir. Pregled postavlja kriterijume za procenu napretka ka tom cilju.

Izvori i dodatna literatura

  • Duan i saradnici, The Last AI Built by Humans, verzija 3 (22. septembar 2026). Primarni pregled definiše B0 i nivoe od 1 do 5, razlikuje strukturnu od efektivne rekurzije i navodi ograničenja dokaza. Taksonomija i tumačenja predstavljaju okvir autora, a ne demonstraciju novog sistema.
  • Zhang i saradnici, Darwin Gödel Machine (verzija 3, 12. mart 2026). U izvornoj studiji prikazan je napredak na testu programiranja i navedeno da održavanje arhive i izbor roditeljske varijante ostaju fiksni.
  • Shi i saradnici, A-Evolve-Training (verzija 3, 8. septembar 2026). Izvorni preprint opisuje četiri kruga naknadne obuke, izmenu politike i navedeni rezultat na rang-listi. Cilj i osnovni sistem agenata i dalje se zadaju spolja.
  • Zhang i saradnici, HyperAgents (2026). Izvorna studija proverava prenos postupka za izgradnju agenata i navodi da poređenje posle 200 iteracija pomenuto ovde nije statistički značajno.
  • Detaljno čitanje Manuela Muñoza Pláa (18. septembar 2026) razmatra primere sa viših nivoa u pregledu i ograničenja dokaza. Analizira raniju verziju rada; članak iznad koristi verziju 3 i navedene izvorne studije za činjenične tvrdnje.
  • Izveštaj lista South China Morning Post (14. septembar 2026) obrađuje petostepeni plan iz pregleda i širi kontekst istraživanja AI-ja. To je sekundarno izveštavanje, a ne dokaz rezultata studija.
  • Objašnjenje lista The Rundown AI (16. septembar 2026) sažima nivoe i smešta rad u raspravu o automatizovanom istraživanju AI-ja. Reč je o sekundarnom izvoru; činjenične tvrdnje iznad potkrepljuju rad i izvorne studije.