HINDI TUMITIGIL ANG MUNDO.RSS
BIG CHANGE.

Markdown edition

AI-translated from English; not yet reviewed by a fluent editor.

# Sinusukat ng bagong survey sa AI self-improvement ang agwat tungo sa mas mahusay na mga susunod na modelo

> Inilalatag ng bagong survey ang limang antas ng kontrol ng AI sa sarili nitong pagpapahusay. May mga sistemang nagpapakita ng limitadong pag-unlad, ngunit hindi pa napapatunayan ang maaasahang pagpapabuti sa magkakasunod na henerasyon.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Inilalatag ng isang [survey na inilathala sa arXiv noong Setyembre 10 at binago noong Setyembre 22](https://arxiv.org/html/2609.11873v3) ang pamagat na *The Last AI Built by Humans* ay naglalarawan ng mithiin, hindi pangyayaring iniulat ng mga may-akda. Umaabot ang ebidensiya nila sa mga limitadong halimbawa ng sistemang nagbabago ng ilang bahagi ng sarili nitong proseso ng pagbuo. Hindi nito pinatutunayan na maaasahang nakakalikha ang isang sistema ng mas mahusay na kahalili sa bawat bagong henerasyon.

Mahalaga ang pagkakaibang ito sa pagbasa ng mga pahayag tungkol sa awtomatikong pananaliksik sa AI. Maaaring magpatakbo ng mga eksperimento, magtala ng mga natutuhan at magpataas ng marka sa benchmark ang isang agent habang tao pa rin ang nagtatakda ng layunin, kumokontrol sa mga pagsubok at nagpapasya kung aling pagbabago ang mananatili. Para mapatunayan ang mas matibay na pahayag, kailangan ng ebidensiyang pinahusay ng sistema ang *pamamaraan* na lumilikha ng susunod nitong bersiyon at mas mahusay na gumana ang binagong pamamaraan sa patas na paghahambing.

## Ang malaking pagbabago

- **Ano ang nagbago:** Mayroon na ngayong mas tiyak na paraan ang mga mananaliksik para ilarawan kung gaano kalaking bahagi ng siklo ng pagpapahusay ng AI ang kontrolado ng isang sistema—mula sa pagsasagawa ng mga iniatas na pagbabago hanggang sa pagrebisa sa pamamaraang gagamitin sa mga susunod na pagbabago. Inaayos ng bagong survey ang umiiral na pananaliksik; hindi ito nag-aanunsyo ng tapos nang sistemang nagsasariling bumubuo ng mas mahusay na kahalili.
- **Bakit ito mahalaga:** Maaaring mag-automate ang mga AI lab ng mas maraming eksperimento nang hindi napapatunayang mas mahusay ang bawat bagong agent sa pagbuo ng kasunod nito. Nakaaapekto ang pagkakaibang ito sa pagbasa ng mga mananaliksik sa mga pahayag tungkol sa performance at sa pagpapasya kung saan kailangan ang pagsusuri ng tao at mga independiyenteng pagsubok.
- **Ano ang dapat bantayan:** Ang mapagpasyang ebidensiya ay serye ng mga kahaliling modelong binuo gamit ang minana at binagong paraan ng pagpapahusay, at sinubok sa mga nakalaang gawain laban sa lumang paraan gamit ang maihahambing na yaman. Hindi pa naitatatag ng sinuring mga pag-aaral ang estadistikong maaasahang pag-ipon ng mga pagpapahusay batay sa pamantayang ito.

## Inilalarawan ng limang antas ang kontrol sa siklo ng pagpapahusay

Inihihiwalay muna ng papel ang pagbabago sa iisang gawain, na tinatawag nitong B0, sa patuloy na pagpapahusay. Pinahusay ng modelong nag-eedit ng sagot hanggang pumasa ito sa pagsusuri ang sagot na iyon. Kung hindi maililipat ang pagbabago sa mga susunod at hiwa-hiwalay na gawain, hindi nakapagtamo ng pangmatagalang pagbabago ang sistema mismo.

Sa **Antas 1**, pinipili ng mga tao ang layunin at pamantayan ng tagumpay; AI naman ang nagsasagawa ng pagbabago, gaya ng pagpapatupad sa tuntunin sa kalidad ng datos na itinakda ng tao. Sa **Antas 2**, AI na rin ang pumipili ng estratehiya para sa iniatas na layunin, halimbawa, sinusuri ang mga pagkabigo ng coding agent at nagmumungkahi ng pagbabago sa mga tool nito. Nananatili sa labas ng sistema ang layunin at pamantayan sa pagtanggap.

Sa **Antas 3**, tumutulong ang sistema na pumili kung anong karanasan ang kailangan nito sa susunod, gaya ng mga pagsasanay na nakatuon sa mga kahinaang natukoy nito. Nagdaragdag ang **Antas 4** ng feedback mula sa patuloy na paggamit: pinananatili ng sistema ang mga aprubadong pagbabago sa memorya, tuntunin o bahagi ng sistema matapos makaharap ng bagong mga sitwasyon. Ayon sa papel, nakadepende ang dalawang antas sa kalidad ng feedback at sa mga tuntuning nagtatakda kung aling pagbabago ang mananatili.

**Antas 5** ang pangunahing ideya ng survey. Binabago ng AI ang pamamaraang gumagabay sa *mga susunod na* pagpapahusay, gaya ng patakaran nito sa paghahanap, evaluator o agent na nagmumungkahi ng mga kahalili. Kailangang panatilihin ang binagong pamamaraan at gamitin sa kasunod na ikot. Gayunman, sinasabi ng papel na maaari pa ring kontrolin ng mga tao ang pangkalahatang layunin, mga nakalaang pamantayan sa pagtanggap at mga mapagkukunan. Inilalarawan ng antas kung anong pananagutan ang ipinagkatiwala, hindi nito ginagarantiyahan ang pag-unlad o walang limitasyong pagsasarili.

## Ipinakikita ng mga umiiral na sistema kung saan nagtatapos ang kontrol

Iniulat sa pag-aaral tungkol sa [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) na tumaas mula 20% tungo sa 50% ang marka ng coding agent sa subset ng SWE-bench na ginamit sa pag-aaral, habang binabago ng mga bersiyon nito ang code ng agent at inilalagay sa archive ang mga matagumpay na bersiyon. Sinasabi rin ng mga may-akda na nakapirmi ang pagpapanatili ng archive at tuntuning pumipili kung aling bersiyon ang magiging magulang. Ginagamit ito ng survey para ipakitang hindi sapat na patunay ng pagpapahusay sa prosesong pumipili ng mga kahalili ang mas mahuhusay na susunod na bersiyon.

[Nagbibigay ang A-Evolve-Training](https://arxiv.org/html/2606.20657) ng mas makitid na halimbawa ng Antas 5. Nagsagawa ito ng apat na ikot ng post-training sa modelong may 30 bilyong parameter. Pinagsama-sama ng meta-agent ang mga resulta at binago ang patakaran sa pananaliksik na gumagabay sa mga susunod na worker matapos huminto sa pagsabay ang panloob na development score at panlabas na leaderboard. Iniulat ng pag-aaral ang huling markang 0.86, kumpara sa 0.87 ng pinakamahusay na submission ng tao noong panahong iyon. Binago ng minanang patakaran kung paano pinili ang mga susunod na eksperimento. Nanatiling nakapirmi ang pinagbabatayang sistema ng mga worker at layunin ng kompetisyon. Ipinakikita nito ang binagong pamamaraan ng pananaliksik sa loob ng isang takdang proyekto, hindi ang nagsasariling kontrol sa bawat bahagi ng pagbuo ng modelo.

Sinusubok sa pag-aaral ng [HyperAgents](https://arxiv.org/html/2603.19461) kung maililipat sa bagong larangan ang pinahusay na pamamaraan sa pagbuo ng agent. Pagkaraan ng 200 pag-ulit sa pagmamarka ng matematika, umabot sa 0.640 ang marka ng takbong nagsimula sa mga inilipat na pagpapahusay, kumpara sa 0.610 ng takbong nagsimula sa orihinal nitong agent. Iniulat ng mga may-akda na hindi estadistikong makabuluhan ang pagkakaibang ito. Sinusuportahan ng resulta ang karagdagang pagsasaliksik sa paglilipat, pero hindi nito napapatunayan ang maaasahang pag-ipon ng mga pagpapahusay sa magkakasunod na takbo.

## Hindi patunay ng mas mahusay na pagpapahusay ang mas maraming aktibidad

Inihihiwalay ng survey ang muling paggamit sa binagong pamamaraan, na tinatawag nitong *structural recursion*, sa *effective recursion*: nagbubunga ang binagong pamamaraan ng mas mahuhusay na kahalili sa ilalim ng maihahambing na badyet at independiyenteng pagsusuri. Iyan ang ikalawang pagsubok na maaaring ipalagay ng mambabasa na naganap na dahil sa kapansin-pansing pamagat ng papel.

May ilang paraang mapagkamalan ang aktibidad bilang pag-unlad. Maaaring gumugol ang sistema ng mas maraming oras sa pag-compute para maghanap, magkasya nang husto sa benchmark na paulit-ulit na nitong sinubok, o magpanatili ng pagbabagong nakatutulong sa isang gawain pero nakasasama sa iba. Kung binabago rin nito ang sarili nitong evaluator, maaaring bagong panukat lang ang dahilan ng mas mataas na marka. Kaya hinihingi ng papel na itala kung ano ang binago, ipakitang ginabayan nga ng binagong bahagi ang kasunod na ikot, ihambing ito sa lumang bahagi gamit ang magkatugmang mapagkukunan, at subukin ang pananatili at paglilipat ng mga pagbabago sa mga independiyenteng gawain.

Tahasan na sinasabi ng mga may-akda na sinusuportahan ng kasalukuyang mga resulta ang limitadong pagbabago sa mga improver, evaluator at patakaran sa pananaliksik, samantalang “hindi pa napagpapasyahan ang estadistikong maaasahang pag-ipon sa magkakasunod na henerasyon gamit ang maihahambing na mga mapagkukunan.” Pangalan ng mithiing pinagbabatayan ng balangkas nila ang pariralang “the last AI built by humans.” Nagbibigay ang survey ng mga pamantayan para tasahin ang pag-usad tungo rito.

## Mga mapagkukunan at karagdagang babasahin

- [Duan et al., *The Last AI Built by Humans*, bersiyon 3](https://arxiv.org/html/2609.11873v3) (Setyembre 22, 2026). Tinutukoy sa pangunahing survey ang B0 at mga Antas 1–5, at inihihiwalay nito ang structural at effective recursion habang inilalahad ang mga limitasyon ng ebidensiya. Balangkas ng mga may-akda ang taxonomy at mga interpretasyon nito, hindi bagong demonstrasyon ng sistema.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (bersiyon 3, Marso 12, 2026). Iniulat sa orihinal na pag-aaral ang pagtaas ng mga marka sa coding benchmark at tinukoy na nananatiling nakapirmi ang pagpapanatili ng archive at pagpili ng magulang.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (bersiyon 3, Setyembre 8, 2026). Inilalarawan sa orihinal na preprint ang apat na ikot ng post-training, pagbabago sa patakaran at iniulat na resulta sa leaderboard. Nananatiling itinakda mula sa labas ang layunin at pinagbabatayang sistema ng mga worker.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). Sinusubok sa orihinal na pag-aaral ang paglilipat ng pamamaraan sa pagbuo ng agent at iniulat na walang estadistikong kabuluhan ang 200-iteration na paghahambing na binabanggit dito.
- [Masusing pagbasa ni Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (Setyembre 18, 2026) sa mga halimbawang nasa matataas na antas ng survey at mga limitasyon ng ebidensiya. Mas naunang rebisyon ng papel ang sinuri nito; bersiyon 3 at ang mga binanggit na orihinal na pag-aaral ang ginamit sa artikulo sa itaas para sa mga pahayag tungkol sa mga katotohanan.
- [Ulat ng South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (Setyembre 14, 2026) tungkol sa limang yugtong roadmap ng survey at konteksto ng pananaliksik sa AI. Sekondaryang pagbabalita ito, hindi ebidensiya para sa mga resulta ng pag-aaral.
- [Paliwanag ng The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (Setyembre 16, 2026) na nagbubuod sa mga antas at naglalagay sa papel sa mas malawak na debate tungkol sa awtomatikong pananaliksik sa AI. Sekondaryang pagbabalita ito; ang papel at mga orihinal na pag-aaral ang sumusuporta sa mga pahayag tungkol sa pananaliksik sa itaas.

## Sources

- [Duan et al.: The Last AI Built by Humans, bersiyon 3](https://arxiv.org/html/2609.11873v3) — Pangunahing survey sa mga antas ng pagsasarili at mga halimbawa ng pananaliksik. Tinutukoy nito ang pagkakaiba ng structural at effective recursion at sinasabing hindi pa napagpapasyahan ang estadistikong maaasahang pag-ipon sa magkakasunod na henerasyon gamit ang maihahambing na mapagkukunan. Hindi ito nagdedemonstrasyon ng bagong AI na kusang binuo.
- [Kasaysayan ng mga bersiyon ng arXiv submission na 2609.11873](https://arxiv.org/abs/2609.11873) — Itinatala rito ang bersiyon 1 noong Setyembre 10 at bersiyon 3 noong Setyembre 22; tinutukoy rin si Yi Duan at ang 34 niyang kapwa may-akda.
- [Zhang et al.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — Iniulat sa orihinal na pag-aaral ang pagtaas mula 20% tungo sa 50% sa subset nito ng SWE-bench at sinabing hindi maaaring baguhin ng sistema ang pagpapanatili ng archive at pagpili ng magulang.
- [Shi et al.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — Inilalarawan sa orihinal na preprint ang apat na awtonomong ikot ng post-training, napanatiling binagong patakaran sa pananaliksik at markang 0.86 kumpara sa 0.87 sa leaderboard sa petsang tinukoy. Nananatiling nakapirmi ang pinagbabatayang sistema ng worker at ang layunin.
- [Zhang et al.: HyperAgents](https://arxiv.org/html/2603.19461) — Iniulat sa orihinal na pag-aaral ang paghahambing ng paglilipat matapos ang 200 pag-ulit: 0.640 kumpara sa 0.610 sa test set para sa pagmamarka ng matematika; hindi estadistikong makabuluhan ang pagkakaiba.
- [Manuel Muñoz Plá: Masusing pagbasa sa The Last AI Built by Humans](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Masusing independiyenteng pagbasa ito sa naunang rebisyon ng survey. Nakalista para sa konteksto; ang mga orihinal na papel ang sumusuporta sa mga pahayag ng artikulong ito tungkol sa pananaliksik.
- [South China Morning Post: Inilalatag ng mga mananaliksik na Tsino ang limang-yugtong landas](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Sekondaryang ulat tungkol sa survey at konteksto ng pananaliksik nito. Karagdagang babasahin ito, hindi pangunahing ebidensiya para sa mga resulta ng eksperimento.
- [The Rundown AI: Inilalarawan ng mga mananaliksik na Tsino ang AI na makabubuo ng mga kahalili nito](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Sekondaryang paliwanag ito sa limang antas ng papel at sa mas malawak na debate. Ang mga orihinal na papel ang sumusuporta sa mga pahayag sa itaas tungkol sa mga katotohanan ng pananaliksik.
Newsletter ng BIG CHANGE

Ang kabuuang larawan, sa sarili mong bilis.

Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.