СВЕТ НЕ СТОЈИ У МЕСТУ.RSS
BIG CHANGE.

Markdown издање

AI-translated from English; not yet reviewed by a fluent editor.

# Истраживање самоусавршавања вештачке интелигенције показује разлику између аутоматизације и стварања бољих наследника

> Ново истраживање описује пет нивоа контроле коју вештачка интелигенција има над сопственим унапређивањем. Постојећи системи показују ограничене добитке, али поуздано побољшање кроз узастопне генерације још није доказано.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Једно [истраживање објављено на arXiv-у 10. септембра и ревидирано 22. септембра](https://arxiv.org/html/2609.11873v3) описује пет нивоа учешћа вештачке интелигенције у унапређивању AI система. Његов наслов, *Последња вештачка интелигенција коју су изградили људи*, описује тежњу, а не догађај који су аутори пријавили. Њихови докази обухватају ограничене примере система који мењају делове сопственог развојног процеса. Они не потврђују постојање система који поуздано ствара све боље наследнике из генерације у генерацију.

Ова разлика је важна за тумачење тврдњи о аутоматизованом истраживању вештачке интелигенције. Агент може да изводи експерименте, чува научене поуке и побољша резултат мерила, док људи и даље одређују циљ, контролишу тестове и одлучују које измене остају. Јача тврдња захтева доказ да је систем унапредио *поступак* којим се ствара његова следећа верзија и да је измењени поступак остварио бољи резултат у равноправном поређењу.

## Кључна промена

- **Шта се променило:** Истраживачи сада имају прецизнији начин да опишу колики део циклуса унапређивања вештачке интелигенције контролише систем: од извршавања додељених измена до ревидирања поступка који усмерава касније измене. Нови преглед организује постојеће радове; не најављује довршен систем који самостално гради наследника.
- **Зашто је важно:** Лабораторије могу да аутоматизују више експеримената, а да тиме не докажу како је сваки нови агент бољи у стварању следећег. Та разлика утиче на тумачење тврдњи о перформансама и на одлуку о томе где ће истраживачи задржати људску проверу и независне тестове.
- **Шта треба пратити:** Одлучујући доказ био би низ наследника створених помоћу наслеђеног, измењеног поступка унапређивања, тестираних на заштићеним задацима у односу на стари поступак и уз упоредиве ресурсе. Прегледани радови још нису доказали статистички поуздано кумулативно побољшање по том основу.

## Пет нивоа описује контролу над циклусом унапређивања

Рад најпре одваја измену појединачног задатка, означену као B0, од трајног унапређења. Модел који мења одговор док не прође проверу побољшао је тај одговор. Ако се измена не пренесе на касније, независне задатке, систем није стекао трајну надоградњу.

На **нивоу 1** људи бирају циљ и проверу успешности, а вештачка интелигенција изводи измену, на пример применом правила за квалитет података које су одредили људи. На **нивоу 2** вештачка интелигенција такође бира стратегију за задати циљ, можда тако што утврђује недостатке програмског агента и предлаже измене његових алатки. Циљ и провера прихватљивости и даље долазе споља.

На **нивоу 3** систем помаже да се одлучи које су му информације следеће потребне, на пример тако што бира задатке за вежбу усмерене на уочене слабости. **Ниво 4** додаје повратне информације из непрекидне употребе: систем задржава одобрене измене меморије, правила или компоненти након сусрета са новим условима. Према раду, оба нивоа зависе од квалитета повратних информација и правила која одређују које се измене задржавају.

**Ниво 5** досеже средишњу идеју прегледа. Вештачка интелигенција ревидира поступак који усмерава *касније* унапређивање, на пример политику претраге, оцењивач или агента који предлаже наследнике. Ревидирани поступак мора да се задржи и користи у следећем кругу. И на том нивоу људи, према раду, могу да задрже контролу над општим циљем, заштићеним тестовима прихватљивости и ресурсима. Ниво описује делегирање одговорности, а не гаранцију напретка нити неограничену аутономију.

## Постојећи системи показују границе

Истраживање о [Darwin Gödel Machine-у](https://arxiv.org/html/2505.22954) наводи да је његов програмски агент остварио раст од 20% на 50% на подскупу SWE-bench-а у тој студији, пошто су варијанте мењале код агента, а успешне варијанте додаване у архиву. Аутори такође наводе да су одржавање архиве и правило за избор варијанте-родитеља били фиксни. Преглед га користи да покаже зашто бољи потомци сами по себи не доказују да се унапредио и поступак који бира потомке.

[A-Evolve-Training](https://arxiv.org/html/2606.20657) пружа ужи пример петог нивоа. Спровео је четири круга пост-обуке модела са 30 милијарди параметара. Мета-агент је сажимао резултате и мењао истраживачку политику која усмерава касније раднике када интерни развојни резултат више није пратио спољну ранг-листу. Студија наводи коначни резултат 0,86, у поређењу са 0,87 за најбољи људски поднесак у том тренутку. Наслеђена политика мењала је начин избора каснијих експеримената. Основни систем радника и циљ такмичења остали су непромењени. Ово показује измењени истраживачки поступак у оквиру дефинисаног пројекта, а не аутономну контролу над свим деловима развоја модела.

Истраживање [HyperAgents](https://arxiv.org/html/2603.19461) испитује да ли се унапређени поступак за изградњу агената преноси на нову област. После 200 итерација оцењивања из математике, извођење које је почело са пренетим побољшањима добило је 0,640 на тестном скупу, у поређењу са 0,610 код извођења започетог почетним агентом. Аутори наводе да ова разлика није статистички значајна. Резултат оправдава даље истраживање преноса, али не доказује поуздано кумулативно унапређење кроз више извођења.

## Више активности не значи и боље унапређење

Преглед разликује поновну употребу измењеног поступка, коју назива *структурном рекурзијом*, од *ефективне рекурзије*: измењени поступак ствара боље наследнике уз упоредив буџет и независну процену. Други тест је оно на шта драматичан наслов наводи читаоце да помисле да се већ догодило.

Постоји више начина да се активност погрешно протумачи као напредак. Систем може да потроши више рачунарског времена на претрагу, да се превише прилагоди мерилу које је више пута проверавао или да задржи измену која помаже једном задатку, а квари други. Ако мења и сопственог оцењивача, виши резултати могу да одражавају ново мерило. Зато аутори позивају да се забележи шта је измењено, покаже да је измењена компонента стварно усмеравала следећи круг, упореди са старом компонентом уз усклађене ресурсе и испита задржавање и пренос на независним задацима.

Аутори изричито наводе да садашњи резултати подржавају ограничене измене система за унапређивање, оцењивача и истраживачких политика, док „статистички поуздано кумулативно побољшање кроз генерације уз упоредиве ресурсе и даље остаје нерешено“. Израз „последња вештачка интелигенција коју су изградили људи“ описује крајњи циљ који покреће њихов оквир. Преглед поставља критеријуме за процену напретка ка том циљу.

## Извори и додатна литература

- [Duan и сарадници, *Последња вештачка интелигенција коју су изградили људи*, верзија 3](https://arxiv.org/html/2609.11873v3) (22. септембар 2026). Примарни преглед дефинише B0 и нивое 1–5, разликује структурну од ефективне рекурзије и наводи ограничења доказа. Таксономија и тумачења представљају оквир аутора, а не демонстрацију новог система.
- [Zhang и сарадници, *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (верзија 3, 12. март 2026). Првобитна студија наводи побољшање на програмском мерилу и прецизира да систем не мења одржавање архиве нити избор родитељске варијанте.
- [ Shi и сарадници, *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (верзија 3, 8. септембар 2026). Првобитни препринт описује четири круга пост-обуке, ревизију политике и наведени резултат на ранг-листи. Циљ и основни систем радника остају задати споља.
- [Zhang и сарадници, *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). Првобитна студија испитује пренос поступка за изградњу агената и наводи да поређење из овог текста, спроведено током 200 итерација, није статистички значајно.
- [Детаљна анализа Мануела Муњоса Пле](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18. септембар 2026) испитује примере виших нивоа у прегледу и ограничења доказа. Анализира ранију верзију рада; претходни чланак користи верзију 3 и наведене првобитне студије за чињеничне тврдње.
- [Извештај South China Morning Post-а](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14. септембар 2026) описује петостепени план из прегледа и контекст истраживања вештачке интелигенције. Реч је о секундарном извештавању, а не доказима о резултатима студија.
- [Објашњење The Rundown AI-а](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16. септембар 2026) сажима нивое и смешта рад у ширу расправу о аутоматизованом истраживању вештачке интелигенције. То је секундарни извор; чињеничне тврдње поткрепљују рад и првобитне студије.

## Sources

- [Duan и сарадници: Последња вештачка интелигенција коју су изградили људи, верзија 3](https://arxiv.org/html/2609.11873v3) — Примарни преглед нивоа аутономије и примера истраживања. Дефинише структурну и ефективну рекурзију и наводи да статистички поуздано кумулативно побољшање кроз генерације уз упоредиве ресурсе остаје нерешено. Не приказује новостворену аутономну вештачку интелигенцију.
- [Историја предаје рада на arXiv-у за 2609.11873](https://arxiv.org/abs/2609.11873) — Бележи верзију 1 од 10. септембра и верзију 3 од 22. септембра; наводи Ји Дуана и 34 коаутора.
- [Zhang и сарадници: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — Првобитна студија наводи резултат од 20% до 50% на свом подскупу SWE-bench-а и истиче да систем не може да мења одржавање архиве нити избор родитељске варијанте.
- [Shi и сарадници: A-Evolve-Training](https://arxiv.org/html/2606.20657) — Првобитни препринт описује четири аутономна круга пост-обуке, задржану измењену истраживачку политику и резултат 0,86 према 0,87 на ранг-листи у наведеном тренутку поређења. Основни систем радника и циљ су фиксни.
- [Zhang и сарадници: HyperAgents](https://arxiv.org/html/2603.19461) — Првобитна студија наводи поређење преноса после 200 итерација, са резултатима 0,640 према 0,610 на тестном скупу за оцењивање математике; разлика није статистички значајна.
- [Мануел Муњос Пла: детаљно читање рада „Последња вештачка интелигенција коју су изградили људи“](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Независна детаљна анализа раније верзије прегледа. Наведена је ради контекста; чињеничне тврдње овог чланка заснивају се на изворним радовима.
- [South China Morning Post: Кинески истраживачи описују петостепени пут](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Секундарни извештај о прегледу и истраживачком контексту. Служи за даље читање, а не као примарни доказ експерименталних резултата.
- [The Rundown AI: Кинески истраживачи описују вештачку интелигенцију која може да гради своје наследнике](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Секундарно објашњење пет нивоа у раду и шире расправе. Чињеничне тврдње поткрепљују првобитни радови.
Билтен BIG CHANGE

Шира слика. Вашим темпом.

Недавне приче о вештачкој интелигенцији и роботици, промене вредне праћења и практичне идеје за примену. Изаберите дневни преглед, недељни сажетак или месечну перспективу.