AI-translated from English; not yet reviewed by a fluent editor.

# Обзор самоулучшения ИИ показывает разрыв между автоматизацией и созданием более совершенных преемников

> В новом обзоре выделены пять уровней контроля ИИ над собственным совершенствованием. Существующие системы демонстрируют ограниченные улучшения, но надёжное улучшение от поколения к поколению пока не доказано.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

В [обзоре, опубликованном на arXiv 10 сентября и обновлённом 22 сентября](https://arxiv.org/html/2609.11873v3), выделены пять уровней участия ИИ в совершенствовании систем ИИ. Его название — *«Последний ИИ, созданный людьми»* — описывает цель, а не событие, о котором сообщают авторы. Представленные данные охватывают ограниченные примеры систем, которые пересматривают отдельные части собственного процесса разработки. Они не доказывают, что система надёжно создаёт всё более совершенных преемников от поколения к поколению.

Это различие важно при оценке заявлений об автоматизации исследований ИИ. Агент может проводить эксперименты, сохранять полученные уроки и улучшать результат на тесте, хотя люди по-прежнему задают цель, контролируют проверки и решают, какие изменения сохранить. Для более сильного утверждения нужны доказательства, что система улучшила *метод* создания своей следующей версии и что обновлённый метод показал лучший результат в корректном сравнении.

## Главное изменение

- **Что изменилось:** Теперь у исследователей есть более точный способ описать, какую часть цикла совершенствования контролирует система ИИ: от выполнения заданных обновлений до пересмотра процедуры, применяемой при следующих обновлениях. Новый обзор систематизирует существующие работы, а не объявляет о готовом автономном конструкторе преемников.
- **Почему это важно:** Лаборатории ИИ могут автоматизировать больше экспериментов, не доказывая, что каждый новый агент лучше справляется с созданием следующего. Это различие влияет на интерпретацию заявлений о производительности и на то, где сохраняются проверка человеком и независимые испытания.
- **За чем следить:** Решающее доказательство — серия преемников, созданных с помощью унаследованного и пересмотренного метода улучшения и проверенных на закрытых задачах по сравнению со старым методом при сопоставимых ресурсах. Обзорные работы пока не подтверждают статистически надёжного накопления улучшений по этому критерию.

## Пять уровней описывают контроль над циклом улучшения

Сначала авторы отделяют пересмотр решения отдельной задачи, который они называют B0, от устойчивого улучшения. Модель, которая редактирует ответ, пока он не пройдёт проверку, улучшила этот ответ. Если изменение не переносится на последующие независимые задачи, сама система не получила постоянного обновления.

На уровне **1** люди выбирают цель и критерий успеха, а ИИ выполняет обновление, например применяет заданное человеком правило качества данных. На уровне **2** ИИ также выбирает стратегию для поставленной цели — например, выявляет ошибки агента-программиста и предлагает изменить его инструменты. Цель и критерий принятия по-прежнему задаются извне.

На уровне **3** система помогает выбирать, какой опыт ей нужен дальше, например подбирает тренировочные задачи, направленные на обнаруженные слабые места. Уровень **4** добавляет обратную связь от продолжающегося использования: система сохраняет одобренные изменения памяти, правил или компонентов после столкновения с новыми условиями. Авторы считают оба уровня зависимыми от качества обратной связи и правил, определяющих, какие изменения сохраняются.

**Уровень 5** воплощает центральную идею обзора. ИИ пересматривает процедуру, направляющую *последующее* совершенствование, например политику поиска, оценщик или агента, предлагающего преемников. Пересмотренную процедуру необходимо сохранить и применить в следующем цикле. Даже на этом уровне, отмечают авторы, люди могут сохранять контроль над общей целью, защищёнными критериями приёмки и ресурсами. Уровень описывает делегированные полномочия, а не гарантию прогресса или неограниченную автономию.

## Существующие системы показывают границы

В [исследовании Darwin Gödel Machine](https://arxiv.org/html/2505.22954) сообщается, что агент для программирования улучшил результат с 20% до 50% на подмножестве SWE-bench в исследовании: варианты изменяли код агента, а успешные варианты попадали в архив. Авторы также указывают, что обслуживание архива и правило выбора родительского варианта были фиксированными. В обзоре этот пример показывает, почему более успешные потомки сами по себе не доказывают, что процесс их отбора улучшил сам себя.

[Исследование A-Evolve-Training](https://arxiv.org/html/2606.20657) приведён более узкий пример уровня 5. В нём провели четыре цикла постобучения модели с 30 миллиардами параметров. Метаагент свёл результаты и изменил исследовательскую стратегию, которой руководствовались последующие исполнители, после того как внутренняя оценка разработки перестала соответствовать внешнему рейтингу. Согласно исследованию, итоговая оценка составила 0,86 против 0,87 у лучшего на тот момент результата человека. Унаследованная стратегия изменила выбор последующих экспериментов. Базовая система исполнителей и цель соревнования остались фиксированными. Это показывает применение пересмотренной исследовательской процедуры в рамках определённого проекта, а не автономный контроль над всеми этапами разработки модели.

В [исследовании HyperAgents](https://arxiv.org/html/2603.19461) проверяется, переносится ли улучшенная процедура создания агентов на новую область. После 200 итераций на задачах оценки математических решений запуск, начатый с перенесёнными улучшениями, получил 0,640 на тестовом наборе против 0,610 у запуска с исходным агентом. Авторы сообщают, что эта разница не была статистически значимой. Результат оправдывает дальнейшее изучение переноса, но не подтверждает надёжное накопление улучшений от цикла к циклу.

## Больше активности не означает лучшего улучшения

В обзоре различаются повторное использование изменённой процедуры, которое называется *структурной рекурсией*, и *эффективной рекурсией*: изменённая процедура создаёт более сильных преемников при сопоставимых бюджетах и независимой оценке. Именно второй критерий драматичное название подталкивает читателей считать уже достигнутым.

Активность можно принять за прогресс по нескольким причинам. Система может тратить больше вычислительных ресурсов на поиск, переобучиться на тесте, который она многократно проверяла, или сохранить изменение, помогающее одной задаче, но мешающее другой. Если система также меняет собственный оценщик, более высокий балл может быть следствием новой мерки. Поэтому авторы призывают фиксировать, что именно было изменено, показывать, что новый компонент действительно управлял следующим циклом, сравнивать его со старым компонентом при одинаковых ресурсах, а также проверять сохранение результата и его перенос на независимые задачи.

Авторы прямо говорят, что нынешние результаты подтверждают ограниченные изменения механизмов улучшения, оценщиков и исследовательских стратегий, тогда как «статистически надёжное накопление улучшений между поколениями при сопоставимых ресурсах остаётся открытым вопросом». Фраза «последний ИИ, созданный людьми» называет цель, которая вдохновила эту систему критериев. Обзор предлагает критерии для оценки продвижения к ней.

## Источники и материалы для дальнейшего чтения

- [Дуань и соавторы, *«Последний ИИ, созданный людьми»*, версия 3](https://arxiv.org/html/2609.11873v3) (22 сентября 2026 года). В основном обзоре определены уровни B0 и 1–5, проводится различие между структурной и эффективной рекурсией и описаны ограничения имеющихся данных. Таксономия и интерпретации — система взглядов авторов, а не демонстрация новой системы.
- [Чжан и соавторы, *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (версия 3, 12 марта 2026 года). В исходном исследовании сообщается об улучшении результатов на тесте программирования и уточняется, что обслуживание архива и выбор родительского варианта система изменить не может.
- [Ши и соавторы, *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (версия 3, 8 сентября 2026 года). В исходном препринте описаны четыре цикла постобучения, пересмотр стратегии и заявленный результат в рейтинге. Цель и базовая система исполнителей остаются заданными извне.
- [Чжан и соавторы, *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). В исходном исследовании проверяется перенос процедуры создания агента и сообщается, что приведённое здесь сравнение после 200 итераций статистически незначимо.
- [Подробный разбор Мануэля Муньоса Пла](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 сентября 2026 года) рассматривает примеры верхних уровней обзора и ограничения доказательств. В нём анализируется более ранняя версия статьи; в тексте выше для фактических утверждений использованы версия 3 и цитируемые оригинальные исследования.
- [Публикация South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 сентября 2026 года) рассказывает о пятиэтапной дорожной карте обзора и контексте исследований ИИ. Это вторичный материал, а не свидетельство результатов исследований.
- [Объяснение The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 сентября 2026 года) обобщает уровни и помещает статью в контекст дискуссии об автоматизации исследований ИИ. Это вторичный материал; фактические утверждения выше основаны на статье и исходных исследованиях.

## Sources

- [Дуань и соавторы: «Последний ИИ, созданный людьми», версия 3](https://arxiv.org/html/2609.11873v3) — Основной обзор уровней автономии и примеров из исследований. Определяет структурную и эффективную рекурсию и указывает, что статистически надёжное накопление улучшений от поколения к поколению при сопоставимых ресурсах остаётся открытым вопросом. Не демонстрирует создание нового автономного ИИ.
- [История публикации arXiv для статьи 2609.11873](https://arxiv.org/abs/2609.11873) — Фиксирует первую версию от 10 сентября и третью версию от 22 сентября; среди авторов указаны И Дуань и 34 соавтора.
- [Чжан и соавторы: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — В исходном исследовании сообщается об улучшении с 20% до 50% на подмножестве SWE-bench; указано, что система не может менять обслуживание архива и выбор родительского варианта.
- [Ши и соавторы: A-Evolve-Training](https://arxiv.org/html/2606.20657) — В исходном препринте описаны четыре цикла постобучения, сохранение пересмотренной исследовательской стратегии и результат в рейтинге — 0,86 против 0,87 на указанную дату сравнения. Базовая система исполнителей и цель зафиксированы.
- [Чжан и соавторы: HyperAgents](https://arxiv.org/html/2603.19461) — В исходном исследовании приводится сравнение переноса после 200 итераций на тесте оценки математических решений: 0,640 против 0,610; различие статистически незначимо.
- [Мануэль Муньос Пла: подробный разбор «Последнего ИИ, созданного людьми»](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Независимый подробный разбор более ранней версии обзора. Приведён для контекста; фактические утверждения о результатах исследований в этой статье опираются на оригинальные работы.
- [South China Morning Post: китайские исследователи описали пятиэтапный путь](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Вторичный материал об этом обзоре и контексте исследований. Приведён для дальнейшего чтения, а не как основной источник экспериментальных результатов.
- [The Rundown AI: китайские исследователи описали ИИ, способный создавать собственных преемников](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Вторичное объяснение пяти уровней статьи и более широкой дискуссии. Фактические утверждения о исследованиях подтверждаются оригинальными работами.
