LE MONDE NE S’ARRÊTE PAS.RSS
BIG CHANGE.

Édition Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Une étude sur l’auto-amélioration de l’IA cartographie l’écart entre l’automatisation et de meilleurs successeurs

> Une nouvelle étude distingue cinq niveaux de contrôle de l’IA sur sa propre amélioration. Les systèmes existants montrent des progrès circonscrits, mais l’amélioration fiable d’une génération à l’autre reste à démontrer.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Une [étude publiée sur arXiv le 10 septembre et révisée le 22 septembre](https://arxiv.org/html/2609.11873v3) décrit cinq niveaux de participation de l’IA à l’amélioration des systèmes d’IA. Son titre, *The Last AI Built by Humans*, exprime une ambition, et non un événement rapporté par les auteurs. Les éléments présentés portent sur des exemples circonscrits où des systèmes révisent certaines parties de leur propre processus de développement. Ils ne démontrent pas qu’un système produise de façon fiable des successeurs toujours plus performants, génération après génération.

Cette distinction est importante pour interpréter les affirmations sur la recherche automatisée en IA. Un agent peut exécuter des expériences, conserver les leçons apprises et améliorer un score de référence tandis que des personnes définissent toujours son objectif, contrôlent les tests et décident quelles modifications sont retenues. Pour étayer l’affirmation plus forte, il faut montrer que le système a amélioré la *méthode* qui produit sa version suivante et que cette méthode révisée a donné de meilleurs résultats lors d’une comparaison équitable.

## Le grand changement

- **Ce qui change :** Les chercheurs disposent désormais d’un cadre plus précis pour décrire la part de la boucle d’amélioration contrôlée par un système d’IA, de l’application de mises à jour prescrites jusqu’à la révision de la procédure qui guidera les mises à jour suivantes. Cette nouvelle étude organise les travaux existants ; elle n’annonce pas un système autonome achevé de création de successeurs.
- **Pourquoi c’est important :** Les laboratoires d’IA peuvent automatiser davantage d’expériences sans démontrer que chaque nouvel agent est plus performant pour en créer un autre. Cette différence compte pour interpréter les affirmations de performance et déterminer où maintenir la supervision humaine et des tests indépendants.
- **À surveiller :** La preuve décisive serait une suite de successeurs créés à l’aide d’une méthode d’amélioration révisée et héritée, puis testés sur des tâches protégées, avec des ressources comparables, face à l’ancienne méthode. Les travaux recensés n’ont pas encore établi, selon ces critères, une accumulation statistiquement fiable des progrès.

## Cinq niveaux décrivent le contrôle de la boucle d’amélioration

L’article distingue d’abord la révision d’une tâche ponctuelle, nommée B0, de l’amélioration persistante. Un modèle qui modifie une réponse jusqu’à ce qu’elle satisfasse un contrôle a amélioré cette réponse. Si la modification ne se répercute pas sur des tâches ultérieures et indépendantes, le système n’a pas lui-même acquis de mise à jour durable.

Au **niveau 1**, les personnes choisissent l’objectif et le critère de réussite ; l’IA exécute une mise à jour, par exemple en appliquant une règle de qualité des données définie par des humains. Au **niveau 2**, l’IA choisit aussi une stratégie pour atteindre l’objectif assigné, par exemple en diagnostiquant les échecs d’un agent de programmation et en proposant des modifications à ses outils. L’objectif et le critère d’acceptation restent définis de l’extérieur du système.

Au **niveau 3**, le système contribue à choisir l’expérience dont il a besoin ensuite, par exemple en proposant des exercices ciblant les faiblesses qu’il a repérées. Au **niveau 4**, il intègre les retours tirés de l’usage continu : après avoir rencontré de nouvelles conditions, le système conserve les modifications approuvées apportées à sa mémoire, à ses règles ou à ses composants. L’article considère que ces deux niveaux dépendent de la qualité des retours et des règles qui déterminent quelles modifications sont conservées.

**Le niveau 5** atteint l’idée centrale de l’étude. L’IA révise une procédure qui oriente l’*amélioration ultérieure*, par exemple sa politique de recherche, son évaluateur ou l’agent qui propose des successeurs. La procédure révisée doit être conservée puis utilisée lors d’une nouvelle itération. Même à ce niveau, les auteurs précisent que les personnes peuvent garder le contrôle de l’objectif général, des tests d’acceptation protégés et des ressources. Un niveau décrit la responsabilité déléguée, et non une garantie de progrès ni une autonomie sans limites.

## Les systèmes existants illustrent cette frontière

L’[étude Darwin Gödel Machine](https://arxiv.org/html/2505.22954) rapporte que son agent de programmation a progressé de 20 % à 50 % sur un sous-ensemble de SWE-bench, alors que les variantes modifiaient le code de l’agent et que les variantes retenues étaient ajoutées à une archive. Les auteurs indiquent aussi que la maintenance de l’archive et la règle de sélection de la variante qui devient parent étaient fixes. L’étude citée montre ainsi pourquoi de meilleurs descendants ne prouvent pas, à eux seuls, que le processus qui les sélectionne s’est amélioré.

[A-Evolve-Training](https://arxiv.org/html/2606.20657) fournit un exemple plus circonscrit de niveau 5. L’étude a effectué quatre cycles de post-entraînement sur un modèle de 30 milliards de paramètres. Un méta-agent a rassemblé les résultats et modifié la politique de recherche qui guidait les agents suivants, après qu’un score interne de développement a cessé de suivre un classement externe. Le score final rapporté est de 0,86, contre 0,87 pour la meilleure soumission d’un participant humain à l’époque. La politique héritée a modifié la manière de choisir les expériences ultérieures. Le système sous-jacent des agents et l’objectif de la compétition sont restés fixes. Cela montre une procédure de recherche révisée à l’œuvre dans un projet défini, et non un contrôle autonome de toutes les étapes du développement d’un modèle.

L’[étude HyperAgents](https://arxiv.org/html/2603.19461) vérifie si une procédure améliorée de création d’agents peut être transférée à un nouveau domaine. Après 200 itérations consacrées à la notation de travaux de mathématiques, un essai partant des améliorations transférées a obtenu 0,640 sur son jeu de test, contre 0,610 pour un essai partant de son agent initial. Les auteurs précisent que cette différence n’était pas statistiquement significative. Le résultat justifie d’étudier le transfert, mais ne démontre pas une accumulation fiable des progrès d’un essai à l’autre.

## Une activité accrue ne prouve pas une meilleure amélioration

L’étude distingue la réutilisation d’une procédure révisée, qu’elle appelle *récursion structurelle*, de la *récursion effective* : dans ce second cas, la procédure révisée produit de meilleurs successeurs avec des budgets comparables et une évaluation indépendante. C’est ce second critère que le titre spectaculaire invite les lecteurs à croire déjà satisfait.

Plusieurs phénomènes peuvent faire passer l’activité pour du progrès. Un système peut consacrer davantage de puissance de calcul à la recherche, surajuster un test de référence qu’il a consulté à plusieurs reprises, ou conserver une modification utile pour une tâche mais nuisible à une autre. S’il modifie aussi son propre évaluateur, la hausse des scores peut simplement refléter un changement de mesure. L’article préconise donc de consigner les éléments révisés, de montrer que le composant modifié a effectivement guidé l’itération suivante, de le comparer à l’ancien avec des ressources équivalentes, puis de tester sa persistance et son transfert sur des tâches indépendantes.

Les auteurs indiquent explicitement que les résultats actuels étayent des changements circonscrits aux systèmes d’amélioration, aux évaluateurs et aux politiques de recherche, tandis que « l’accumulation statistiquement fiable d’une génération à l’autre, avec des ressources comparables, reste une question ouverte ». L’expression « la dernière IA construite par des humains » désigne l’objectif qui motive leur cadre. L’étude propose des critères pour évaluer les progrès vers cet objectif.

## Sources et lectures complémentaires

- [Duan et al., *The Last AI Built by Humans*, version 3](https://arxiv.org/html/2609.11873v3) (22 septembre 2026). Cette étude de référence définit B0 et les niveaux 1 à 5, distingue récursion structurelle et récursion effective, et précise les limites des éléments disponibles. Sa taxonomie et ses interprétations constituent le cadre des auteurs ; il ne s’agit pas de la démonstration d’un nouveau système.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (version 3, 12 mars 2026). L’étude d’origine rapporte des progrès sur un test de programmation et précise que la maintenance de l’archive et le choix du parent restent fixes.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (version 3, 8 septembre 2026). La prépublication d’origine décrit quatre cycles de post-entraînement, la révision d’une politique et le résultat obtenu dans le classement cité. L’objectif et le système sous-jacent des agents restent définis de l’extérieur.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). L’étude d’origine teste le transfert d’une procédure de création d’agents et indique que la comparaison sur 200 itérations citée ici n’est pas statistiquement significative.
- [Lecture détaillée de Manuel Muñoz Plá](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18 septembre 2026) consacrée aux exemples de niveau supérieur de l’étude et aux limites des éléments disponibles. Elle analyse une version antérieure de l’article ; le texte ci-dessus s’appuie sur la version 3 et les études originales citées pour ses affirmations factuelles.
- [Article du South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14 septembre 2026) sur la feuille de route en cinq étapes de l’étude et le contexte de la recherche en IA. Il s’agit d’une couverture secondaire, et non d’une preuve des résultats des études.
- [Explication de The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16 septembre 2026) qui résume les niveaux et replace l’article dans le débat sur la recherche automatisée en IA. Il s’agit d’une couverture secondaire ; les articles de recherche et les études originales étayent les affirmations factuelles ci-dessus.

## Sources

- [Duan et al. : The Last AI Built by Humans, version 3](https://arxiv.org/html/2609.11873v3) — Étude de référence sur les niveaux d’autonomie et les exemples de recherche. Elle définit la différence entre récursion structurelle et récursion effective et indique que l’accumulation statistiquement fiable d’une génération à l’autre, avec des ressources comparables, reste une question ouverte. Elle ne démontre pas la création récente d’une IA autonome.
- [Historique des versions arXiv pour 2609.11873](https://arxiv.org/abs/2609.11873) — Enregistre la version 1 du 10 septembre et la version 3 du 22 septembre ; indique Yi Duan et 34 coauteurs.
- [Zhang et al. : Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — L’étude d’origine rapporte un score passé de 20 % à 50 % sur son sous-ensemble SWE-bench et précise que le système ne peut pas modifier la maintenance de l’archive ni la sélection du parent.
- [Shi et al. : A-Evolve-Training](https://arxiv.org/html/2606.20657) — La prépublication d’origine décrit quatre cycles autonomes de post-entraînement, une politique de recherche révisée et conservée, et un score de classement de 0,86 contre 0,87 à la date de comparaison indiquée. Le système sous-jacent des agents et l’objectif restent fixes.
- [Zhang et al. : HyperAgents](https://arxiv.org/html/2603.19461) — L’étude d’origine rapporte une comparaison du transfert sur 200 itérations : 0,640 contre 0,610 sur un jeu de test de notation de travaux de mathématiques ; la différence n’est pas statistiquement significative.
- [Manuel Muñoz Plá : « The last AI built by humans, read in depth »](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Analyse indépendante détaillée d’une version antérieure de l’étude. Incluse pour le contexte ; les articles de recherche originaux étayent les affirmations de recherche de cet article.
- [South China Morning Post : « Chinese researchers chart 5-stage path »](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Article secondaire sur cette étude et le contexte de recherche. Il s’agit d’une lecture complémentaire, et non d’une source primaire pour les résultats expérimentaux.
- [The Rundown AI : « Chinese researchers outline AI that can build its successors »](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Explication secondaire des cinq niveaux de l’article et du débat plus large. Les articles de recherche originaux étayent les affirmations factuelles de cet article.
La newsletter BIG CHANGE

Prendre du recul, à votre rythme.

Articles récents sur l’IA et la robotique, évolutions à surveiller et idées pratiques à utiliser. Choisissez un briefing quotidien, une synthèse hebdomadaire ou une analyse mensuelle.