Anthropic indique que Claude réalise désormais 26 % des travaux de recherche et développement en IA qu’elle mesure au sein de l’entreprise, au niveau « l’IA dirige ». Cela signifie qu’un système peut accomplir la majeure partie d’une tâche à partir d’une consigne générale, sous la supervision d’une personne. Anthropic précise également qu’aucun travail de R&D qu’elle mesure n’est entièrement autonome. Cette distinction compte pour un nouveau document de travail du Cambridge Programme on AI Science & Policy, qui demande si une part croissante de la R&D réalisée par l’IA pourrait, à terme, accélérer fortement les progrès de l’IA.

Daté de septembre 2026, l’article rassemble 22 auteurs issus d’universités, d’entreprises d’IA et de la société civile. Il soutient qu’une boucle de rétroaction rapide est possible : des systèmes performants contribuent à créer de meilleurs systèmes, qui mènent ensuite davantage de recherches. Sa conclusion centrale est un avertissement sur une trajectoire plausible et la nécessité de la mesurer. L’article ne dit pas qu’une telle accélération a commencé.

Le grand changement

  • Ce qui change : Un document de travail interinstitutionnel expose les données relatives à la R&D menée par l’IA, les conditions dans lesquelles elle pourrait accélérer les progrès de l’IA, et les mesures précises qu’il demande aux gouvernements de recueillir auprès des laboratoires de pointe.
  • Pourquoi c’est important : Les entreprises qui développent des systèmes d’IA leur délèguent davantage de tâches de recherche. Les indicateurs publics de cette délégation restent partiels, ce qui complique l’évaluation de l’accélération réelle du processus de recherche dans son ensemble.
  • À suivre : Des mesures vérifiées de façon indépendante indiquant quelle part du travail l’IA accomplit, si ses contributions améliorent les modèles suivants, et si les capacités de calcul, les expériences et l’examen humain ralentissent la boucle de rétroaction.

Les données sont réelles, mais les indicateurs ne répondent pas aux mêmes questions

Le rapport de mesure d’Anthropic de septembre indique que la part de ses travaux de R&D relevant du niveau « l’IA dirige » a atteint 26 % en août 2026, contre moins de 1 % en février. Son échelle de notation prévoit toujours un superviseur humain dans cette catégorie. Anthropic précise que cet indice est un prototype, que ses propres modèles contribuent à évaluer les travaux et qu’il n’existe pas de méthode commune permettant de comparer de tels chiffres entre entreprises. Il faut mettre son affirmation selon laquelle aucune des tâches mesurées n’est entièrement autonome en regard du chiffre de 26 %.

Le compte rendu d’OpenAI publié en septembre décrit des chercheurs qui utilisent davantage d’agents de codage, contribuent du code plus rapidement et réalisent davantage d’expériences. OpenAI indique que le volume d’expériences est corrélé à l’utilisation accrue d’agents, tandis que les capacités de calcul disponibles ont également augmenté. Selon l’entreprise, les personnes continuent de choisir les priorités de recherche et de décider quels résultats poursuivre. Une hausse du code et des expériences peut aider la recherche sans prouver une augmentation équivalente du rythme de production de modèles plus performants.

Les évaluations indépendantes mesurent une partie du processus. La mise à jour Time Horizon 1.1 de METR constate que, dans sa suite de tests, les modèles accomplissent des tâches de recherche et de développement logiciel plus longues que les systèmes antérieurs. METR fait aussi état d’une grande incertitude pour les tâches longues, dont beaucoup ont été estimées à partir du temps qu’aurait mis une personne. Un benchmark mesure les capacités sur les tâches qu’il sélectionne ; il ne mesure pas la productivité totale de la recherche d’un laboratoire d’IA. Dans une autre étude randomisée portant sur 16 développeurs expérimentés de logiciels libres et 246 tâches, METR a constaté que l’accès à des outils d’IA du début de 2025 augmentait la durée d’exécution de 19 %. Ce contexte logiciel plus ancien ne représente pas un laboratoire de pointe en septembre 2026, mais il montre pourquoi l’utilisation d’outils et les benchmarks de tâches ne suffisent pas à trancher la question de la productivité.

Une éventuelle boucle de rétroaction a plusieurs freins

L’article CASP se concentre sur une boucle pilotée par le logiciel. Les systèmes d’IA augmenteraient les capacités de recherche disponibles en réalisant des tâches en parallèle. Les améliorations obtenues rendraient les systèmes suivants meilleurs, ce qui permettrait d’autres améliorations. Les auteurs estiment que les premiers éléments concordent avec ce mécanisme et jugent probable une automatisation importante de la R&D d’ici quelques années. L’hypothèse plus forte d’une « explosion de l’intelligence », qui condenserait des années de progrès en quelques mois ou moins, suppose que la boucle dépasse ses contraintes. Il s’agit d’un scénario conditionnel, pas d’une prévision mesurée.

L’article nomme quatre contraintes importantes : les rendements décroissants des efforts de recherche supplémentaires, les limites de calcul et de données, les tâches qui restent difficiles à automatiser, et les processus tels que les longs entraînements qui ne peuvent pas être accélérés à volonté. Il précise que les données sur certains de ces facteurs sont mixtes ou indirectes et qu’il manque des données directes sur l’importance des goulots d’étranglement liés au temps. Son exemple d’une accélération par dix en environ 1,5 an est le résultat d’un modèle qui suppose une automatisation complète de la R&D, la persistance des rendements estimés de l’effort de recherche et l’absence de nouvel obstacle. Il ne s’agit ni d’une accélération observée ni d’une échéance inconditionnelle.

D’autres travaux précisent les incertitudes. Dans une étude de 2025 menée auprès de quatre laboratoires d’IA, Parker Whitfill et Cheryl Wu obtiennent des conclusions différentes selon leur modélisation des capacités de calcul affectées à la recherche. Dans un modèle, le travail cognitif et le calcul semblent substituables ; dans un autre, qui tient compte des besoins croissants des expériences de pointe, ils semblent complémentaires. Les auteurs soulignent les limites des données et du modèle. L’analyse de Toby Ord publiée en août 2026 identifie le temps nécessaire à chaque cycle d’amélioration comme un autre paramètre essentiel. Ces analyses n’excluent pas une accélération rapide ; elles montrent que la vitesse de la boucle ne se déduit pas directement du nombre d’agents ni du volume de code écrit.

Ce que les auteurs demandent de mesurer

Les auteurs de Cambridge proposent trois priorités d’action : mieux connaître le degré d’automatisation de la R&D en IA, trouver des moyens d’orienter et de limiter une éventuelle accélération, et se préparer à ses effets potentiels. La mesure est la priorité la plus immédiate et la plus vérifiable. Ils suggèrent de déclarer la part des contributions de recherche produites par l’IA, le rythme des progrès algorithmiques, la répartition des dépenses des laboratoires entre personnel et calcul, les décisions de recherche influencées par les systèmes d’IA et les incidents impliquant des agents internes. Ils proposent aussi des audits indépendants, assortis d’exigences plus strictes pour les systèmes à la pointe des capacités de R&D en IA.

Certaines propositions ultérieures, notamment des exigences préalables à de nouveaux déploiements, des moyens de suspendre certains travaux de R&D et une vérification internationale, nécessiteraient une conception approfondie et des compromis importants. L’article avertit lui-même que des pouvoirs mal conçus pourraient avantager une entreprise et retarder des travaux bénéfiques. Les bénéfices potentiels et les préjudices graves qu’il décrit reposent sur l’hypothèse conditionnelle d’une accélération présentée plus haut. Les responsables politiques peuvent examiner l’intérêt d’une transparence à court terme sans supposer que le scénario le plus extrême s’est produit.

La question utile après la publication de ce rapport est plus restreinte que de savoir si l’IA deviendra soudainement superintelligente. Les laboratoires peuvent-ils montrer, au moyen de données comparables, quelles parties de la recherche sont désormais dirigées par l’IA, quelles améliorations résistent à l’évaluation humaine et à quelle vitesse elles alimentent la génération suivante de systèmes ? Les informations publiques ne suffisent pas encore à répondre à cette question pour l’ensemble des entreprises.

Sources et lectures complémentaires