LE MONDE NE S’ARRÊTE PAS.RSS
BIG CHANGE.

Édition Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Les agents de codage IA ont accru la production de code dans une étude en entreprise, tandis que le travail achevé a pris du retard

> Un document de travail de Harvard associe l’adoption d’agents de codage dans 718 entreprises à davantage de code et à des revues de demandes de fusion plus longues, sans hausse significative du travail résolu.

By BIG CHANGE Editorial

Published: 2026-10-10T00:19:01.727Z
Updated: 2026-10-10T00:19:01.727Z
Canonical: https://bigchange.ai/blog/ai-coding-agents-review-output-study

![Two colleagues discuss a software change beside a monitor turned away from view.](https://bigchange.ai/api/media/file/hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE

Un [document de travail de Harvard](https://fion.ac/jellyfish.pdf) propose un examen utile d’une affirmation courante sur la productivité : écrire davantage de code avec l’IA devrait signifier livrer davantage de logiciels. Dans 718 entreprises utilisant la plateforme d’analyse technique Jellyfish, Fiona Chen et James Stratton estiment que l’adoption d’agents de codage a été suivie de 30 % de lignes de code supplémentaires, de 20 % de commits supplémentaires et de 23 % de demandes de fusion supplémentaires par employé actif. Leurs mesures des tickets Jira et des épopées achevés n’ont pas montré de hausse statistiquement significative. La version actuelle de l’article est datée du 4 août 2026 ; les données sur les événements de travail s’arrêtent en mars 2026.

Cet écart compte pour les responsables techniques, car une demande de fusion entre dans une file d’attente pour la revue, les tests et d’éventuelles révisions. Dans la même étude, le délai entre la soumission d’une demande de fusion et sa fusion a augmenté d’environ 49 % après l’adoption des agents. Les demandes de modifications sont devenues plus fréquentes et le nombre de commentaires par demande de fusion a augmenté. Ces résultats indiquent une charge de revue plus lourde, sans montrer que chaque modification écrite par un agent est mauvaise ni établir un taux mesuré de défauts.

## Le grand changement

- **Ce qui a changé :** Dans cette étude au niveau des entreprises, l’adoption d’agents de codage a coïncidé avec une activité de codage nettement accrue et des revues de demandes de fusion plus exigeantes, sans hausse statistiquement significative des tickets résolus ni des épopées.
- **Pourquoi c’est important :** Les lignes de code, les commits et les demandes de fusion mesurent le travail qui entre dans le processus de production. Le travail résolu est une mesure ultérieure. Une équipe qui évalue les agents uniquement au volume de code risque de manquer la charge qui arrive en revue.
- **À suivre :** La capacité des entreprises à accroître leur capacité de revue et l’apparition éventuelle de gains dans le travail achevé à mesure que de nouvelles données seront disponibles. Cet article de travail suit les premières adoptions jusqu’en mars 2026 et ne permet pas de trancher les effets à plus long terme.

## Assistants et agents ont produit des estimations différentes

Les auteurs distinguent les *assistants*, qui proposent du code au fil du travail du développeur, des *agents*, qui peuvent prendre en charge une tâche de plus haut niveau et en exécuter plusieurs étapes avant que le développeur n’approuve le résultat. Ils mesurent l’adoption des assistants à partir de l’activation de licences professionnelles GitHub Copilot et Cursor. Pour les agents, ils combinent les données d’utilisation de Claude Code avec des indices tels que les comptes de bots et les signatures d’outils dans les commits ou les demandes de fusion. Certains usages individuels ou outils non intégrés peuvent échapper à ces mesures. L’estimation des agents représente l’association supplémentaire autour de leur adoption par rapport à la période antérieure d’adoption des assistants ; elle ne s’applique pas à chaque personne qui utilise un agent.

Les résultats des assistants étaient plus modestes : une hausse estimée de 12 % des lignes de code, de 9 % des commits et de 5 % des demandes de fusion. Seul le résultat concernant les commits était statistiquement significatif dans les estimations principales de l’article. L’adoption des agents a entraîné des hausses significatives pour les trois mesures d’activité de codage. Un commit consigne une mise à jour du code ; une demande de fusion soumet une modification à la revue. Aucun des deux ne prouve qu’une fonctionnalité est parvenue aux utilisateurs. L’article utilise les tickets Jira résolus et les épopées plus importantes comme mesures de production à un stade ultérieur, selon le processus suivi dans lequel les équipes marquent le travail comme terminé après revue, tests et déploiement. Le statut Jira reste un indicateur indirect de livraison, et non une mesure indépendante de ce que les utilisateurs ont reçu.

Pour les agents, la hausse estimée des tickets résolus était de 0,12 par employé et par mois, pour une référence de 3,67, avec une erreur-type de 0,17. Le résultat ne se distingue pas statistiquement de zéro. L’achèvement des épopées n’a pas non plus connu de changement significatif. Les auteurs indiquent que leur intervalle de confiance exclut une hausse de plus de 12 % de la moyenne de référence pour les tickets achevés pendant la période étudiée. Cette conclusion est plus limitée que l’affirmation selon laquelle les agents ne produisent aucun logiciel utile : des gains modestes restent possibles, et le nombre de tickets ne peut saisir tous les changements de valeur ou de qualité. Les auteurs ont vérifié si la taille des tickets avait changé à l’aide de mesures prédites de durée des tâches et n’ont trouvé aucun indice de ce changement dans leur échantillon.

## Davantage de travail est arrivé chez les personnes chargées de la revue

Les mesures de revue offrent un mécanisme plausible pour expliquer l’écart de production. Après l’adoption des agents, l’article estime à 3,45 jours supplémentaires le délai entre la soumission et la fusion d’une demande, par rapport à une référence de 7,03 jours, soit une hausse de 49 %. Il s’agit du temps calendaire dans le processus de revue, et non d’une mesure chronométrée des minutes de revue active d’une personne. La part des demandes de fusion faisant l’objet d’une demande formelle de modifications a augmenté d’environ 12 points de pourcentage par rapport à une référence de 13 %, tandis que les commentaires par demande ont augmenté de 0,58 par rapport à une référence de 1,66, soit 35 %. La part des employés ayant revu au moins une demande de fusion dans un mois a augmenté d’environ quatre points de pourcentage par rapport à une référence de 29 %, soit une hausse relative de 14 %. Les estimations comparables pour les assistants n’ont pas montré de hausse significative de la durée de revue, des demandes de modifications ou des commentaires.

À partir de ces seules métadonnées, l’article ne peut expliquer pourquoi une personne chargée de la revue a demandé des modifications. Un plus grand nombre de soumissions peut mettre à rude épreuve une file d’attente de revue de taille fixe ; une évolution de la qualité du code ou des normes de revue peut aussi accroître l’examen. Les auteurs n’ont trouvé aucune hausse significative de la taille moyenne des demandes de fusion, ce qui affaiblit une explication simple de l’augmentation des commentaires. Ils n’ont pas examiné le contenu du code ni compté directement les défauts du travail généré par des agents. Leur modèle de production en deux étapes explique comment une écriture de code plus rapide et une variation du travail de revue requis pour chaque brouillon pourraient ensemble limiter la production achevée. Le modèle interprète les observations ; il ne s’agit pas d’un test distinct isolant l’un ou l’autre mécanisme.

Les outils de revue par IA s’étaient également répandus dans l’échantillon : près de 80 % des entreprises en avaient utilisé un en mars 2026. Pourtant, l’article attribue 23,3 % des commentaires de revue à l’IA et relève au moins un commentaire d’IA sur 10,8 % des demandes de fusion. L’adoption d’un outil de revue ne signifie donc pas que la revue est devenue automatique dans ces entreprises.

## Ce que la méthode permet d’établir

Les chercheurs analysent environ 300 millions d’événements de travail de janvier 2021 à mars 2026 dans 718 entreprises clientes consentantes de Jellyfish, représentant 725 938 employés. Ils comparent les résultats avant et après l’adoption d’assistants ou d’agents avec ceux d’entreprises ayant adopté ces outils plus tard ou ne les ayant pas encore adoptés, au moyen d’une méthode de différences de différences échelonnée. Des contrôles par entreprise et par mois civil prennent en compte certaines différences stables et tendances temporelles communes. L’inférence dépend toujours de la comparabilité des trajectoires qu’auraient suivies ces entreprises sans adoption. Les grandes entreprises ont adopté les outils plus tôt, et des changements non mesurés ont pu influer à la fois sur l’adoption et sur le travail d’ingénierie. L’étude est observationnelle ; ses estimations ne doivent pas être interprétées comme un test randomisé ni comme une prévision pour toutes les équipes logicielles.

Le résultat sur l’emploi exige la même prudence. À partir de l’emploi total associé à LinkedIn et des employés actifs de Jellyfish pour l’emploi technique, les auteurs n’ont pas pu attribuer de changement significatif à l’adoption d’agents pendant la période observée. Cela ne montre pas ce qu’il adviendra du recrutement après un ajustement plus long ni sur l’ensemble du marché du travail.

[Un précédent article de BIG CHANGE](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) étudiait un récit distinct sur l’ingénierie, le codage par IA et la fiabilité des livraisons. Cette étude élargit la perspective à plusieurs entreprises et distingue les mesures d’activité de codage, de revue et de travail résolu. Sa leçon pratique est de suivre ces étapes ensemble lorsqu’on évalue les agents : un premier brouillon plus rapide modifie la quantité de travail en attente en aval, et cet article ne montre pas encore de hausse correspondante des tickets ou projets achevés.

## Sources et lectures complémentaires

- [Fiona Chen et James Stratton, *Artificial Intelligence in the Firm: Bottlenecks in Software Production*](https://fion.ac/jellyfish.pdf) : document de travail principal, version actuelle du 4 août 2026. Les méthodes, figures et annexes étayent les estimations rapportées et leurs limites ; les données sous-jacentes au niveau des entreprises sont propriétaires et agrégées.
- [Le reportage d’Ars Technica du 9 octobre](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/) : compte rendu indépendant et contemporain qui a attiré l’attention sur l’article. Les affirmations numériques et méthodologiques ci-dessus ont été vérifiées à partir de l’article lui-même.
- [L’article antérieur de BIG CHANGE sur le codage par IA et l’intégration continue](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) : couverture connexe d’un récit distinct sur l’ingénierie. Il fournit un contexte à la question de la livraison, sans constituer une suite de cette étude.

## Sources

- [Artificial Intelligence in the Firm: Bottlenecks in Software Production](https://fion.ac/jellyfish.pdf) — Document de travail principal de 78 pages pour le marché de l’emploi de Harvard ; événements de travail jusqu’en mars 2026, méthodes et estimations numériques. Les données propriétaires sont agrégées et anonymisées.
- [Ars Technica : AI coding agents generate more code, but not more software](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/) — Compte rendu indépendant et contemporain ; découverte et contexte, les affirmations de l’étude ayant été vérifiées à partir de l’article.
- [BIG CHANGE : AI coding makes dependable delivery the next engineering challenge](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) — Article antérieur de BIG CHANGE sur un récit distinct de l’ingénierie Linear concernant le codage par IA et la fiabilité des livraisons.