DIE WELT BLEIBT NICHT STEHEN.RSS
BIG CHANGE.

Markdown-Ausgabe

AI-translated from English; not yet reviewed by a fluent editor.

# KI-Coding-Agenten steigerten die Code-Ausgabe in einer Unternehmensstudie, während die abgeschlossene Arbeit zurückblieb

> Ein Harvard-Arbeitspapier bringt den Einsatz von Coding-Agenten in 718 Unternehmen mit mehr Code und längeren Pull-Request-Prüfungen in Verbindung, ohne einen signifikanten Anstieg erledigter Arbeit.

By BIG CHANGE Editorial

Published: 2026-10-10T00:19:01.727Z
Updated: 2026-10-10T00:19:01.727Z
Canonical: https://bigchange.ai/blog/ai-coding-agents-review-output-study

![Two colleagues discuss a software change beside a monitor turned away from view.](https://bigchange.ai/api/media/file/hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE

Ein [Harvard-Arbeitspapier](https://fion.ac/jellyfish.pdf) bietet eine nützliche Prüfung einer verbreiteten Produktivitätsbehauptung: Mehr mit KI geschriebener Code sollte mehr ausgelieferte Software bedeuten. Für 718 Unternehmen, die die Engineering-Analyseplattform Jellyfish nutzen, schätzen Fiona Chen und James Stratton, dass nach der Einführung von Coding-Agenten die Codezeilen pro aktivem Beschäftigten um 30 %, Commits um 20 % und Pull Requests um 23 % zunahmen. Ihre Kennzahlen für erledigte Jira-Issues und Epics zeigten keinen statistisch signifikanten Anstieg. Die aktuelle Fassung des Papiers ist auf den 4. August 2026 datiert; die Daten zu Arbeitsereignissen reichen bis März 2026.

Die Diskrepanz ist für Engineering-Verantwortliche relevant, weil ein Pull Request in eine Warteschlange für Prüfung, Tests und mögliche Überarbeitung gelangt. In derselben Studie stieg die Zeit von der Einreichung bis zum Merge eines Pull Requests nach Einführung der Agenten laut Schätzung um 49 %. Änderungswünsche wurden häufiger, und die Zahl der Kommentare pro Pull Request nahm zu. Diese Ergebnisse deuten auf mehr Prüfaufwand hin, zeigen aber weder, dass jede von Agenten verfasste Änderung mangelhaft ist, noch messen sie eine Fehlerquote.

## Die große Veränderung

- **Was sich verändert hat:** In dieser Studie auf Unternehmensebene ging die Einführung von Coding-Agenten mit deutlich mehr Coding-Aktivität und anspruchsvolleren Pull-Request-Prüfungen einher, jedoch ohne statistisch signifikanten Anstieg erledigter Issues oder Epics.
- **Warum das wichtig ist:** Zeilen, Commits und Pull Requests messen Arbeit, die in den Produktionsprozess gelangt. Erledigte Arbeit ist eine spätere Kennzahl. Ein Team, das Agenten allein anhand des Codevolumens bewertet, könnte den Prüfaufwand übersehen, der dadurch entsteht.
- **Worauf zu achten ist:** Ob Unternehmen ihre Prüfungskapazität erhöhen können und ob spätere Daten Zuwächse bei erledigter Arbeit zeigen. Dieses Arbeitspapier verfolgt die frühe Einführung bis März 2026 und kann längerfristige Auswirkungen nicht abschließend beurteilen.

## Assistenten und Agenten ergaben unterschiedliche Schätzungen

Die Autoren unterscheiden *Assistenten*, die während der Arbeit eines Entwicklers Codevorschläge liefern, von *Agenten*, die eine übergeordnete Aufgabe übernehmen und mehrere Schritte ausführen können, bevor ein Entwickler das Ergebnis genehmigt. Die Einführung von Assistenten messen sie anhand der Aktivierung von Geschäftslizenzen für GitHub Copilot und Cursor. Bei Agenten kombinieren sie Nutzungsdaten von Claude Code mit Signalen wie Bot-Konten und Tool-Signaturen in Commits oder Pull Requests. Einzelne Nutzungen oder nicht integrierte Tools werden von diesen Messungen möglicherweise nicht erfasst. Die Agentenschätzung ist der zusätzliche Zusammenhang rund um die Einführung von Agenten gegenüber der früheren Phase der Assistentennutzung; sie ist keine Schätzung für jede einzelne Person, die einen Agenten verwendet.

Die Ergebnisse für Assistenten fielen geringer aus: geschätzt wurden 12 % mehr Zeilen, 9 % mehr Commits und 5 % mehr Pull Requests. In den Hauptschätzungen des Papiers war nur das Ergebnis für Commits statistisch signifikant. Die Einführung von Agenten zeigte bei allen drei Kennzahlen der Coding-Aktivität signifikante Zuwächse. Ein Commit dokumentiert eine Codeaktualisierung; ein Pull Request reicht eine Änderung zur Prüfung ein. Beides beweist nicht, dass ein Feature die Nutzer erreicht hat. Das Papier verwendet erledigte Jira-Issues und größere Epics als spätere Ergebniskennzahlen, basierend auf dem erfassten Arbeitsablauf, in dem Teams Arbeit nach Prüfung, Tests und Bereitstellung als abgeschlossen markieren. Der Jira-Status ist ein Näherungswert für die Auslieferung und keine unabhängige Messung dessen, was Nutzer erhalten haben.

Bei Agenten lag der geschätzte Anstieg erledigter Issues bei 0,12 pro Beschäftigtenmonat gegenüber einem Ausgangswert von 3,67; der Standardfehler betrug 0,17. Das Ergebnis ist statistisch nicht von null zu unterscheiden. Auch bei abgeschlossenen Epics zeigte sich keine signifikante Veränderung. Laut den Autoren schließt ihr Konfidenzintervall einen Anstieg abgeschlossener Issues von mehr als 12 % des Ausgangsmittelwerts im untersuchten Zeitraum aus. Das ist eine engere Aussage als die Behauptung, Agenten produzierten keine nützliche Software: Bescheidene Zuwächse bleiben möglich, und Issue-Zahlen erfassen nicht jede Veränderung von Wert oder Qualität. Die Autoren prüften anhand prognostizierter Aufgabenlängen, ob sich die Größe der Issues verschob, und fanden in ihrer Stichprobe keine Hinweise darauf.

## Mehr Arbeit erreichte die Reviewer

Die Prüfkennzahlen liefern einen plausiblen Mechanismus für die Lücke bei den Ergebnissen. Nach Einführung der Agenten vergingen laut Schätzung 3,45 Tage mehr von der Einreichung eines Pull Requests bis zum Merge als beim Ausgangswert von 7,03 Tagen, ein Anstieg um 49 %. Dabei handelt es sich um Kalenderzeit im Prüfprozess, nicht um eine Stoppuhrmessung der aktiven Prüfminuten einer Person. Der Anteil der Pull Requests mit einer formellen Änderungsanforderung stieg gegenüber einem Ausgangswert von 13 % um etwa 12 Prozentpunkte; die Kommentare pro Anforderung nahmen gegenüber 1,66 um 0,58 beziehungsweise 35 % zu. Der Anteil der Beschäftigten, die in einem Monat mindestens einen Pull Request prüften, stieg gegenüber 29 % um etwa vier Prozentpunkte, also relativ um 14 %. Die vergleichbaren Schätzungen für Assistenten zeigten keine signifikanten Zuwächse bei Prüfdauer, Änderungsanforderungen oder Kommentaren.

Anhand dieser Metadaten allein kann das Papier nicht feststellen, warum ein Reviewer Änderungen verlangte. Mehr Einreichungen können eine feste Prüfwarteschlange belasten; auch eine Veränderung der Codequalität oder der Prüfstandards könnte zu genauerer Kontrolle führen. Die Autoren fanden keinen signifikanten Anstieg der durchschnittlichen Größe von Pull Requests, was eine einfache Erklärung für die zusätzlichen Kommentare abschwächt. Sie untersuchten weder den Codeinhalt noch zählten sie direkt Fehler in agentengenerierter Arbeit. Ihr zweistufiges Produktionsmodell erklärt, wie schnelleres Schreiben von Code und ein veränderter Prüfaufwand pro Entwurf gemeinsam die abgeschlossene Arbeit begrenzen könnten. Das Modell interpretiert die Beobachtungen; es ist kein separater Test, der einen der beiden Mechanismen isoliert.

Auch KI-Prüftools hatten sich in der Stichprobe verbreitet: Bis März 2026 hatten fast 80 % der Unternehmen eines genutzt. Dennoch führt das Papier 23,3 % der Prüfungskommentare auf KI zurück und findet mindestens einen KI-Kommentar bei 10,8 % der Pull Requests. Die Einführung eines Prüftools bedeutet daher nicht, dass Prüfungen in diesen Unternehmen automatisch ablaufen.

## Was das Studiendesign zeigen kann

Die Forschenden analysieren rund 300 Millionen Arbeitsereignisse von Januar 2021 bis März 2026 bei 718 zustimmenden Jellyfish-Kundenunternehmen mit insgesamt 725.938 Beschäftigten. Sie vergleichen die Ergebnisse vor und nach der Einführung von Assistenten oder Agenten mit den Ergebnissen bei Unternehmen, die später oder noch nicht eingeführt hatten, und verwenden ein gestaffeltes Difference-in-Differences-Design. Kontrollen für Unternehmen und Kalendermonate berücksichtigen einige stabile Unterschiede und gemeinsame zeitliche Trends. Die Schlussfolgerung hängt weiterhin davon ab, wie vergleichbar die Entwicklung dieser Unternehmen ohne Einführung gewesen wäre. Größere Unternehmen führten die Tools früher ein, und nicht gemessene Veränderungen könnten sowohl die Einführung als auch die Engineering-Arbeit beeinflusst haben. Die Studie ist beobachtend; ihre Schätzungen sind weder als randomisierter Test noch als Prognose für alle Softwareteams zu verstehen.

Auch das Beschäftigungsergebnis ist mit derselben Vorsicht zu betrachten. Anhand der mit LinkedIn verknüpften Gesamtbeschäftigung und der aktiven Beschäftigten bei Jellyfish für die Engineering-Beschäftigung konnten die Autoren im beobachteten Zeitraum keine signifikante Veränderung der Einführung von Agenten zuschreiben. Daraus lässt sich nicht ableiten, wie sich Einstellungen nach einer längeren Anpassung oder auf dem breiteren Arbeitsmarkt entwickeln werden.

[Frühere Berichterstattung von BIG CHANGE](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) untersuchte einen separaten Engineering-Bericht über KI-Coding und verlässliche Auslieferung. Diese Studie ergänzt eine unternehmensübergreifende Perspektive und getrennte Kennzahlen für Coding-Aktivität, Prüfung und erledigte Arbeit. Die praktische Lehre lautet, diese Phasen bei der Bewertung von Agenten gemeinsam zu verfolgen: Ein schnellerer erster Entwurf verändert die nachgelagerte Arbeitsmenge, doch dieses Papier zeigt bislang keinen entsprechenden Anstieg abgeschlossener Issues oder Projekte.

## Quellen und weiterführende Lektüre

- [Fiona Chen und James Stratton, *Künstliche Intelligenz im Unternehmen: Engpässe in der Softwareproduktion*](https://fion.ac/jellyfish.pdf): primäres Arbeitspapier, aktuelle Fassung vom 4. August 2026. Methoden, Abbildungen und Anhänge stützen die berichteten Schätzungen und ihre Grenzen; die zugrunde liegenden Unternehmensdaten sind proprietär und aggregiert.
- [Bericht von Ars Technica vom 9. Oktober](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/): unabhängiger zeitgenössischer Bericht, der auf das Papier aufmerksam machte. Die obigen numerischen und methodischen Aussagen wurden anhand des Papiers selbst geprüft.
- [Früherer BIG-CHANGE-Artikel zu KI-Coding und CI](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery): verwandte Berichterstattung über einen separaten Engineering-Bericht. Er dient als Kontext zur Auslieferungsfrage und ist keine Fortsetzung dieser Studie.

## Sources

- [Künstliche Intelligenz im Unternehmen: Engpässe in der Softwareproduktion](https://fion.ac/jellyfish.pdf) — Primäres, 78-seitiges Harvard-Arbeitspapier für den akademischen Arbeitsmarkt; Arbeitsereignisse bis März 2026, Methoden und numerische Schätzungen. Proprietäre Daten sind aggregiert und anonymisiert.
- [Ars Technica: KI-Coding-Agenten erzeugen mehr Code, aber nicht mehr Software](https://arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/) — Unabhängiger zeitgenössischer Bericht; Recherche und Kontext, wobei die Studienbehauptungen anhand des Papiers geprüft wurden.
- [BIG CHANGE: KI-Coding macht verlässliche Auslieferung zur nächsten Engineering-Herausforderung](https://bigchange.ai/blog/ai-coding-ci-bottleneck-dependable-delivery) — Frühere BIG-CHANGE-Berichterstattung über einen separaten Linear-Engineering-Bericht zu KI-Coding und verlässlicher Auslieferung.