Das Team, das Atria Dawn Preview entwickelte, setzte KI bei 713 von 739 Aufgaben ein, zu denen die Beteiligten eine eindeutige Auskunft über die KI-Nutzung gaben. In der Studie zur eigenen Entwicklungsarbeit trafen Menschen bei 85,5 Prozent der erfassten Entscheidungen über Methoden oder Parameter weiterhin die endgültige Wahl. Der Titel der Studie spricht von „agentischer Superintelligenz“, doch die Aufgabenprotokolle erzählen genauer, wie das Team die Arbeit aufteilte.
Der Vorabdruck wurde am 14. September eingereicht und am 17. September 2026 überarbeitet. Er stützt sich auf 769 Aufgabenprotokolle von 56 Beteiligten sowie auf Agentenprotokolle aus einem einzelnen Modellprojekt. Die Autoren beschreiben die Aufzeichnungen als Fallstudie zum Einsatz von Agenten bei der Entwicklung von Atria Dawn Preview.
Die große Änderung
- Was sich geändert hat: Das Team hielt fest, wie Agenten und Menschen bei einem Modellprojekt konkrete Forschungsentscheidungen teilten, und unterschied dabei zwischen einem Vorschlag und der endgültigen Wahl.
- Warum das wichtig ist: Ein Agent kann eine Methode vorschlagen und eine Überarbeitung ausführen, während Forschende weiterhin das Ziel wählen, die Methode genehmigen und entscheiden, ob das Ergebnis die Kriterien der Aufgabe erfüllt. Wer nur die Aktionen des Agenten zählt, übersieht diese unterschiedlichen Rollen.
- Worauf es ankommt: Dies sind Beobachtungen aus der Arbeit eines einzelnen Teams, wobei ein großer Teil der Entscheidungsdaten von den Beteiligten stammt. Die Ergebnisse zeigen weder, wie andere KI-Labore Entscheidungen aufteilen, noch ob Agenten ihre Nachfolger autonom entwickeln können.
Agenten schlugen viele Methoden vor; Menschen wählten die meisten aus
Die deutlichste Unterscheidung zeigt sich bei 567 erfassten Entscheidungen über Methoden oder Parameter unter Beteiligten mit ausführenden Rollen. Der Studie zufolge schlug die KI bei 64,6 Prozent dieser Entscheidungen eine Option vor. Die größte Einzelkategorie mit 55,4 Prozent lautete: „KI schlägt vor, Mensch wählt aus.“ Menschen trafen die endgültige Wahl in 85,5 Prozent der Fälle, die KI in 9,2 Prozent. Die übrigen Entscheidungen wurden einer externen Einschränkung zugeschrieben.
Je nach Frage unterschieden sich die Anteile. Bei 93,4 Prozent von 603 Entscheidungen über Ziele oder Umfang und bei 81,9 Prozent von 542 Entscheidungen über Abnahmekriterien trafen Menschen die endgültige Wahl. KI-Vorschläge waren bei Methoden weitaus häufiger als bei Zielen. Die Abbildung der Studie zeigt außerdem, dass Menschen bei 144 von 151 Aufgaben das endgültige Ziel auswählten, die die Beteiligten ohne KI als nicht umsetzbar einschätzten.
Diese Prozentwerte beschreiben die berichteten Entscheidungsrollen. Sie messen nicht, ob jede menschliche Entscheidung gut informiert war. Die Autoren deuten das Muster so, dass Forschende die Arbeit steuerten und Agenten innerhalb der von Menschen gesetzten Vorgaben Optionen erzeugten. Die Fallstudie dokumentiert in diesem Projekt delegierte Ausführung bei zugleich erhaltener letzter Entscheidungsbefugnis.
Menschliches Feedback schickte Agenten häufig zurück an die Arbeit
Die Beteiligten erinnerten sich an die jeweils größte Schwierigkeit jeder Aufgabe. Von 588 Aufgaben mit erfasster Schwierigkeit und Reaktion wurden 447, also 76,0 Prozent, mit menschlicher Hilfe fortgesetzt; bei 135 Aufgaben beziehungsweise 23,0 Prozent fanden Agenten selbstständig eine Lösung. Am häufigsten halfen zusätzlicher Kontext oder präzisierte Anforderungen (207 Aufgaben) sowie eine Diagnose oder ein Methodenwechsel (204). In vier Aufgaben übernahm ein Mensch die Hauptarbeit.
Die Ergebnisprotokolle zeigen eine ähnliche Aufteilung. Von 627 Aufgaben mit bekannter Bewertung des zentralen KI-Ergebnisses erforderten 354 eine substanziellere Überarbeitung. In dieser überarbeiteten Teilgruppe nahm der Agent nach menschlichem Feedback in 75,4 Prozent der Fälle die Änderungen vor; in 19,2 Prozent bearbeitete ein Mensch das Ergebnis direkt. Forschende konnten eine Änderung anweisen, ohne sie selbst vorzunehmen.
Auch eine Kennzahl aus den Protokollen stieg während der Entwicklung: Bei einer Gruppe von 22 Beteiligten erhöhte sich der tägliche Median protokollierter Agentenaktionen pro menschlichem Prompt von 11,0 am 7. August auf 28,5 am 4. September. Die Kennzahl nutzt ein rollierendes Zeitfenster von sieben Tagen; an jedem der beiden Tage lagen gültige Verhältnisse für 21 oder 22 Personen vor. Sie zählt Aktivitäten und belegt weder, dass Agenten mehr Entscheidungsbefugnis erhielten, noch dass sich ihre Ergebnisse verbesserten.
Was sich aus den Aufgabenprotokollen ableiten lässt
Die Beteiligten schätzten ein, ob sie ihren jeweiligen Aufgabenanteil ohne KI bei gleichem Umfang, gleicher Qualität und mit denselben weiteren Ressourcen hätten erledigen können. Von 455 abgeschlossenen KI-unterstützten Aufgaben mit auswertbaren Antworten stuften sie 151, also 33,2 Prozent, ohne KI als nicht umsetzbar ein. Das ist eine selbstberichtete kontrafaktische Einschätzung und kein Experiment, bei dem das Team dieselben Aufgaben ohne Agent erneut ausführte. Sie belegt nicht, dass die Arbeit unter anderen Bedingungen gar nicht erst begonnen worden wäre.
Die Studie beschreibt weder ein Stichprobenverfahren für die 56 Beteiligten oder die 769 Aufgabenprotokolle noch stellen ihre öffentlichen Links die zugrunde liegenden Aufgabenantworten und Agentenprotokolle für eine unabhängige Neuauswertung bereit. Die Benchmark-Ergebnisse bewerten Atria Dawn Preview als Modell. Sie zeigen nicht, dass ein KI-System seinen Nachfolger autonom verbessert. Für Teams, die über Delegation entscheiden, ist die berichtete Grenze konkret: In diesem Projekt schlugen Agenten häufig Arbeiten vor und überarbeiteten sie; nach Angaben der Beteiligten behielten Menschen die meisten Entscheidungen über Ziele, Methoden und Abnahmekriterien.



