AI-translated from English; not yet reviewed by a fluent editor.

# In einem KI-Modellprojekt schlugen Agenten Methoden vor, während Forschende die endgültigen Entscheidungen trafen

> Das Team von Atria Dawn untersuchte 769 Aufgabenprotokolle aus der eigenen Modellentwicklung. Agenten schlugen häufig Methoden vor und überarbeiteten Ergebnisse; nach Angaben der Beteiligten trafen Menschen die meisten endgültigen Entscheidungen. Die Ergebnisse beschreiben ein einzelnes Projekt.

By BIG CHANGE Editorial

Published: 2026-09-27T17:05:31.968Z
Updated: 2026-09-27T17:05:31.968Z
Canonical: https://bigchange.ai/blog/atria-dawn-ai-agents-human-research-decisions

![Conceptual charcoal illustration of an anonymous researcher in profile considering code-like marks on a desktop monitor, with one hand on a mouse.](https://bigchange.ai/api/media/file/atria-dawn-research-choice-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Das Team, das Atria Dawn Preview entwickelte, setzte KI bei 713 von 739 Aufgaben ein, zu denen die Beteiligten eine eindeutige Auskunft über die KI-Nutzung gaben. In der [Studie zur eigenen Entwicklungsarbeit](https://arxiv.org/html/2609.15818v2) trafen Menschen bei 85,5 Prozent der erfassten Entscheidungen über Methoden oder Parameter weiterhin die endgültige Wahl. Der Titel der Studie spricht von „agentischer Superintelligenz“, doch die Aufgabenprotokolle erzählen genauer, wie das Team die Arbeit aufteilte.

Der [Vorabdruck](https://arxiv.org/abs/2609.15818) wurde am 14. September eingereicht und am 17. September 2026 überarbeitet. Er stützt sich auf 769 Aufgabenprotokolle von 56 Beteiligten sowie auf Agentenprotokolle aus einem einzelnen Modellprojekt. Die Autoren beschreiben die Aufzeichnungen als Fallstudie zum Einsatz von Agenten bei der Entwicklung von Atria Dawn Preview.

## Die große Änderung

- **Was sich geändert hat:** Das Team hielt fest, wie Agenten und Menschen bei einem Modellprojekt konkrete Forschungsentscheidungen teilten, und unterschied dabei zwischen einem Vorschlag und der endgültigen Wahl.
- **Warum das wichtig ist:** Ein Agent kann eine Methode vorschlagen und eine Überarbeitung ausführen, während Forschende weiterhin das Ziel wählen, die Methode genehmigen und entscheiden, ob das Ergebnis die Kriterien der Aufgabe erfüllt. Wer nur die Aktionen des Agenten zählt, übersieht diese unterschiedlichen Rollen.
- **Worauf es ankommt:** Dies sind Beobachtungen aus der Arbeit eines einzelnen Teams, wobei ein großer Teil der Entscheidungsdaten von den Beteiligten stammt. Die Ergebnisse zeigen weder, wie andere KI-Labore Entscheidungen aufteilen, noch ob Agenten ihre Nachfolger autonom entwickeln können.

## Agenten schlugen viele Methoden vor; Menschen wählten die meisten aus

Die deutlichste Unterscheidung zeigt sich bei 567 erfassten Entscheidungen über Methoden oder Parameter unter Beteiligten mit ausführenden Rollen. Der Studie zufolge schlug die KI bei 64,6 Prozent dieser Entscheidungen eine Option vor. Die größte Einzelkategorie mit 55,4 Prozent lautete: „KI schlägt vor, Mensch wählt aus.“ Menschen trafen die endgültige Wahl in 85,5 Prozent der Fälle, die KI in 9,2 Prozent. Die übrigen Entscheidungen wurden einer externen Einschränkung zugeschrieben.

Je nach Frage unterschieden sich die Anteile. Bei 93,4 Prozent von 603 Entscheidungen über Ziele oder Umfang und bei 81,9 Prozent von 542 Entscheidungen über Abnahmekriterien trafen Menschen die endgültige Wahl. KI-Vorschläge waren bei Methoden weitaus häufiger als bei Zielen. Die Abbildung der Studie zeigt außerdem, dass Menschen bei 144 von 151 Aufgaben das endgültige Ziel auswählten, die die Beteiligten ohne KI als nicht umsetzbar einschätzten.

Diese Prozentwerte beschreiben die berichteten Entscheidungsrollen. Sie messen nicht, ob jede menschliche Entscheidung gut informiert war. Die Autoren deuten das Muster so, dass Forschende die Arbeit steuerten und Agenten innerhalb der von Menschen gesetzten Vorgaben Optionen erzeugten. Die Fallstudie dokumentiert in diesem Projekt delegierte Ausführung bei zugleich erhaltener letzter Entscheidungsbefugnis.

## Menschliches Feedback schickte Agenten häufig zurück an die Arbeit

Die Beteiligten erinnerten sich an die jeweils größte Schwierigkeit jeder Aufgabe. Von 588 Aufgaben mit erfasster Schwierigkeit und Reaktion wurden 447, also 76,0 Prozent, mit menschlicher Hilfe fortgesetzt; bei 135 Aufgaben beziehungsweise 23,0 Prozent fanden Agenten selbstständig eine Lösung. Am häufigsten halfen zusätzlicher Kontext oder präzisierte Anforderungen (207 Aufgaben) sowie eine Diagnose oder ein Methodenwechsel (204). In vier Aufgaben übernahm ein Mensch die Hauptarbeit.

Die Ergebnisprotokolle zeigen eine ähnliche Aufteilung. Von 627 Aufgaben mit bekannter Bewertung des zentralen KI-Ergebnisses erforderten 354 eine substanziellere Überarbeitung. In dieser überarbeiteten Teilgruppe nahm der Agent nach menschlichem Feedback in 75,4 Prozent der Fälle die Änderungen vor; in 19,2 Prozent bearbeitete ein Mensch das Ergebnis direkt. Forschende konnten eine Änderung anweisen, ohne sie selbst vorzunehmen.

Auch eine Kennzahl aus den Protokollen stieg während der Entwicklung: Bei einer Gruppe von 22 Beteiligten erhöhte sich der tägliche Median protokollierter Agentenaktionen pro menschlichem Prompt von 11,0 am 7. August auf 28,5 am 4. September. Die Kennzahl nutzt ein rollierendes Zeitfenster von sieben Tagen; an jedem der beiden Tage lagen gültige Verhältnisse für 21 oder 22 Personen vor. Sie zählt Aktivitäten und belegt weder, dass Agenten mehr Entscheidungsbefugnis erhielten, noch dass sich ihre Ergebnisse verbesserten.

## Was sich aus den Aufgabenprotokollen ableiten lässt

Die Beteiligten schätzten ein, ob sie ihren jeweiligen Aufgabenanteil ohne KI bei gleichem Umfang, gleicher Qualität und mit denselben weiteren Ressourcen hätten erledigen können. Von 455 abgeschlossenen KI-unterstützten Aufgaben mit auswertbaren Antworten stuften sie 151, also 33,2 Prozent, ohne KI als nicht umsetzbar ein. Das ist eine selbstberichtete kontrafaktische Einschätzung und kein Experiment, bei dem das Team dieselben Aufgaben ohne Agent erneut ausführte. Sie belegt nicht, dass die Arbeit unter anderen Bedingungen gar nicht erst begonnen worden wäre.

Die Studie beschreibt weder ein Stichprobenverfahren für die 56 Beteiligten oder die 769 Aufgabenprotokolle noch stellen ihre öffentlichen Links die zugrunde liegenden Aufgabenantworten und Agentenprotokolle für eine unabhängige Neuauswertung bereit. Die Benchmark-Ergebnisse bewerten Atria Dawn Preview als Modell. Sie zeigen nicht, dass ein KI-System seinen Nachfolger autonom verbessert. Für Teams, die über Delegation entscheiden, ist die berichtete Grenze konkret: In diesem Projekt schlugen Agenten häufig Arbeiten vor und überarbeiteten sie; nach Angaben der Beteiligten behielten Menschen die meisten Entscheidungen über Ziele, Methoden und Abnahmekriterien.

## Sources

- [Atria-Team, Atria Dawn: The Dawn of Agentic Superintelligence, arXiv v2](https://arxiv.org/html/2609.15818v2) — Primäre Fallstudie. Abschnitt 4 und die Abbildungen 6–10 enthalten Angaben zu Aufgaben, Entscheidungen, Eingriffen, Überarbeitungen und Aktivitätsprotokollen. Die Aufzeichnungen stammen aus dem eigenen Modellprojekt der Autoren. Die Studie beschreibt keine repräsentative Stichprobe und stellt weder die Antworten der Beteiligten noch Agentenprotokolle bereit.
- [Atria Dawn: arXiv-Eintrag und Versionsverlauf](https://arxiv.org/abs/2609.15818) — Bestätigt die Einreichung des Vorabdrucks am 14. September, die Überarbeitung v2 am 17. September und verlinkt das vollständige PDF. Der Titel der Studie belegt nicht, dass autonome Superintelligenz erreicht wurde.
- [Öffentliches Repository von Atria Dawn Preview](https://github.com/atria-asi/Atria-Dawn-Preview) — Das verlinkte öffentliche Repository stellt Material zur Modellveröffentlichung und ein PDF der Studie bereit. Bei der Prüfung waren darin keine Aufgabenantworten auf Einzelebene, Agentenprotokolle oder Skripte zur erneuten Auswertung der Entscheidungsdaten zwischen Mensch und Agent enthalten.
- [The Decoder: KI-Agenten übernehmen mehr Arbeit in der Modellentwicklung, aber Menschen treffen weiterhin die Entscheidungen](https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions/) — Sekundärbericht, der Anlass für diesen Auftrag war. BIG CHANGE prüfte die Angaben zur Studie anhand der Primärarbeit und behandelt die Einschätzung zur Umsetzbarkeit ohne KI als Urteil der Beteiligten, nicht als Beleg dafür, dass die Arbeit nie begonnen worden wäre.
