AI-translated from English; not yet reviewed by a fluent editor.

# Eine Übersicht zur KI-Selbstverbesserung zeigt die Lücke zwischen Automatisierung und immer besseren Nachfolgern

> Eine neue Übersicht beschreibt fünf Stufen, wie stark KI die eigene Weiterentwicklung steuert. Bestehende Systeme zeigen begrenzte Fortschritte; zuverlässige Verbesserungen über mehrere Generationen sind weiterhin nicht belegt.

By BIG CHANGE Editorial

Published: 2026-09-24T22:02:18.653Z
Updated: 2026-09-24T22:02:18.653Z
Canonical: https://bigchange.ai/blog/ai-self-improvement-successor-test

![A charcoal-and-ink illustration of an intact orange chain link held between the jaws of a steel materials-testing machine.](https://bigchange.ai/api/media/file/self-improvement-link-test-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Eine [Übersicht, die am 10. September auf arXiv veröffentlicht und am 22. September überarbeitet wurde](https://arxiv.org/html/2609.11873v3), beschreibt fünf Stufen der KI-Beteiligung an der Verbesserung von KI-Systemen. Ihr Titel *Die letzte von Menschen gebaute KI* bezeichnet eine Zielvorstellung und kein Ereignis, von dem die Autoren berichten. Die angeführten Belege reichen bis zu begrenzten Beispielen, in denen Systeme Teile ihres eigenen Entwicklungsprozesses überarbeiten. Sie belegen kein System, das von Generation zu Generation zuverlässig bessere Nachfolger hervorbringt.

Diese Unterscheidung ist wichtig, wenn man Behauptungen über automatisierte KI-Forschung einordnet. Ein Agent kann Experimente ausführen, Erkenntnisse speichern und einen Benchmarkwert verbessern, während Menschen weiterhin das Ziel festlegen, die Tests kontrollieren und über übernommene Änderungen entscheiden. Für die stärkere Behauptung müsste belegt werden, dass das System die *Methode* verbessert hat, mit der seine nächste Version entsteht, und dass das überarbeitete Verfahren in einem fairen Vergleich besser abschnitt.

## Die große Veränderung

- **Was sich geändert hat:** Forschende können genauer beschreiben, wie viel Kontrolle ein System über einen KI-Verbesserungszyklus ausübt – von der Ausführung vorgegebener Aktualisierungen bis zur Überarbeitung des Verfahrens für spätere Aktualisierungen. Die neue Übersicht ordnet bestehende Arbeiten ein; sie kündigt keinen fertigen autonomen Nachfolger-Generator an.
- **Warum das wichtig ist:** KI-Labore können mehr Experimente automatisieren, ohne damit zu belegen, dass jeder neue Agent besser darin ist, den nächsten zu entwickeln. Dieser Unterschied beeinflusst, wie Forschende Leistungsbehauptungen einordnen und an welchen Stellen sie menschliche Prüfung und unabhängige Tests beibehalten.
- **Worauf zu achten ist:** Der entscheidende Beleg wäre eine Folge von Nachfolgern, die mit einem übernommenen und überarbeiteten Verbesserungsverfahren erzeugt und bei vergleichbarem Ressourceneinsatz anhand geschützter Aufgaben mit dem alten Verfahren verglichen werden. Die untersuchten Arbeiten haben auf dieser Grundlage noch keine statistisch zuverlässige Anhäufung von Fortschritten belegt.

## Fünf Stufen beschreiben die Kontrolle über den Verbesserungszyklus

Die Arbeit unterscheidet zunächst die Überarbeitung einer einzelnen Aufgabe, als B0 bezeichnet, von dauerhafter Verbesserung. Ein Modell, das eine Antwort so lange bearbeitet, bis sie eine Prüfung besteht, hat diese Antwort verbessert. Wird die Änderung nicht auf spätere, unabhängige Aufgaben übertragen, hat das System selbst keine dauerhafte Aktualisierung erworben.

Auf **Stufe 1** bestimmen Menschen Ziel und Erfolgskriterium; die KI führt eine Aktualisierung aus, etwa indem sie eine von Menschen festgelegte Datenqualitätsregel anwendet. Auf **Stufe 2** wählt die KI zusätzlich eine Strategie für das vorgegebene Ziel, beispielsweise indem sie Fehler eines Programmieragenten diagnostiziert und Änderungen an dessen Werkzeugen vorschlägt. Ziel und Abnahmetest kommen weiterhin von außerhalb des Systems.

Auf **Stufe 3** hilft das System mitzuentscheiden, welche Erfahrungen es als Nächstes braucht, etwa indem es Übungsaufgaben zu erkannten Schwächen auswählt. **Stufe 4** ergänzt Rückmeldungen aus der fortlaufenden Nutzung: Nach neuen Bedingungen übernimmt das System genehmigte Änderungen an Speicher, Regeln oder Komponenten dauerhaft. Laut Arbeit hängen beide Stufen von der Qualität der Rückmeldungen und den Regeln dafür ab, welche Änderungen bestehen bleiben.

**Stufe 5** trifft den Kerngedanken der Übersicht. Die KI überarbeitet ein Verfahren, das spätere *Verbesserungen* steuert, etwa ihre Suchstrategie, ihren Bewertungsmechanismus oder den Agenten, der Nachfolger vorschlägt. Das geänderte Verfahren muss beibehalten und in einer späteren Runde eingesetzt werden. Auch hier können Menschen laut Arbeit weiterhin das Gesamtziel, geschützte Abnahmetests und Ressourcen kontrollieren. Eine Stufe beschreibt delegierte Verantwortung, keine Fortschrittsgarantie und keine uneingeschränkte Autonomie.

## Bestehende Systeme zeigen die Grenze

Die Studie zur [Darwin Gödel Machine](https://arxiv.org/html/2505.22954) berichtet, dass sich die Leistung ihres Programmieragenten auf einer Teilmenge von SWE-bench von 20 auf 50 Prozent verbesserte, während Varianten den Agentencode änderten und erfolgreiche Varianten in ein Archiv aufgenommen wurden. Die Autoren halten zugleich fest, dass die Archivpflege und die Regel zur Auswahl der nächsten Ausgangsvariante fest vorgegeben waren. Die Übersicht führt das Beispiel an, um zu zeigen: Bessere Nachkommen belegen noch nicht, dass sich auch das Verfahren zur Auswahl dieser Nachkommen verbessert hat.

[A-Evolve-Training](https://arxiv.org/html/2606.20657) liefert ein enger umrissenes Beispiel für Stufe 5. Dabei wurden vier Runden Nachtraining mit einem Modell mit 30 Milliarden Parametern durchgeführt. Ein Meta-Agent fasste Ergebnisse zusammen und änderte die Forschungsstrategie, an der sich spätere Arbeitsagenten orientierten, nachdem ein interner Entwicklungswert nicht mehr mit einer externen Rangliste übereinstimmte. Die Studie nennt einen Endwert von 0,86 gegenüber 0,87 für die damals beste menschliche Einreichung. Die übernommene Strategie änderte, wie spätere Experimente ausgewählt wurden. Das zeigt ein überarbeitetes Forschungsverfahren innerhalb eines klar abgegrenzten Projekts, nicht die autonome Kontrolle über sämtliche Teile der Modellentwicklung.

Die [HyperAgents-Studie](https://arxiv.org/html/2603.19461) prüft, ob sich ein verbessertes Verfahren zum Bau von Agenten auf ein neues Gebiet übertragen lässt. Nach 200 Iterationen zur Bewertung mathematischer Lösungen erreichte ein Lauf mit übertragenen Verbesserungen 0,640 im Testsatz, verglichen mit 0,610 bei einem Lauf mit dem ursprünglichen Agenten. Die Autoren berichten, dass dieser Unterschied statistisch nicht signifikant war. Das Ergebnis spricht dafür, den Transfer weiter zu untersuchen, belegt aber keine zuverlässige kumulative Verbesserung über mehrere Durchläufe.

## Mehr Aktivität ist kein Beleg für bessere Verbesserung

Die Übersicht unterscheidet die erneute Nutzung eines überarbeiteten Verfahrens – die sie *strukturelle Rekursion* nennt – von *effektiver Rekursion*: Das überarbeitete Verfahren erzeugt unter vergleichbaren Ressourcen und bei unabhängiger Bewertung stärkere Nachfolger. Diese zweite Prüfung ist es, die der dramatische Titel Leserinnen und Leser leicht als bereits bestanden annehmen lässt.

Es gibt mehrere Möglichkeiten, Aktivität mit Fortschritt zu verwechseln. Ein System kann mehr Rechenzeit in die Suche investieren, sich an einen wiederholt abgefragten Benchmark anpassen oder eine Änderung beibehalten, die einer Aufgabe nützt und eine andere beeinträchtigt. Ändert es außerdem seinen eigenen Bewertungsmechanismus, können höhere Werte auf einem neuen Maßstab beruhen. Die Arbeit fordert deshalb, genau zu dokumentieren, was überarbeitet wurde, zu zeigen, dass die geänderte Komponente tatsächlich die nächste Runde gesteuert hat, sie bei gleichen Ressourcen mit der alten Komponente zu vergleichen und Beibehaltung sowie Transfer anhand unabhängiger Aufgaben zu prüfen.

Die Autoren erklären ausdrücklich, dass die bisherigen Ergebnisse begrenzte Änderungen an Verbesserungsagenten, Bewertungsmechanismen und Forschungsstrategien stützen, während „statistisch zuverlässige Anhäufung von Fortschritten über Generationen hinweg bei vergleichbarem Ressourceneinsatz weiterhin offen ist“. Die Formulierung „die letzte von Menschen gebaute KI“ benennt das Ziel, das ihren Rahmen motiviert. Die Übersicht liefert Kriterien, um den Fortschritt auf diesem Weg zu beurteilen.

## Quellen und weiterführende Informationen

- [Duan et al., *Die letzte von Menschen gebaute KI*, Version 3](https://arxiv.org/html/2609.11873v3) (22. September 2026). Die Primärübersicht definiert B0 und die Stufen 1 bis 5, unterscheidet strukturelle von effektiver Rekursion und erläutert die Grenzen der Belege. Taxonomie und Einordnung sind der Rahmen der Autoren, keine Demonstration eines neuen Systems.
- [Zhang et al., *Darwin Gödel Machine*](https://arxiv.org/html/2505.22954) (Version 3, 12. März 2026). Die Originalstudie berichtet Zuwächse bei Programmier-Benchmarks und legt dar, dass Archivpflege und Auswahl der Ausgangsvariante für das System nicht veränderbar sind.
- [Shi et al., *A-Evolve-Training*](https://arxiv.org/html/2606.20657) (Version 3, 8. September 2026). Das Original-Preprint beschreibt vier Runden Nachtraining, eine überarbeitete Forschungsstrategie und das angegebene Ergebnis im Vergleich zur Rangliste. Ziel und zugrunde liegendes Arbeitssystem bleiben von außen festgelegt.
- [Zhang et al., *HyperAgents*](https://arxiv.org/html/2603.19461) (2026). Die Originalstudie untersucht den Transfer eines Verfahrens zum Bau von Agenten und berichtet, dass der hier zitierte Vergleich nach 200 Iterationen statistisch nicht signifikant ist.
- [Manuel Muñoz Plás ausführliche Analyse](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) (18. September 2026) untersucht Beispiele der oberen Stufen und die Grenzen der Belege. Sie analysiert eine frühere Fassung der Arbeit; der obige Artikel verwendet Version 3 und die zitierten Originalstudien für die Sachbehauptungen.
- [Bericht der South China Morning Post](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) (14. September 2026) behandelt den fünfstufigen Fahrplan der Übersicht und den Kontext der KI-Forschung. Es ist eine Sekundärquelle und kein Beleg für die Ergebnisse der Studien.
- [Erklärstück von The Rundown AI](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) (16. September 2026) fasst die Stufen zusammen und ordnet die Arbeit in die Debatte über automatisierte KI-Forschung ein. Es ist eine Sekundärquelle; die Arbeit und die Originalstudien stützen die obigen Tatsachenbehauptungen.

## Sources

- [Duan et al.: „Die letzte von Menschen gebaute KI“, Version 3](https://arxiv.org/html/2609.11873v3) — Primärübersicht zu Autonomiestufen und Forschungsbeispielen. Definiert strukturelle und effektive Rekursion und hält fest, dass eine statistisch zuverlässige Anhäufung von Fortschritten über Generationen bei vergleichbarem Ressourceneinsatz weiterhin offen ist. Sie demonstriert keine neu gebaute autonome KI.
- [arXiv-Einreichungshistorie zu 2609.11873](https://arxiv.org/abs/2609.11873) — Dokumentiert Version 1 vom 10. September und Version 3 vom 22. September sowie Yi Duan und 34 Mitautoren.
- [Zhang et al.: Darwin Gödel Machine](https://arxiv.org/html/2505.22954) — Originalstudie mit einem Zuwachs von 20 auf 50 Prozent auf der verwendeten SWE-bench-Teilmenge. Sie hält fest, dass das System Archivpflege und Auswahl der Ausgangsvariante nicht verändern kann.
- [Shi et al.: A-Evolve-Training](https://arxiv.org/html/2606.20657) — Das Original-Preprint beschreibt vier autonome Nachtrainingsrunden, eine übernommene überarbeitete Forschungsstrategie und den Ranglistenwert von 0,86 gegenüber 0,87 zum angegebenen Vergleichszeitpunkt. Die zugrunde liegende Infrastruktur der Arbeitsagenten und das Ziel bleiben festgelegt.
- [Zhang et al.: HyperAgents](https://arxiv.org/html/2603.19461) — Originalstudie mit einem Transfervergleich nach 200 Iterationen: 0,640 gegenüber 0,610 in einem Testsatz zur Bewertung mathematischer Lösungen; der Unterschied ist statistisch nicht signifikant.
- [Manuel Muñoz Plá: „Die letzte von Menschen gebaute KI – eine ausführliche Lektüre“](https://manpla.net/en/posts/the-last-ai-read-from-the-inside/) — Unabhängige ausführliche Analyse einer früheren Fassung der Übersicht. Als Kontext aufgeführt; die Forschungsbehauptungen dieses Artikels stützen sich auf die Originalarbeiten.
- [South China Morning Post: „Chinesische Forschende skizzieren einen fünfstufigen Weg“](https://www.scmp.com/tech/tech-trends/article/3367486/chinese-researchers-chart-five-stage-path-toward-last-ai-built-humans) — Sekundärbericht über diese Übersicht und ihren Forschungskontext. Ergänzende Lektüre, kein Primärbeleg für Versuchsergebnisse.
- [The Rundown AI: „Chinesische Forschende skizzieren eine KI, die ihre Nachfolger entwickeln kann“](https://www.therundown.ai/news/chinese-researchers-ai-recursive-self-improvement-roadmap) — Sekundärerläuterung der fünf Stufen der Arbeit und der breiteren Debatte. Die sachlichen Forschungsbehauptungen stützen sich auf die Originalarbeiten.
