Eine Übersicht, die am 10. September auf arXiv veröffentlicht und am 22. September überarbeitet wurde, beschreibt fünf Stufen der KI-Beteiligung an der Verbesserung von KI-Systemen. Ihr Titel Die letzte von Menschen gebaute KI bezeichnet eine Zielvorstellung und kein Ereignis, von dem die Autoren berichten. Die angeführten Belege reichen bis zu begrenzten Beispielen, in denen Systeme Teile ihres eigenen Entwicklungsprozesses überarbeiten. Sie belegen kein System, das von Generation zu Generation zuverlässig bessere Nachfolger hervorbringt.

Diese Unterscheidung ist wichtig, wenn man Behauptungen über automatisierte KI-Forschung einordnet. Ein Agent kann Experimente ausführen, Erkenntnisse speichern und einen Benchmarkwert verbessern, während Menschen weiterhin das Ziel festlegen, die Tests kontrollieren und über übernommene Änderungen entscheiden. Für die stärkere Behauptung müsste belegt werden, dass das System die Methode verbessert hat, mit der seine nächste Version entsteht, und dass das überarbeitete Verfahren in einem fairen Vergleich besser abschnitt.

Die große Veränderung

  • Was sich geändert hat: Forschende können genauer beschreiben, wie viel Kontrolle ein System über einen KI-Verbesserungszyklus ausübt – von der Ausführung vorgegebener Aktualisierungen bis zur Überarbeitung des Verfahrens für spätere Aktualisierungen. Die neue Übersicht ordnet bestehende Arbeiten ein; sie kündigt keinen fertigen autonomen Nachfolger-Generator an.
  • Warum das wichtig ist: KI-Labore können mehr Experimente automatisieren, ohne damit zu belegen, dass jeder neue Agent besser darin ist, den nächsten zu entwickeln. Dieser Unterschied beeinflusst, wie Forschende Leistungsbehauptungen einordnen und an welchen Stellen sie menschliche Prüfung und unabhängige Tests beibehalten.
  • Worauf zu achten ist: Der entscheidende Beleg wäre eine Folge von Nachfolgern, die mit einem übernommenen und überarbeiteten Verbesserungsverfahren erzeugt und bei vergleichbarem Ressourceneinsatz anhand geschützter Aufgaben mit dem alten Verfahren verglichen werden. Die untersuchten Arbeiten haben auf dieser Grundlage noch keine statistisch zuverlässige Anhäufung von Fortschritten belegt.

Fünf Stufen beschreiben die Kontrolle über den Verbesserungszyklus

Die Arbeit unterscheidet zunächst die Überarbeitung einer einzelnen Aufgabe, als B0 bezeichnet, von dauerhafter Verbesserung. Ein Modell, das eine Antwort so lange bearbeitet, bis sie eine Prüfung besteht, hat diese Antwort verbessert. Wird die Änderung nicht auf spätere, unabhängige Aufgaben übertragen, hat das System selbst keine dauerhafte Aktualisierung erworben.

Auf Stufe 1 bestimmen Menschen Ziel und Erfolgskriterium; die KI führt eine Aktualisierung aus, etwa indem sie eine von Menschen festgelegte Datenqualitätsregel anwendet. Auf Stufe 2 wählt die KI zusätzlich eine Strategie für das vorgegebene Ziel, beispielsweise indem sie Fehler eines Programmieragenten diagnostiziert und Änderungen an dessen Werkzeugen vorschlägt. Ziel und Abnahmetest kommen weiterhin von außerhalb des Systems.

Auf Stufe 3 hilft das System mitzuentscheiden, welche Erfahrungen es als Nächstes braucht, etwa indem es Übungsaufgaben zu erkannten Schwächen auswählt. Stufe 4 ergänzt Rückmeldungen aus der fortlaufenden Nutzung: Nach neuen Bedingungen übernimmt das System genehmigte Änderungen an Speicher, Regeln oder Komponenten dauerhaft. Laut Arbeit hängen beide Stufen von der Qualität der Rückmeldungen und den Regeln dafür ab, welche Änderungen bestehen bleiben.

Stufe 5 trifft den Kerngedanken der Übersicht. Die KI überarbeitet ein Verfahren, das spätere Verbesserungen steuert, etwa ihre Suchstrategie, ihren Bewertungsmechanismus oder den Agenten, der Nachfolger vorschlägt. Das geänderte Verfahren muss beibehalten und in einer späteren Runde eingesetzt werden. Auch hier können Menschen laut Arbeit weiterhin das Gesamtziel, geschützte Abnahmetests und Ressourcen kontrollieren. Eine Stufe beschreibt delegierte Verantwortung, keine Fortschrittsgarantie und keine uneingeschränkte Autonomie.

Bestehende Systeme zeigen die Grenze

Die Studie zur Darwin Gödel Machine berichtet, dass sich die Leistung ihres Programmieragenten auf einer Teilmenge von SWE-bench von 20 auf 50 Prozent verbesserte, während Varianten den Agentencode änderten und erfolgreiche Varianten in ein Archiv aufgenommen wurden. Die Autoren halten zugleich fest, dass die Archivpflege und die Regel zur Auswahl der nächsten Ausgangsvariante fest vorgegeben waren. Die Übersicht führt das Beispiel an, um zu zeigen: Bessere Nachkommen belegen noch nicht, dass sich auch das Verfahren zur Auswahl dieser Nachkommen verbessert hat.

A-Evolve-Training liefert ein enger umrissenes Beispiel für Stufe 5. Dabei wurden vier Runden Nachtraining mit einem Modell mit 30 Milliarden Parametern durchgeführt. Ein Meta-Agent fasste Ergebnisse zusammen und änderte die Forschungsstrategie, an der sich spätere Arbeitsagenten orientierten, nachdem ein interner Entwicklungswert nicht mehr mit einer externen Rangliste übereinstimmte. Die Studie nennt einen Endwert von 0,86 gegenüber 0,87 für die damals beste menschliche Einreichung. Die übernommene Strategie änderte, wie spätere Experimente ausgewählt wurden. Das zeigt ein überarbeitetes Forschungsverfahren innerhalb eines klar abgegrenzten Projekts, nicht die autonome Kontrolle über sämtliche Teile der Modellentwicklung.

Die HyperAgents-Studie prüft, ob sich ein verbessertes Verfahren zum Bau von Agenten auf ein neues Gebiet übertragen lässt. Nach 200 Iterationen zur Bewertung mathematischer Lösungen erreichte ein Lauf mit übertragenen Verbesserungen 0,640 im Testsatz, verglichen mit 0,610 bei einem Lauf mit dem ursprünglichen Agenten. Die Autoren berichten, dass dieser Unterschied statistisch nicht signifikant war. Das Ergebnis spricht dafür, den Transfer weiter zu untersuchen, belegt aber keine zuverlässige kumulative Verbesserung über mehrere Durchläufe.

Mehr Aktivität ist kein Beleg für bessere Verbesserung

Die Übersicht unterscheidet die erneute Nutzung eines überarbeiteten Verfahrens – die sie strukturelle Rekursion nennt – von effektiver Rekursion: Das überarbeitete Verfahren erzeugt unter vergleichbaren Ressourcen und bei unabhängiger Bewertung stärkere Nachfolger. Diese zweite Prüfung ist es, die der dramatische Titel Leserinnen und Leser leicht als bereits bestanden annehmen lässt.

Es gibt mehrere Möglichkeiten, Aktivität mit Fortschritt zu verwechseln. Ein System kann mehr Rechenzeit in die Suche investieren, sich an einen wiederholt abgefragten Benchmark anpassen oder eine Änderung beibehalten, die einer Aufgabe nützt und eine andere beeinträchtigt. Ändert es außerdem seinen eigenen Bewertungsmechanismus, können höhere Werte auf einem neuen Maßstab beruhen. Die Arbeit fordert deshalb, genau zu dokumentieren, was überarbeitet wurde, zu zeigen, dass die geänderte Komponente tatsächlich die nächste Runde gesteuert hat, sie bei gleichen Ressourcen mit der alten Komponente zu vergleichen und Beibehaltung sowie Transfer anhand unabhängiger Aufgaben zu prüfen.

Die Autoren erklären ausdrücklich, dass die bisherigen Ergebnisse begrenzte Änderungen an Verbesserungsagenten, Bewertungsmechanismen und Forschungsstrategien stützen, während „statistisch zuverlässige Anhäufung von Fortschritten über Generationen hinweg bei vergleichbarem Ressourceneinsatz weiterhin offen ist“. Die Formulierung „die letzte von Menschen gebaute KI“ benennt das Ziel, das ihren Rahmen motiviert. Die Übersicht liefert Kriterien, um den Fortschritt auf diesem Weg zu beurteilen.

Quellen und weiterführende Informationen

  • Duan et al., Die letzte von Menschen gebaute KI, Version 3 (22. September 2026). Die Primärübersicht definiert B0 und die Stufen 1 bis 5, unterscheidet strukturelle von effektiver Rekursion und erläutert die Grenzen der Belege. Taxonomie und Einordnung sind der Rahmen der Autoren, keine Demonstration eines neuen Systems.
  • Zhang et al., Darwin Gödel Machine (Version 3, 12. März 2026). Die Originalstudie berichtet Zuwächse bei Programmier-Benchmarks und legt dar, dass Archivpflege und Auswahl der Ausgangsvariante für das System nicht veränderbar sind.
  • Shi et al., A-Evolve-Training (Version 3, 8. September 2026). Das Original-Preprint beschreibt vier Runden Nachtraining, eine überarbeitete Forschungsstrategie und das angegebene Ergebnis im Vergleich zur Rangliste. Ziel und zugrunde liegendes Arbeitssystem bleiben von außen festgelegt.
  • Zhang et al., HyperAgents (2026). Die Originalstudie untersucht den Transfer eines Verfahrens zum Bau von Agenten und berichtet, dass der hier zitierte Vergleich nach 200 Iterationen statistisch nicht signifikant ist.
  • Manuel Muñoz Plás ausführliche Analyse (18. September 2026) untersucht Beispiele der oberen Stufen und die Grenzen der Belege. Sie analysiert eine frühere Fassung der Arbeit; der obige Artikel verwendet Version 3 und die zitierten Originalstudien für die Sachbehauptungen.
  • Bericht der South China Morning Post (14. September 2026) behandelt den fünfstufigen Fahrplan der Übersicht und den Kontext der KI-Forschung. Es ist eine Sekundärquelle und kein Beleg für die Ergebnisse der Studien.
  • Erklärstück von The Rundown AI (16. September 2026) fasst die Stufen zusammen und ordnet die Arbeit in die Debatte über automatisierte KI-Forschung ein. Es ist eine Sekundärquelle; die Arbeit und die Originalstudien stützen die obigen Tatsachenbehauptungen.