Ein im September veröffentlichter arXiv-Vorabdruck mit dem Titel „In-Context Robot Learning with VLM Agents“ stellt GPT-Policy vor. Das System verbindet ein festes Vision-Language-Modell mithilfe von Demonstrationen, Bildern und Interaktionsverläufen mit Roboterwerkzeugen. Die Experimente umfassen Aufgaben mit Roboterarmen und mobile Erkundung. Sie bestätigen nicht die separate Behauptung eines Reddit-Beitrags zu GPT-6 Astra und einem Unitree G1.

Die große Änderung

  • Was sich geändert hat: GPT-Policy bietet einem allgemeinen Vision-Language-Modell eine strukturierte Möglichkeit, Demonstrationen und aktuelle Kamerabilder in Anfragen an Roboterwerkzeuge umzusetzen und anschließend anhand von Ausführungsfeedback eine weitere Aktion auszuwählen, ohne die aufgabenspezifischen Modellgewichte zu aktualisieren.
  • Warum das wichtig ist: Der Ansatz trennt allgemeines visuelles Schlussfolgern von Bewegungsprüfung und Ausführung. In den begrenzten Versuchen der Autoren half zusätzlicher Kontext bei einigen Aufgaben; für kontaktabhängige Aktionen waren mitunter abgestimmte Referenzen für Roboteraktionen nötig.
  • Worauf es ankommt: Die Studie berichtet nur drei Durchläufe pro Bedingung und beschreibt langsame, fehleranfällige Abläufe, darunter Armkollisionen. Bevor diese Ergebnisse viel über Roboter in der Nähe von Menschen aussagen, sind Reproduktionen, umfangreichere Bewertungen und unabhängige Sicherheitskontrollen wichtig.

Was GPT-Policy leistet

Der Vorabdruck wurde am 16. September bei arXiv eingereicht. Er untersucht, ob ein allgemeines Vision-Language-Modell mit Beispielen und Feedback eine Aufgabe aus einem neuen Ausgangszustand bewältigen kann, ohne Feintuning oder Änderungen an aufgabenspezifischen Modellparametern. Die Autoren nennen ihr Framework GPT-Policy und führen GPT-6 Astra unter den untersuchten Modellen auf.

Das System stellt verschiedene Arten von Kontext zusammen: eine Aufgabenanweisung, aktuelle Kamerabilder und Zustandsdaten sowie optional Videos menschlicher Demonstrationen, Roboterbeispiele mit Aktionsreferenzen, ein Zielbild, frühere Roboterversuche oder menschliche Interaktion. Ein Kontext-Compiler wählt visuell relevante Übergänge der Aufgabe aus und kombiniert sie mit Anweisungen, Einschränkungen und Werkzeugschemata. Anschließend schlägt das Vision-Language-Modell eine strukturierte Anfrage an ein Roboterwerkzeug vor.

Diese Anfrage wird an eine Steuerung für den jeweiligen Roboter weitergegeben. Die Autoren beschreiben, wie Lösungen der inversen Kinematik geprüft, kartesische Posen abgetastet und zeitliche Gelenkreferenzen vor der Ausführung einer Bewegung kontrolliert oder zurückgewiesen werden. Die Steuerung gibt Beobachtungen und Ausführungsfeedback für die nächste Modellentscheidung zurück. Das Modell schlägt Aktionen vor; roboterspezifischer Code prüft sie und führt sie aus.

Diese Schleife ist der zentrale Beitrag der Studie. Ein festes Vision-Language-Modell kann damit seine nächste Aktion anhand von Beispielen und jüngsten Ergebnissen anpassen, ohne ein Gradienten-Update. „In-Context Learning“ bezeichnet hier die Nutzung von Informationen, die während einer Aufgabe bereitgestellt werden. Es bedeutet weder, dass ein Modell dauerhaft eine neue Fähigkeit erlernt hat, noch, dass jeder Roboter dieselbe Werkzeugschnittstelle verwenden kann.

Was die Versuche gemessen haben

Die Autoren berichten von fünf Experimentfamilien mit insgesamt zehn Roboteraufgaben und drei Durchläufen pro Bedingung. Auf der Projektseite der Autoren sind Roboterversuche in der realen Welt sowie Aufgabenergebnisse, Entscheidungen und Zeitangaben aufgeführt. Beim Aufheben eines Handtuchs war GPT-6 Astra mit einem menschlichen Video in zwei von drei Durchläufen erfolgreich, ohne Video in keinem der drei. Auch beim Aufheben eines Notizbuchs stieg das Ergebnis von null Erfolgen ohne Demonstration auf zwei von drei mit einer Demonstration.

Kontaktabhängige Aufgaben zeigen, warum zusätzlicher Kontext keine allgemeingültige Lösung ist. Beim Abschrauben eines Flaschendeckels führte ein Robotervideo zu zwei Erfolgen in drei Durchläufen; mit ergänzten, abgestimmten Roboteraktionen waren es drei von drei. Beim Herausziehen und Wiedereinstecken eines Steckers gab es in der Bedingung nur mit Video keinen Erfolg in drei Durchläufen, während Video plus Aktionsreferenzen zwei Erfolge erzielten. Das sind kleine Fallzahlen pro Bedingung, keine Zuverlässigkeitsschätzungen.

Für Anordnungen von Blöcken und Obst nach einem Zielbild sowie zwei Aufgaben mit menschlicher Interaktion berichtet die Studie ebenfalls drei Erfolge in drei Durchläufen. Bei Verwendung des Verlaufs eigener Interaktionen meldet sie drei Erfolge von drei sowohl für „Lemon to Pink Plate“ als auch für „Movable Exploration“. Bei der zweiten Aufgabe wich der Roboter aktiv Hindernissen aus, während er nach dem Ziel suchte; die mittlere Dauer betrug 25,53 Minuten. Abbildung 1 zeigt außerdem das mobile Aufnehmen eines Gegenstands. Die Ergebnisse erweitern die Studie über Tischmanipulation hinaus, betreffen aber weiterhin ausgewählte Aufgaben mit drei Durchläufen je Bedingung. Die Durchläufe dauerten Minuten: Für das Aufheben eines Handtuchs mit menschlichem Video nennt die Projektseite durchschnittlich 18,9 Minuten, für die Aufgabe mit Flaschendeckel und Video plus Aktionsreferenzen 17,9 Minuten. Latenz und Betriebskosten bleiben daher praktische offene Fragen.

Anhang B führt Morphi Kino neben YAM und ARX X5 als eine der beschriebenen Roboterkonfigurationen der Studie auf. Morphi Kino habe eine mobile Basis, eine Hüfte und einen Kopf sowie zwei Arme mit jeweils sieben Gelenken. Die Studie umfasst demnach neben Armplattformen auch eine mobile Roboterkonfiguration; in Anhang B wird kein Unitree G1 genannt.

Die mobile Aufgabe der Studie belegt nicht das Reddit-Szenario

Der Reddit-Beitrag behauptet, GPT-6 Astra steuere einen Unitree G1 in einem unbekannten Raum, merke sich die Position von Gegenständen und hole sie später auf ungenaue Anfragen hin. Die Studie berichtet über die andere Aufgabe „Movable Exploration“ und beschreibt Morphi Kino als Plattform mit mobiler Basis. Doch weder die Studie noch die Projektmaterialien oder das öffentliche GitHub-Repository ordnen das G1-Szenario des Reddit-Beitrags einem GPT-Policy-Experiment zu. Der Beitrag bleibt eine separate, nicht verifizierte Behauptung; dieser Vergleich widerlegt sie nicht.

Die Projektseite der Autoren enthält Videos ihrer Experimente. Sie belegen die von den Autoren beschriebenen Aufgaben, sind aber keine unabhängige Validierung. Im öffentlichen Code-Repository sind derzeit Adapter für ARX X5 und I2RT/YAM aufgeführt. Laut Repository fehlen Bereitstellungshosts, private Prompts, Aufzeichnungsdaten der Durchläufe, standortspezifische Kalibrierungen und der Evaluierungsverlauf. Diese Adapterliste beschreibt das veröffentlichte Repository, nicht den gesamten Umfang der Studie, die außerdem mobile Erkundung untersucht und Morphi Kino in Anhang B aufführt. Die verfügbaren Materialien reichen nicht aus, damit BIG CHANGE die gemeldeten Durchläufe reproduzieren könnte; wir haben keinen Roboter getestet.

Die Grenzen der Steuerung bleiben wichtig

Die Projektseite berichtet von langen Aktionssequenzen und Schwierigkeiten bei der Ausführung. Laut Diskussion zeigten beobachtete Kollisionen zwischen Armen, dass die vorhandenen Schutzmaßnahmen für einen sicheren autonomen Einsatz nicht ausreichten. Die Autoren fordern eine unabhängige Überwachung des physischen Abstands und von Kontakten sowie eine schnellere Steuerung auf niedriger Ebene und sicherere Wiederherstellungsverfahren. Dass eine Steuerung einige ungültige Bewegungen zurückweist, macht sie für sich genommen noch nicht zu einem vollständigen Sicherheitssystem.

Die Studie liefert ein konkretes Forschungsergebnis: Kontext kann einem allgemeinen Vision-Language-Modell helfen, Roboterwerkzeuge bei bestimmten Aufgaben zu steuern, und die Art des Kontexts ist entscheidend. Der begrenzte Umfang der Evaluierung, die Dauer der Durchläufe, unvollständige öffentliche Materialien zur Reproduktion und die berichteten Kollisionen sind jedoch weit entfernt von einem Beleg dafür, dass ein humanoider Haushaltsroboter offene Anfragen zuverlässig versteht und ausführt.

Quellen und weiterführende Informationen