DIE WELT BLEIBT NICHT STEHEN.RSS
BIG CHANGE.

Markdown-Ausgabe

AI-translated from English; not yet reviewed by a fluent editor.

# HomeBody verbindet räumliches Gedächtnis mit wiederverwendbaren Roboterfähigkeiten für einen Humanoiden

> Forschende von Caltech und Stanford zeigen einen Unitree G1, der eine gespeicherte Küchenkarte und wiederverwendbare Fähigkeiten nutzt. Die Veröffentlichung enthält ausgewählte Vorführungen, aber keine kontrollierten Ergebnisse, keine vollständige Studie und keinen Roboter-Code.

By BIG CHANGE Editorial

Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

![Conceptual charcoal illustration of a white humanoid robot walking toward a closed drawer in a light wood kitchen.](https://bigchange.ai/api/media/file/homebody-kitchen-g1-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Ein Team von Caltech und Stanford hat [HomeBody vorgestellt](https://tml.stanford.edu/homebody/): ein Forschungssystem, in dem GPT Astra einen Unitree G1 durch Küchenaufgaben steuert, indem es Navigations- und Manipulationsfähigkeiten aufruft. Der Roboter erkundet zunächst den Raum und speichert, wo er Gegenstände gesehen hat. In den Vorführungen des Teams sammelt er Kaffeepackungen, entsorgt bestimmte Kartons und holt eine Medikamentenflasche aus einer Schublade, nachdem sie aus seinem Kamerabild verschwunden ist.

## Die große Änderung

- **Was sich geändert hat:** HomeBody gibt einem Vision-Language-Modell Zugriff auf einen räumlichen Datensatz eines erkundeten Raums und eine gemeinsame Schnittstelle für Roboterfähigkeiten. Das Modell wählt eine Fähigkeit und ein Ziel; lokale Software plant die Bewegung, führt sie aus und meldet anschließend das Ergebnis.
- **Warum das wichtig ist:** Das Modell kann Aufgaben über verschiedene Orte hinweg planen und Rückmeldungen nutzen, ohne dass für diese Küche eine neue Bewegungssteuerung trainiert wurde. Die Vorführungen des Teams zeigen, wie Gedächtnis und bestehende Bewegungsfähigkeiten für längere Aufgaben kombiniert werden können.
- **Was noch offen ist:** Die öffentliche Veröffentlichung zeigt ausgewählte Vorführungen, keine kontrollierte Untersuchung der Erfolgsquote. Zum Stand vom 27. September ist weder eine Studie noch der Roboter-Code öffentlich verfügbar; die berichtete Leistung lässt sich daher anhand der Veröffentlichung noch nicht unabhängig reproduzieren.

## Wie sich der Roboter an den Raum erinnert

HomeBody beginnt mit einer Erkundung. Der [Beschreibung der Bereitstellung des Projekts](https://tml.stanford.edu/homebody/) zufolge erfasst der G1 Weitwinkelvideos mit einem iPhone, Beobachtungen einer D435i-Kamera, LiDAR-Scans, Gelenkpositionen und vom Modell ausgewählte Wegpunkte. Eine LiDAR-basierte SLAM-Karte liefert die gemessene Raumgeometrie. Astra nutzt dieses Material, um in Nvidia Isaac Sim einen digitalen Zwilling zu erstellen. Das Team richtet Karte und Rekonstruktion so aus, dass aufgezeichnete Kamerabilder und die aktuelle Position des Roboters dasselbe Koordinatensystem verwenden.

Diese Vorbereitung ist wichtig, wenn sich eine Anweisung auf einen Gegenstand bezieht, den der Roboter gerade nicht sehen kann. Bei der Bitte um das Medikament ruft HomeBody den Angaben des Teams zufolge gespeicherte Kameraschlüsselbilder ab, um die Schublade zu finden. Der Roboter fährt hin, öffnet sie und nimmt die Flasche heraus. Das Raummodell unterstützt Navigation und Ortsgedächtnis; die Live-Kamera steuert weiterhin die abschließende physische Interaktion.

Der [interaktive Durchlauf durch die Küche](https://tml.stanford.edu/homebody/) auf der Projektseite ist ausdrücklich als Illustration gekennzeichnet und findet im rekonstruierten Raum statt. Daneben zeigt die Seite Videos, in denen der G1 die Küchenaufgaben tatsächlich ausführt. Die Clips zu Navigation, Greifen, Ablegen und Öffnen der Schublade sind als echte Roboteraufnahmen gekennzeichnet. Sie dokumentieren ausgewählte Durchläufe des Teams; die simulierte Wiedergabe veranschaulicht die Abfolge der Planung.

## Von der Modellentscheidung zur Bewegung

Das Modell erhält die Aufgabe, das aktuelle Kamerabild, Kartenkontext, den Greiferzustand, abgerufene Beobachtungen und das Ergebnis der vorherigen Fähigkeit. Es sendet einen strukturierten Aufruf mit der gewünschten Fähigkeit und dem Ziel. Beim Greifen besteht das Ziel aus einem Bildpunkt auf einer Skala von 0 bis 1000 und der Wahl einer Hand. Die lokale Wahrnehmung segmentiert das Objekt, schätzt seine Tiefe anhand von Stereobildern und setzt die Auswahl in einen dreidimensionalen Griff um. Anschließend berechnet ein Armplaner einen Bewegungsweg und prüft ihn. Für die Navigation werden ein zweidimensionales Ziel und eine Blickrichtung in Kartenkoordinaten verwendet; beim Ablegen ein dreidimensionaler Absetzpunkt. Die Schubladenöffnung bündelt die Ausrichtung am Griff, das Einhaken und das Rückwärtsgehen in einer Aktion.

Die Fähigkeiten nehmen kleine Korrekturen lokal vor. Das Team beschreibt visuelle Verfolgung während der Annäherung und begrenzte Wiederholungsversuche, wenn ein Griff misslingt. Schlägt die Wiederherstellung fehl, meldet die Fähigkeit einen Grund an Astra zurück, damit das Modell eine neue Entscheidung treffen kann. Gehen und Greifen stützen sich auf AMO, eine vortrainierte Ganzkörpersteuerung. Laut Projektseite laufen Befehle für Arme und Hände mit 250 Hz und die AMO-Steuerung wird mit 50 Hz aktualisiert. Astra läuft entfernt; Wahrnehmung, Bewegungsplanung und Roboterfähigkeiten laufen auf einem Laptop mit RTX-4090-GPU.

Astra entscheidet, *welche* Aktion sie versucht und *wo*; die Fähigkeitsbibliothek und die Steuerungen bestimmen, *wie* sich der G1 bewegt. Nach Angaben des Teams kamen bei den Küchendemonstrationen weder aufgabenspezifische Trainingsdaten für die Umgebung noch zusätzliches Richtlinienlernen zum Einsatz. Vortrainierte Steuerung und eine umfangreiche Rekonstruktion des Raums sind dennoch Teil des Aufbaus.

## Was die Vorführungen belegen

Die Projektseite beschreibt zwei physische Aufgabenfolgen in einer zuvor unbekannten Küche. In der einen sammelt der Roboter Kaffeepackungen zusammen und wirft bestimmte Milch- und Orangensaftkartons weg. In der anderen findet der G1 eine Medikamentenflasche anhand einer ungenauen Anfrage, holt sie aus einer Schublade, reicht sie weiter und entsorgt einen Karton. Clips seiner Fähigkeiten zeigen einzelne Aktionen und protokollierte Wiederholungsversuche. Laut Seite laufen die meisten Vorschauen beschleunigt; bei einer Sequenz zum Greifen aus der Schublade werden fortlaufende erneute Versuche kenntlich gemacht.

Die Veröffentlichung nennt weder die Zahl der Durchläufe noch eine Erfolgsquote, einen Vergleich mit einer trainierten Vision-Language-Action-Richtlinie oder Zeit- und Kostenangaben pro abgeschlossener Küchenaufgabe. Sie belegt daher eine Architekturvorführung, aber keine gemessene Zuverlässigkeit in anderen Küchen. Das [verlinkte öffentliche Repository](https://github.com/Stanford-TML/homebody) enthält derzeit den Hinweis „Code coming soon“. Die Rubrik „Paper“ auf der Projektseite führt zu keinem Manuskript. Das Repository enthält die Website, Illustrationen und Videos, aber weder die Roboterimplementierung noch Evaluierungsdateien. BIG CHANGE hat HomeBody nicht ausgeführt und keinen Roboter getestet.

Der frühere [GPT-Policy-Bericht von BIG CHANGE](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents) untersuchte die Arbeit eines anderen Teams zum Kontext für Roboteraktionen. Die HomeBody-Materialien bezeichnen diese Studie nicht als Teil des Systems.

Das Team nennt praktische Einschränkungen: Der Aufbau des digitalen Zwillings erfordert Einrichtungszeit und API-Ausgaben; Astras entferntes Schlussfolgern verursacht Pausen zwischen den Fähigkeiten; Reichweite und Greifmöglichkeiten begrenzen den G1; und die Fingerservos können sich bei längerem Betrieb überhitzen. Der lokale Systemstapel erfordert den RTX-4090-Laptop; anspruchsvollere Fähigkeiten benötigen möglicherweise mehr Rechenleistung.

## Quellen und weiterführende Informationen

- [Projektseite zu HomeBody von Forschenden aus Caltech und Stanford](https://tml.stanford.edu/homebody/) – Primärquelle zum System, zu Küchendemonstrationen, simulierter Wiedergabe, Schnittstellen der Fähigkeiten, Steuerungsstapel und genannten Einschränkungen. Die Seite ist auf September 2026 datiert. Die ausgewählten Videos und Beschreibungen stammen vom Team und sind keine unabhängige Bewertung.
- [Öffentliches HomeBody-Repository von Stanford TML](https://github.com/Stanford-TML/homebody) – von der Projektseite verlinkt. Zum Stand vom 27. September 2026 kündigt die README den Code für später an; der öffentliche Verzeichnisbaum enthält Website-Materialien statt der Roboterimplementierung oder einer vollständigen Studie.

## Sources

- [Projektseite zu HomeBody von Forschenden aus Caltech und Stanford](https://tml.stanford.edu/homebody/) — Primärbericht der Autoren zu Architektur, physischen Küchendemonstrationen, ausdrücklich illustrativem simuliertem Durchlauf, Schnittstellen der Fähigkeiten, Rechenumgebung und genannten Einschränkungen. Die ausgewählten Aufnahmen und Beschreibungen sind keine kontrollierte unabhängige Bewertung. Die Rubrik „Paper“ enthält keinen verlinkten Text der Studie.
- [Öffentliches HomeBody-Repository von Stanford TML](https://github.com/Stanford-TML/homebody) — Die README kündigt den Code für später an. Der öffentliche Verzeichnisbaum enthält die Projektwebsite und Medien, aber weder die Roboterimplementierung noch Evaluierungsdateien. Die Erstellung des Repositorys belegt nicht, wann die Experimente stattgefunden haben.
Der Newsletter von BIG CHANGE

Das große Ganze. In Ihrem Tempo.

Aktuelle Storys über KI und Robotik, beobachtenswerte Veränderungen und praktische Ideen zur Anwendung. Wählen Sie ein tägliches Briefing, eine wöchentliche Zusammenfassung oder eine monatliche Perspektive.