AI-translated from English; not yet reviewed by a fluent editor.
# HomeBody relie mémoire spatiale d’un humanoïde et compétences robotiques réutilisables
> Des chercheurs de Caltech et Stanford présentent un robot Unitree G1 utilisant une carte mémorisée de cuisine et des compétences réutilisables. La publication montre certaines démonstrations, mais ne fournit ni résultats contrôlés, ni article scientifique complet, ni code du robot.
By BIG CHANGE Editorial
Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

AI-generated conceptual illustration by BIG CHANGE.
Une équipe de Caltech et Stanford a [présenté HomeBody](https://tml.stanford.edu/homebody/), un système de recherche dans lequel GPT Astra dirige un Unitree G1 dans des tâches de cuisine en faisant appel à des compétences de navigation et de manipulation. Le robot explore d’abord la pièce et mémorise l’emplacement des objets qu’il a vus. Dans les démonstrations de l’équipe, il rassemble des sachets de café, jette les cartons indiqués et récupère dans un tiroir un flacon de médicament qui a quitté le champ de sa caméra.
## Le changement majeur
- **Ce qui a changé :** HomeBody donne à un modèle de vision et de langage accès à une représentation spatiale de la pièce explorée ainsi qu’à une interface commune pour les compétences du robot. Le modèle choisit une compétence et une cible ; un logiciel local planifie le mouvement, l’exécute puis en communique le résultat.
- **Pourquoi c’est important :** Le modèle peut planifier des déplacements entre différents endroits et exploiter les retours sans qu’une nouvelle politique d’action ait été entraînée pour cette cuisine. Les démonstrations de l’équipe montrent comment combiner mémoire et compétences motrices existantes pour accomplir des tâches plus longues.
- **Ce qui reste à vérifier :** La publication montre une sélection de démonstrations, et non une étude contrôlée du taux de réussite. Au 27 septembre, aucun article scientifique complet ni code du robot n’étaient accessibles au public ; les résultats présentés ne peuvent donc pas encore être reproduits de manière indépendante à partir de cette publication.
## Comment le robot mémorise la pièce
HomeBody commence par explorer. Selon la [description du déploiement du projet](https://tml.stanford.edu/homebody/), le G1 recueille des vidéos grand angle prises avec un iPhone, des observations de caméras D435i, des balayages LiDAR, des poses articulaires et des points de passage choisis par le modèle. Une carte SLAM fondée sur le LiDAR fournit la géométrie mesurée de la pièce. Astra utilise ces éléments pour créer un jumeau numérique dans Nvidia Isaac Sim. L’équipe aligne la carte et la reconstruction afin que les vues enregistrées de la caméra et la position actuelle du robot partagent le même repère de coordonnées.
Cette préparation est utile lorsque la consigne porte sur un objet que le robot ne peut pas voir à cet instant. Pour la demande concernant le médicament, l’équipe explique que HomeBody retrouve des images clés enregistrées par la caméra afin de localiser le tiroir, s’y rend, l’ouvre et prend le flacon. Le modèle de la pièce aide à naviguer et à retrouver les emplacements ; la caméra en direct guide toujours l’interaction physique finale.
La [simulation interactive de la cuisine](https://tml.stanford.edu/homebody/) présentée sur la page du projet est explicitement qualifiée d’illustrative et se déroule dans la pièce reconstruite. La page présente séparément des vidéos du G1 exécutant les tâches de cuisine et indique que les extraits de navigation, de prise, de pose et d’ouverture de tiroir montrent de véritables images du robot. Ces vidéos documentent les essais sélectionnés par l’équipe, tandis que la reconstitution simulée explique la séquence de planification.
## De la décision du modèle au mouvement
Le modèle reçoit la tâche, l’image actuelle de la caméra, le contexte de la carte, l’état de la pince, les observations retrouvées et le résultat de la compétence précédente. Il envoie un appel structuré qui indique une compétence et une cible. Pour saisir un objet, la cible est un point de l’image sur une échelle de 0 à 1 000, assorti du choix de la main. La perception locale segmente l’objet, estime sa profondeur à partir d’images stéréoscopiques et transforme la sélection en une prise en 3D. Un planificateur du bras calcule ensuite une trajectoire et la vérifie. La navigation prend plutôt un objectif en 2D et un point d’orientation dans les coordonnées de la carte ; la pose utilise un point de relâchement en 3D. L’ouverture d’un tiroir regroupe l’alignement avec la poignée, son accrochage et le recul en une seule action.
Les compétences effectuent localement de petites corrections. L’équipe décrit un suivi visuel pendant l’approche et un nombre limité de nouvelles tentatives lorsqu’une prise échoue. Si la récupération échoue, la compétence renvoie une raison à Astra pour qu’il prenne une nouvelle décision. La marche et l’extension du bras s’appuient sur AMO, un contrôleur corps entier préentraîné. La page indique que les commandes des bras et des mains sont exécutées à 250 Hz et que la politique AMO est mise à jour à 50 Hz. Astra fonctionne à distance ; la perception, la planification des mouvements et les compétences s’exécutent sur un ordinateur portable équipé d’un GPU RTX 4090.
Astra choisit *quelle* action tenter et *où* ; la bibliothèque de compétences et les contrôleurs déterminent *comment* le G1 se déplace. L’équipe indique que les démonstrations dans la cuisine n’ont utilisé ni données d’entraînement propres à l’environnement ni apprentissage supplémentaire de la politique. Le dispositif comprend tout de même un contrôleur préentraîné et une reconstruction détaillée de la pièce.
## Ce que les démonstrations permettent d’établir
La page du projet décrit deux séquences de tâches physiques dans une cuisine jamais vue auparavant. Dans la première, le robot regroupe des sachets de café et jette les cartons de lait et de jus d’orange indiqués. Dans l’autre, le G1 localise un flacon de médicament à partir d’une consigne imprécise, le sort d’un tiroir, le tend puis jette un carton. Les extraits de compétences montrent des actions individuelles et des tentatives répétées enregistrées ; la page précise que la plupart des aperçus sont accélérés et signale une séquence de prise dans un tiroir comportant des tentatives continues.
La publication ne donne ni nombre d’essais, ni taux de réussite des tâches, ni comparaison avec une politique apprise de vision-langage-action, ni durée et coût de chaque tâche de cuisine accomplie. Elle démontre donc une architecture, mais ne prouve pas que cette conception fonctionne de façon fiable dans d’autres cuisines. Le [dépôt public lié au projet](https://github.com/Stanford-TML/homebody) indique actuellement « Code coming soon » et l’étiquette « Paper » de la page du projet ne renvoie à aucun manuscrit. Le dépôt contient le site, des illustrations et des vidéos, mais ni l’implémentation du robot ni des fichiers d’évaluation. BIG CHANGE n’a pas exécuté HomeBody ni testé de robot.
Le précédent article de BIG CHANGE sur [GPT-Policy](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents) examinait l’article d’une autre équipe sur le contexte des actions robotiques. Les documents de HomeBody ne présentent pas cet article comme faisant partie du système.
L’équipe énumère plusieurs contraintes pratiques : la création du jumeau numérique prend du temps de configuration et entraîne des frais d’API ; le raisonnement à distance d’Astra introduit des pauses entre les compétences ; la portée et la manipulation limitent ce que le G1 peut faire ; les servomoteurs des doigts peuvent surchauffer en cas d’utilisation prolongée. Le système local nécessite un ordinateur portable équipé d’un RTX 4090, et les compétences plus lourdes peuvent demander davantage de calcul.
## Sources et lectures complémentaires
- [Page du projet HomeBody des chercheurs de Caltech et Stanford](https://tml.stanford.edu/homebody/) — Présentation primaire du système, des démonstrations en cuisine, de la reconstitution simulée, des interfaces de compétences, du système de contrôle et des limites déclarées. Datée de septembre 2026, cette page présente des vidéos et descriptions choisies par l’équipe, et non une évaluation indépendante.
- [Dépôt public HomeBody de Stanford TML](https://github.com/Stanford-TML/homebody) — Lien fourni par la page du projet. Au 27 septembre 2026, le fichier README indique que le code sera publié ultérieurement ; l’arborescence publique contient les ressources du site plutôt que l’implémentation du robot ou un article complet.
## Sources
- [Page du projet HomeBody des chercheurs de Caltech et Stanford](https://tml.stanford.edu/homebody/) — Présentation des auteurs sur l’architecture, les démonstrations physiques dans la cuisine, la reconstitution simulée explicitement illustrative, les interfaces de compétences, la configuration de calcul et les limites annoncées. Les séquences vidéo sélectionnées et les descriptions ne constituent pas une évaluation indépendante contrôlée. L’étiquette « Paper » ne renvoie à aucun manuscrit.
- [Dépôt public HomeBody de Stanford TML](https://github.com/Stanford-TML/homebody) — Le fichier README indique que le code sera publié ultérieurement. L’arborescence publique contient le site du projet et ses médias, mais ni l’implémentation du robot ni des fichiers d’évaluation. La création du dépôt ne prouve pas la date des expériences.
La newsletter BIG CHANGE
Prendre du recul, à votre rythme.
Articles récents sur l’IA et la robotique, évolutions à surveiller et idées pratiques à utiliser. Choisissez un briefing quotidien, une synthèse hebdomadaire ou une analyse mensuelle.
Envoyée à 09:00, heure de Belgrade : chaque jour, le lundi ou le premier du mois. Votre première édition arrivera lors du prochain envoi programmé après votre confirmation.
Votre vie privée, votre choix.
Le stockage nécessaire contribue à la sécurité du site et mémorise vos choix. Google Analytics facultatif reste désactivé tant que vous ne l’autorisez pas. Vous pouvez lire tous les articles avec le seul stockage nécessaire. Détails sur la confidentialité