AI-translated from English; not yet reviewed by a fluent editor.
# HomeBody conecta la memoria espacial de un humanoide con habilidades robóticas reutilizables
> Investigadores de Caltech y Stanford muestran a un Unitree G1 usando un mapa recordado de una cocina y habilidades reutilizables. La publicación presenta demostraciones seleccionadas, pero no resultados controlados, el artículo completo ni el código del robot.
By BIG CHANGE Editorial
Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

AI-generated conceptual illustration by BIG CHANGE.
Un equipo de Caltech y Stanford ha [presentado HomeBody](https://tml.stanford.edu/homebody/), un sistema de investigación en el que GPT Astra dirige un Unitree G1 por tareas de cocina mediante habilidades de navegación y manipulación. Primero, el robot explora la habitación y guarda dónde vio los objetos. En las demostraciones del equipo, recoge bolsas de café, desecha los envases indicados y recupera un frasco de medicamento de un cajón después de que el objeto haya salido de su campo de visión.
## El gran cambio
- **Qué ha cambiado:** HomeBody da a un modelo de visión y lenguaje acceso al registro espacial de una habitación explorada y a una interfaz común para las habilidades del robot. El modelo elige una habilidad y un objetivo; el software local planifica y ejecuta el movimiento, y luego comunica el resultado.
- **Por qué importa:** El modelo puede planificar entre distintas ubicaciones y usar la retroalimentación sin una nueva política de acciones entrenada para esta cocina. Las demostraciones del equipo muestran cómo combinar memoria y habilidades motoras existentes para tareas más largas.
- **Qué sigue abierto:** La publicación muestra demostraciones seleccionadas, no un estudio controlado de la tasa de éxito. Al 27 de septiembre, no estaban disponibles públicamente el artículo ni el código del robot, por lo que el rendimiento comunicado todavía no puede reproducirse de forma independiente a partir de la publicación.
## Cómo recuerda la habitación el robot
HomeBody comienza con una exploración. Según la [descripción del despliegue del proyecto](https://tml.stanford.edu/homebody/), el G1 recopila vídeo panorámico de un iPhone, observaciones de una cámara D435i, escaneos LiDAR, posturas de las articulaciones y puntos de ruta elegidos por el modelo. Un mapa SLAM basado en LiDAR proporciona la geometría medida de la habitación. Astra usa ese material para construir un gemelo digital en Nvidia Isaac Sim. El equipo alinea el mapa y la reconstrucción para que las vistas de cámara grabadas y la posición actual del robot compartan un sistema de coordenadas.
Esa preparación importa cuando la instrucción se refiere a un objeto que el robot no puede ver en ese momento. Para la solicitud del medicamento, el equipo dice que HomeBody recupera fotogramas clave de cámara almacenados para localizar el cajón; se desplaza hasta allí, lo abre y recoge el frasco. El modelo de la habitación ayuda con la navegación y el recuerdo de ubicaciones; la cámara en directo sigue guiando la interacción física final.
La [secuencia interactiva del recorrido por la cocina](https://tml.stanford.edu/homebody/) en la página del proyecto está identificada expresamente como ilustrativa y ocurre en la habitación reconstruida. La página presenta por separado vídeos del G1 realizando las tareas de cocina y etiqueta sus clips de navegación, agarre, colocación y apertura de cajones como imágenes reales del robot. Esos vídeos documentan las ejecuciones seleccionadas por el equipo, mientras que la recreación simulada explica la secuencia de planificación.
## De la decisión del modelo al movimiento
El modelo recibe la tarea, la vista actual de la cámara, el contexto del mapa, el estado de la pinza, las observaciones recuperadas y el resultado de la habilidad anterior. Envía una llamada estructurada que indica una habilidad y un objetivo. Para recoger un objeto, el objetivo es un punto de la imagen en una escala de 0 a 1000 y la elección de una mano. La percepción local segmenta el objeto, estima su profundidad a partir de imágenes estéreo y convierte la selección en un agarre tridimensional. Después, un planificador de brazos calcula y verifica una trayectoria de movimiento. La navegación usa, en cambio, un objetivo bidimensional y un punto de orientación en las coordenadas del mapa; la colocación utiliza un punto tridimensional de liberación. La apertura de cajones reúne la alineación con la manija, el enganche y el desplazamiento hacia atrás en una sola acción.
Las habilidades realizan pequeñas correcciones de forma local. El equipo describe el seguimiento visual durante la aproximación y los reintentos acotados cuando falla un agarre. Si la recuperación no funciona, la habilidad devuelve un motivo a Astra para que tome otra decisión. La marcha y el alcance se apoyan en AMO, un controlador preentrenado de cuerpo completo. La página dice que los comandos de brazo y mano funcionan a 250 Hz y que la política AMO se actualiza a 50 Hz. Astra se ejecuta de forma remota; la percepción, la planificación de movimiento y las habilidades corren en un portátil con GPU RTX 4090.
Astra decide *qué* acción probar y *dónde*; la biblioteca de habilidades y los controladores determinan *cómo* se mueve el G1.
## Qué demuestran las pruebas
La página del proyecto describe dos secuencias de tareas físicas en una cocina que el robot no conocía. En una, reúne bolsas de café y desecha los envases indicados de leche y zumo de naranja. En la otra, el G1 localiza un frasco de medicamento a partir de una solicitud poco específica, lo saca de un cajón, lo entrega y desecha un envase. Sus clips de habilidades muestran acciones individuales y reintentos grabados; la página dice que la mayoría de las vistas previas están aceleradas e identifica una secuencia de agarre del cajón con intentos continuos.
La publicación no indica el número de pruebas, la tasa de éxito de las tareas, una comparación con una política de acción de visión y lenguaje aprendida ni el tiempo y coste de cada ejecución completa en la cocina. Por tanto, respalda una demostración de arquitectura, no una afirmación medida de que el diseño funcione de forma fiable en otras cocinas. El [repositorio público enlazado](https://github.com/Stanford-TML/homebody) dice actualmente «Code coming soon» y la etiqueta «Paper» de la página del proyecto no enlaza a ningún manuscrito. El repositorio contiene el sitio web, ilustraciones y vídeos, pero no la implementación del robot ni archivos de evaluación. BIG CHANGE no ejecutó HomeBody ni probó un robot.
Un informe anterior de BIG CHANGE sobre [GPT-Policy](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents) examinó el artículo de otro equipo sobre el contexto de las acciones robóticas. Los materiales de HomeBody no indican que ese artículo forme parte de este sistema.
El equipo enumera limitaciones prácticas: crear el gemelo digital requiere tiempo de preparación y gasto en API; el razonamiento remoto de Astra provoca pausas entre habilidades; el alcance y la manipulación limitan lo que puede hacer el G1; y los servomotores de los dedos pueden sobrecalentarse durante un uso prolongado. El sistema local requiere el portátil RTX 4090, y las habilidades más exigentes pueden necesitar más capacidad de cálculo.
## Fuentes y lecturas adicionales
- [Página del proyecto HomeBody de los investigadores de Caltech y Stanford](https://tml.stanford.edu/homebody/) — Fuente primaria sobre el sistema, las demostraciones en la cocina, la recreación simulada, las interfaces de habilidades, el sistema de control y las limitaciones declaradas. La página está fechada en septiembre de 2026; sus vídeos seleccionados y descripciones son evidencia del equipo, no una evaluación independiente.
- [Repositorio público de HomeBody de Stanford TML](https://github.com/Stanford-TML/homebody) — Enlazado desde la página del proyecto. Al consultarlo el 27 de septiembre de 2026, el README decía que el código estaría disponible próximamente; el árbol público contenía recursos del sitio web, no la implementación del robot ni un artículo completo.
## Sources
- [Página del proyecto HomeBody de los investigadores de Caltech y Stanford](https://tml.stanford.edu/homebody/) — Relato primario de los autores sobre la arquitectura, las demostraciones físicas en la cocina, la recreación simulada identificada explícitamente como ilustrativa, las interfaces de habilidades, la configuración de cálculo y las limitaciones declaradas. Los vídeos y descripciones seleccionados no son una evaluación independiente controlada. La etiqueta «Paper» no enlaza a ningún manuscrito.
- [Repositorio público de HomeBody de Stanford TML](https://github.com/Stanford-TML/homebody) — El README dice que el código estará disponible próximamente. El árbol público contiene el sitio del proyecto y material multimedia, no la implementación del robot ni archivos de evaluación. La creación del repositorio no demuestra cuándo se realizaron los experimentos.
El boletín de BIG CHANGE
La visión global, a tu ritmo.
Historias recientes sobre IA y robótica, cambios que vale la pena observar e ideas prácticas para usar. Elige un informe diario, un resumen semanal o una perspectiva mensual.
Se envía a las 09:00, hora de Belgrado: a diario, los lunes o el primer día del mes. Tu primera edición llegará en el siguiente envío programado después de que confirmes.
Tu privacidad, tu elección.
El almacenamiento necesario ayuda a proteger el sitio y a recordar tus preferencias. Google Analytics opcional permanece desactivado hasta que lo autorices. Puedes leer todas las historias usando solo el almacenamiento necesario. Detalles de privacidad