Uma equipa da Caltech e de Stanford apresentou o HomeBody, um sistema de investigação no qual o GPT Astra orienta um Unitree G1 em tarefas de cozinha através de competências de navegação e manipulação. Primeiro, o robô explora o ambiente e regista onde viu os objetos. Nas demonstrações da equipa, reúne embalagens de café, deita fora embalagens específicas e retira de uma gaveta um frasco de medicamento que já saiu do campo de visão da câmara.
A grande mudança
- O que mudou: O HomeBody dá a um modelo de visão e linguagem acesso ao registo espacial de um ambiente explorado e a uma interface comum para competências robóticas. O modelo escolhe a competência e o alvo; o software local planeia e executa o movimento e, em seguida, comunica o resultado.
- Porque é importante: O modelo pode planear entre diferentes locais e usar as respostas do sistema sem precisar de uma nova política de ações treinada para aquela cozinha. As demonstrações da equipa mostram como a memória e as competências motoras existentes podem ser combinadas em tarefas mais longas.
- O que continua em aberto:O lançamento público mostra demonstrações selecionadas, não um estudo controlado da taxa de sucesso. A 27 de setembro, não havia um artigo completo nem código do robô disponíveis ao público; por isso, ainda não é possível reproduzir de forma independente o desempenho relatado com base no lançamento.
Como o robô se lembra do ambiente
O HomeBody começa pela exploração. Segundo a descrição de implementação do projeto, o G1 recolhe vídeos em grande angular de um iPhone, imagens da câmara D435i, varrimentos LiDAR, posições das articulações e pontos de referência escolhidos pelo modelo. Um mapa SLAM baseado em LiDAR fornece a geometria medida do ambiente. O Astra usa estes dados para criar um gémeo digital no NVIDIA Isaac Sim. A equipa alinha o mapa e a reconstrução para que as imagens gravadas pela câmara e a posição atual do robô partilhem o mesmo sistema de coordenadas.
Esta preparação é importante quando a instrução menciona um objeto que o robô não consegue ver naquele momento. No pedido do medicamento, a equipa afirma que o HomeBody recupera fotogramas-chave armazenados da câmara para localizar a gaveta, desloca-se até ela, abre-a e pega no frasco. O modelo do ambiente apoia a navegação e a recuperação de locais; para a interação física final, o robô continua a ser orientado pela câmara em tempo real.
A demonstração interativa da cozinha na página do projeto está explicitamente identificada como ilustrativa e decorre no ambiente reconstruído. A página apresenta separadamente vídeos do G1 a executar tarefas na cozinha e identifica os clipes de navegação, preensão, colocação de objetos e abertura de gavetas como gravações reais do robô. Estes vídeos documentam execuções selecionadas pela equipa, enquanto a simulação explica a sequência de planeamento.
Da decisão do modelo ao movimento
O modelo recebe a tarefa, a imagem atual da câmara, o contexto do mapa, o estado da garra, observações recuperadas e o resultado da competência anterior. Envia uma chamada estruturada que identifica a competência e o alvo. Para agarrar um objeto, o alvo é um ponto na imagem numa escala de 0 a 1 000, juntamente com a escolha de uma das mãos. O sistema local de perceção segmenta o objeto, estima a sua profundidade a partir de imagens estéreo e transforma a seleção numa posição tridimensional de preensão. Em seguida, um planeador de braço calcula e verifica uma trajetória de movimento. A navegação recebe um destino bidimensional e um ponto de orientação nas coordenadas do mapa; para colocar um objeto, recebe um ponto tridimensional de largada. A abertura de gavetas combina o alinhamento com o puxador, o encaixe e o movimento para trás numa única ação.
As competências fazem pequenos ajustes localmente. A equipa descreve o acompanhamento visual durante a aproximação e novas tentativas limitadas quando a preensão falha. Se a recuperação não resultar, a competência envia um motivo ao Astra para que este tome outra decisão. Para andar e alcançar objetos, o sistema usa o controlador de corpo inteiro AMO, pré-treinado. A página diz que os comandos do braço e da mão são executados a 250 Hz e que a política AMO é atualizada a 50 Hz. O Astra funciona remotamente; a perceção, o planeamento de movimentos e as competências são executados num computador portátil com uma GPU RTX 4090.
O Astra escolhe qual ação tentar e onde; a biblioteca de competências e os controladores determinam como o G1 se movimenta. Segundo a equipa, as demonstrações na cozinha não usaram dados de treino específicos daquele ambiente nem aprendizagem adicional da política. O controlador pré-treinado existente e uma reconstrução substancial do ambiente continuam a fazer parte da configuração.
O que demonstram os vídeos
A página do projeto descreve duas sequências de tarefas físicas numa cozinha que o robô não conhecia. Numa delas, reúne embalagens de café e deita fora embalagens indicadas de leite e sumo de laranja. Na outra, o G1 localiza um frasco de medicamento a partir de um pedido pouco detalhado, retira-o de uma gaveta, entrega-o e deita fora uma embalagem. Os clipes das competências mostram ações individuais e novas tentativas registadas; a página diz que a maioria das pré-visualizações está acelerada e identifica uma sequência de recolha de um objeto na gaveta com tentativas repetidas contínuas.
O lançamento não indica o número de testes, uma taxa de sucesso das tarefas, uma comparação com uma política de ação visual e linguística aprendida, nem o tempo e o custo de cada execução completa na cozinha. Por isso, sustenta uma demonstração de arquitetura, não uma alegação medida de que o projeto funcione de forma fiável noutras cozinhas. O repositório público vinculado informa atualmente «Código em breve», e a etiqueta «Paper» na página do projeto não conduz a um manuscrito. O repositório contém o site, ilustrações e vídeos, mas não uma implementação do robô nem ficheiros de avaliação. A BIG CHANGE não executou o HomeBody nem testou um robô.
O relatório anterior da BIG CHANGE sobre o GPT-Policy examinou o artigo de outra equipa sobre contexto para ações robóticas. Os materiais do HomeBody não identificam esse artigo como parte do sistema.
A equipa enumera limitações práticas: criar o gémeo digital exige tempo de preparação e despesas de API; o raciocínio remoto do Astra gera pausas entre competências; o alcance e a manipulação limitam o que o G1 consegue fazer; e os servos dos dedos podem sobreaquecer durante uma operação prolongada. O sistema local requer um computador portátil com RTX 4090, e as competências mais exigentes podem precisar de maior capacidade de computação.
Fontes e leituras complementares
- Página do projeto HomeBody, dos pesquisadores da Caltech e de Stanford — Relato primário do sistema, das demonstrações na cozinha, da simulação, das interfaces de competências, da pilha de controlo e das limitações declaradas. A página é datada de setembro de 2026; os vídeos selecionados e as respetivas descrições são provas apresentadas pela equipa, não uma avaliação independente.
- Repositório público do HomeBody, da Stanford TML — Ligado a partir da página do projeto. Numa consulta realizada a 27 de setembro de 2026, o README dizia que o código seria publicado em breve; a árvore pública continha recursos do site, não a implementação do robô nem um artigo completo.



