Uma equipe da Caltech e de Stanford apresentou o HomeBody, um sistema de pesquisa no qual o GPT Astra orienta um Unitree G1 em tarefas de cozinha por meio de habilidades de navegação e manipulação. Primeiro, o robô explora o ambiente e registra onde viu os objetos. Nas demonstrações da equipe, ele reúne pacotes de café, descarta caixas específicas e retira de uma gaveta um frasco de medicamento que já saiu do campo de visão da câmera.

A grande mudança

  • O que mudou: O HomeBody dá a um modelo de visão e linguagem acesso ao registro espacial de um ambiente explorado e a uma interface comum para habilidades robóticas. O modelo escolhe a habilidade e o alvo; o software local planeja e executa o movimento e, em seguida, informa o resultado.
  • Por que isso importa: O modelo pode planejar entre diferentes lugares e usar feedback sem precisar de uma nova política de ações treinada para essa cozinha. As demonstrações da equipe mostram como memória e habilidades motoras existentes podem ser combinadas em tarefas mais longas.
  • O que continua em aberto: O lançamento público mostra demonstrações selecionadas, não um estudo controlado de taxa de sucesso. Em 27 de setembro, não havia artigo completo nem código do robô disponível ao público; portanto, ainda não é possível reproduzir de forma independente o desempenho relatado com base no lançamento.

Como o robô se lembra do ambiente

O HomeBody começa pela exploração. Segundo a descrição de implementação do projeto, o G1 coleta vídeos em grande angular de um iPhone, observações da câmera D435i, varreduras LiDAR, posições das articulações e pontos de referência escolhidos pelo modelo. Um mapa SLAM baseado em LiDAR fornece a geometria medida do ambiente. O Astra usa esses dados para criar um gêmeo digital no Nvidia Isaac Sim. A equipe alinha o mapa e a reconstrução para que as imagens gravadas da câmera e a posição atual do robô compartilhem o mesmo sistema de coordenadas.

Essa preparação importa quando a instrução menciona um objeto que o robô não consegue ver naquele momento. No pedido do medicamento, a equipe diz que o HomeBody recupera quadros-chave armazenados da câmera para localizar a gaveta, vai até lá, abre-a e pega o frasco. O modelo do ambiente apoia a navegação e a recuperação de locais; para a interação física final, a câmera ao vivo ainda orienta o robô.

A demonstração interativa da cozinha na página do projeto está explicitamente identificada como ilustrativa e ocorre no ambiente reconstruído. A página apresenta separadamente vídeos do G1 executando tarefas na cozinha e identifica os clipes de navegação, pegar, colocar e abrir gavetas como filmagens reais do robô. Esses vídeos documentam execuções selecionadas pela equipe, enquanto a simulação explica a sequência de planejamento.

Da decisão do modelo ao movimento

O modelo recebe a tarefa, a imagem atual da câmera, o contexto do mapa, o estado da garra, observações recuperadas e o resultado da habilidade anterior. Ele envia uma chamada estruturada que identifica a habilidade e o alvo. Para pegar um objeto, o alvo é um ponto na imagem em uma escala de 0 a 1.000, junto com a escolha de uma das mãos. A percepção local segmenta o objeto, estima sua profundidade com imagens estéreo e transforma a seleção em uma pegada tridimensional. Em seguida, um planejador de braço calcula e verifica uma trajetória de movimento. A navegação recebe um destino bidimensional e um ponto para orientar o robô nas coordenadas do mapa; colocar um objeto recebe um ponto tridimensional de soltura. A abertura de gavetas reúne o alinhamento com o puxador, o encaixe e o movimento para trás em uma única ação.

As habilidades fazem pequenos ajustes localmente. A equipe descreve rastreamento visual durante a aproximação e novas tentativas limitadas quando a pegada falha. Se a recuperação não dá certo, a habilidade envia um motivo ao Astra para que tome outra decisão. Para andar e alcançar objetos, o sistema usa o controlador de corpo inteiro AMO, pré-treinado. A página diz que os comandos de braço e mão são executados a 250 Hz e que a política AMO é atualizada a 50 Hz. O Astra funciona remotamente; percepção, planejamento de movimentos e habilidades são executados em um laptop com GPU RTX 4090.

O Astra escolhe qual ação tentar e onde; a biblioteca de habilidades e os controladores determinam como o G1 se movimenta. Segundo a equipe, as demonstrações na cozinha não usaram dados de treinamento específicos daquele ambiente nem aprendizado adicional da política. O controle pré-treinado já existente e uma reconstrução substancial do ambiente continuam fazendo parte da configuração.

O que as demonstrações comprovam

A página do projeto descreve duas sequências de tarefas físicas em uma cozinha que o robô não conhecia. Em uma, ele reúne pacotes de café e joga fora caixas indicadas de leite e suco de laranja. Na outra, o G1 localiza um frasco de medicamento a partir de um pedido sem muitos detalhes, retira-o de uma gaveta, entrega-o e descarta uma caixa. Os clipes das habilidades mostram ações individuais e novas tentativas registradas; a página diz que a maioria das prévias está acelerada e identifica uma sequência de pegar um item na gaveta com tentativas repetidas contínuas.

O lançamento não informa o número de testes, uma taxa de sucesso das tarefas, uma comparação com uma política de ação visual e linguística aprendida nem o tempo e custo de cada execução completa na cozinha. Portanto, sustenta uma demonstração de arquitetura, não uma alegação medida de que o projeto funcione de forma confiável em outras cozinhas. O repositório público vinculado atualmente informa “Código em breve”, e o rótulo “Paper” na página do projeto não leva a um manuscrito. O repositório contém o site, ilustrações e vídeos, mas não uma implementação do robô nem arquivos de avaliação. A BIG CHANGE não executou o HomeBody nem testou um robô.

O relatório anterior da BIG CHANGE sobre o GPT-Policy examinou o artigo de outra equipe sobre contexto para ações robóticas. Os materiais do HomeBody não identificam esse artigo como parte do sistema.

A equipe lista limitações práticas: criar o gêmeo digital exige tempo de preparação e gastos com API; o raciocínio remoto do Astra gera pausas entre habilidades; o alcance e a manipulação limitam o que o G1 consegue fazer; e os servos dos dedos podem superaquecer durante uma operação prolongada. O sistema local requer um laptop com RTX 4090, e habilidades mais exigentes podem precisar de mais capacidade computacional.

Fontes e leituras complementares

  • Página do projeto HomeBody, dos pesquisadores da Caltech e de Stanford — Relato primário do sistema, das demonstrações na cozinha, da simulação, das interfaces de habilidades, da pilha de controle e das limitações declaradas. A página é datada de setembro de 2026; os vídeos e as descrições selecionados são evidências da equipe, não uma avaliação independente.
  • Repositório público do HomeBody, da Stanford TML — Vinculado pela página do projeto. Em consulta realizada em 27 de setembro de 2026, o README dizia que o código seria publicado em breve; a árvore pública continha recursos do site, não a implementação do robô nem um artigo completo.