AI-translated from English; not yet reviewed by a fluent editor.
# HomeBody conecta a memória espacial de um humanoide a habilidades robóticas reutilizáveis
> Pesquisadores da Caltech e de Stanford mostram um Unitree G1 usando um mapa memorizado de uma cozinha e habilidades reutilizáveis. O lançamento apresenta demonstrações selecionadas, mas não resultados controlados, artigo completo ou código do robô.
By BIG CHANGE Editorial
Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

AI-generated conceptual illustration by BIG CHANGE.
Uma equipe da Caltech e de Stanford [apresentou o HomeBody](https://tml.stanford.edu/homebody/), um sistema de pesquisa no qual o GPT Astra orienta um Unitree G1 em tarefas de cozinha por meio de habilidades de navegação e manipulação. Primeiro, o robô explora o ambiente e registra onde viu os objetos. Nas demonstrações da equipe, ele reúne pacotes de café, descarta caixas específicas e retira de uma gaveta um frasco de medicamento que já saiu do campo de visão da câmera.
## A grande mudança
- **O que mudou:** O HomeBody dá a um modelo de visão e linguagem acesso ao registro espacial de um ambiente explorado e a uma interface comum para habilidades robóticas. O modelo escolhe a habilidade e o alvo; o software local planeja e executa o movimento e, em seguida, informa o resultado.
- **Por que isso importa:** O modelo pode planejar entre diferentes lugares e usar feedback sem precisar de uma nova política de ações treinada para essa cozinha. As demonstrações da equipe mostram como memória e habilidades motoras existentes podem ser combinadas em tarefas mais longas.
- **O que continua em aberto:** O lançamento público mostra demonstrações selecionadas, não um estudo controlado de taxa de sucesso. Em 27 de setembro, não havia artigo completo nem código do robô disponível ao público; portanto, ainda não é possível reproduzir de forma independente o desempenho relatado com base no lançamento.
## Como o robô se lembra do ambiente
O HomeBody começa pela exploração. Segundo a [descrição de implementação do projeto](https://tml.stanford.edu/homebody/), o G1 coleta vídeos em grande angular de um iPhone, observações da câmera D435i, varreduras LiDAR, posições das articulações e pontos de referência escolhidos pelo modelo. Um mapa SLAM baseado em LiDAR fornece a geometria medida do ambiente. O Astra usa esses dados para criar um gêmeo digital no Nvidia Isaac Sim. A equipe alinha o mapa e a reconstrução para que as imagens gravadas da câmera e a posição atual do robô compartilhem o mesmo sistema de coordenadas.
Essa preparação importa quando a instrução menciona um objeto que o robô não consegue ver naquele momento. No pedido do medicamento, a equipe diz que o HomeBody recupera quadros-chave armazenados da câmera para localizar a gaveta, vai até lá, abre-a e pega o frasco. O modelo do ambiente apoia a navegação e a recuperação de locais; para a interação física final, a câmera ao vivo ainda orienta o robô.
A [demonstração interativa da cozinha](https://tml.stanford.edu/homebody/) na página do projeto está explicitamente identificada como ilustrativa e ocorre no ambiente reconstruído. A página apresenta separadamente vídeos do G1 executando tarefas na cozinha e identifica os clipes de navegação, pegar, colocar e abrir gavetas como filmagens reais do robô. Esses vídeos documentam execuções selecionadas pela equipe, enquanto a simulação explica a sequência de planejamento.
## Da decisão do modelo ao movimento
O modelo recebe a tarefa, a imagem atual da câmera, o contexto do mapa, o estado da garra, observações recuperadas e o resultado da habilidade anterior. Ele envia uma chamada estruturada que identifica a habilidade e o alvo. Para pegar um objeto, o alvo é um ponto na imagem em uma escala de 0 a 1.000, junto com a escolha de uma das mãos. A percepção local segmenta o objeto, estima sua profundidade com imagens estéreo e transforma a seleção em uma pegada tridimensional. Em seguida, um planejador de braço calcula e verifica uma trajetória de movimento. A navegação recebe um destino bidimensional e um ponto para orientar o robô nas coordenadas do mapa; colocar um objeto recebe um ponto tridimensional de soltura. A abertura de gavetas reúne o alinhamento com o puxador, o encaixe e o movimento para trás em uma única ação.
As habilidades fazem pequenos ajustes localmente. A equipe descreve rastreamento visual durante a aproximação e novas tentativas limitadas quando a pegada falha. Se a recuperação não dá certo, a habilidade envia um motivo ao Astra para que tome outra decisão. Para andar e alcançar objetos, o sistema usa o controlador de corpo inteiro AMO, pré-treinado. A página diz que os comandos de braço e mão são executados a 250 Hz e que a política AMO é atualizada a 50 Hz. O Astra funciona remotamente; percepção, planejamento de movimentos e habilidades são executados em um laptop com GPU RTX 4090.
O Astra escolhe *qual* ação tentar e *onde*; a biblioteca de habilidades e os controladores determinam *como* o G1 se movimenta. Segundo a equipe, as demonstrações na cozinha não usaram dados de treinamento específicos daquele ambiente nem aprendizado adicional da política. O controle pré-treinado já existente e uma reconstrução substancial do ambiente continuam fazendo parte da configuração.
## O que as demonstrações comprovam
A página do projeto descreve duas sequências de tarefas físicas em uma cozinha que o robô não conhecia. Em uma, ele reúne pacotes de café e joga fora caixas indicadas de leite e suco de laranja. Na outra, o G1 localiza um frasco de medicamento a partir de um pedido sem muitos detalhes, retira-o de uma gaveta, entrega-o e descarta uma caixa. Os clipes das habilidades mostram ações individuais e novas tentativas registradas; a página diz que a maioria das prévias está acelerada e identifica uma sequência de pegar um item na gaveta com tentativas repetidas contínuas.
O lançamento não informa o número de testes, uma taxa de sucesso das tarefas, uma comparação com uma política de ação visual e linguística aprendida nem o tempo e custo de cada execução completa na cozinha. Portanto, sustenta uma demonstração de arquitetura, não uma alegação medida de que o projeto funcione de forma confiável em outras cozinhas. O [repositório público vinculado](https://github.com/Stanford-TML/homebody) atualmente informa “Código em breve”, e o rótulo “Paper” na página do projeto não leva a um manuscrito. O repositório contém o site, ilustrações e vídeos, mas não uma implementação do robô nem arquivos de avaliação. A BIG CHANGE não executou o HomeBody nem testou um robô.
O relatório anterior da BIG CHANGE sobre o [GPT-Policy](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents) examinou o artigo de outra equipe sobre contexto para ações robóticas. Os materiais do HomeBody não identificam esse artigo como parte do sistema.
A equipe lista limitações práticas: criar o gêmeo digital exige tempo de preparação e gastos com API; o raciocínio remoto do Astra gera pausas entre habilidades; o alcance e a manipulação limitam o que o G1 consegue fazer; e os servos dos dedos podem superaquecer durante uma operação prolongada. O sistema local requer um laptop com RTX 4090, e habilidades mais exigentes podem precisar de mais capacidade computacional.
## Fontes e leituras complementares
- [Página do projeto HomeBody, dos pesquisadores da Caltech e de Stanford](https://tml.stanford.edu/homebody/) — Relato primário do sistema, das demonstrações na cozinha, da simulação, das interfaces de habilidades, da pilha de controle e das limitações declaradas. A página é datada de setembro de 2026; os vídeos e as descrições selecionados são evidências da equipe, não uma avaliação independente.
- [Repositório público do HomeBody, da Stanford TML](https://github.com/Stanford-TML/homebody) — Vinculado pela página do projeto. Em consulta realizada em 27 de setembro de 2026, o README dizia que o código seria publicado em breve; a árvore pública continha recursos do site, não a implementação do robô nem um artigo completo.
## Sources
- [Página do projeto HomeBody, dos pesquisadores da Caltech e de Stanford](https://tml.stanford.edu/homebody/) — Relato primário dos autores sobre a arquitetura, as demonstrações físicas na cozinha, a simulação explicitamente ilustrativa, as interfaces de habilidades, a configuração computacional e as limitações declaradas. Os vídeos e as descrições selecionados não constituem uma avaliação controlada e independente. O rótulo “Paper” não tem link para um manuscrito.
- [Repositório público do HomeBody, da Stanford TML](https://github.com/Stanford-TML/homebody) — O README diz que o código será publicado em breve. A árvore pública contém o site do projeto e mídia, não a implementação do robô nem arquivos de avaliação. A criação do repositório não comprova quando o experimento ocorreu.
Newsletter da BIG CHANGE
A visão ampla, no seu ritmo.
Matérias recentes sobre IA e robótica, mudanças que merecem atenção e ideias práticas para usar. Escolha um briefing diário, um resumo semanal ou uma perspectiva mensal.
Enviada às 09:00, horário de Belgrado: diariamente, às segundas-feiras ou no primeiro dia do mês. Sua primeira edição chegará no próximo envio programado após a confirmação.
Sua privacidade, sua escolha.
O armazenamento necessário ajuda a proteger o site e a lembrar suas escolhas. O Google Analytics opcional permanece desativado até você autorizá-lo. Você pode ler todas as matérias usando apenas o armazenamento necessário. Detalhes de privacidade