AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy testa contexto em tarefas com braço robótico e exploração móvel

> Um preprint de setembro relata uma tarefa de exploração móvel com três tentativas, além de experimentos com braços robóticos. Ele não verifica a alegação separada do Reddit sobre GPT-6 Astra e um Unitree G1.

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Um preprint de setembro, [“Aprendizado robótico em contexto com agentes VLM”](https://arxiv.org/html/2609.19138v1), apresenta o GPT-Policy, que conecta um modelo de visão e linguagem fixo a ferramentas robóticas por meio de demonstrações, imagens e histórico de interações. Os experimentos incluem tarefas com braços robóticos e exploração móvel. Eles não validam a [alegação de uma publicação no Reddit sobre o GPT-6 Astra e um Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).

## A grande mudança

- **O que mudou:** O GPT-Policy oferece a um modelo geral de visão e linguagem uma forma estruturada de transformar demonstrações e imagens atuais das câmeras em solicitações às ferramentas do robô. Em seguida, usa o retorno da execução para escolher outra ação, sem atualizar os pesos do modelo para a tarefa específica.
- **Por que isso importa:** A abordagem separa o raciocínio visual amplo das verificações de movimento e da execução. Nos testes limitados dos autores, mais contexto ajudou em algumas tarefas; ações sensíveis ao contato às vezes exigiram referências alinhadas de ações robóticas.
- **O que acompanhar:** O artigo relata apenas três tentativas por condição e descreve execuções lentas e sujeitas a falhas, inclusive colisões entre braços. Reprodução, avaliações maiores e controles de segurança independentes são importantes antes de se concluir que os resultados se aplicam a robôs trabalhando perto de pessoas.

## O que o GPT-Policy faz

O artigo foi enviado ao arXiv em 16 de setembro. Investiga se um modelo geral de visão e linguagem consegue usar exemplos e feedback para executar uma tarefa a partir de um novo estado inicial, sem ajuste fino nem alteração dos parâmetros do modelo específicos da tarefa. Os autores chamam a estrutura de GPT-Policy e incluem o GPT-6 Astra entre os modelos avaliados.

O sistema reúne diferentes tipos de contexto: uma instrução para a tarefa, imagens atuais das câmeras e o estado do robô, além de vídeos opcionais de demonstrações humanas, demonstrações robóticas com referências de ação, uma imagem-alvo, tentativas anteriores do robô ou interação humana. Um compilador de contexto seleciona transições visuais relevantes para a tarefa e as combina com instruções, restrições e esquemas de ferramentas. Em seguida, o VLM propõe uma solicitação estruturada ao robô.

Essa solicitação é encaminhada a um controlador específico para cada tipo de robô. Os autores descrevem a verificação de soluções de cinemática inversa, a amostragem de posições cartesianas e a temporização de referências articulares antes de executar ou rejeitar um movimento. O controlador devolve observações e feedback da execução para a próxima decisão do modelo. O modelo propõe ações; código específico do robô as valida e executa.

Esse ciclo é a principal contribuição do artigo. Ele permite que um VLM fixo adapte sua próxima ação com base em exemplos e resultados recentes, sem atualização por gradiente. Aqui, “aprendizado em contexto” descreve como o sistema usa informações fornecidas durante uma tarefa. Não significa que o modelo tenha aprendido permanentemente uma nova habilidade nem que qualquer robô possa usar a mesma interface de ferramentas.

## O que os testes mediram

Os autores relatam cinco famílias de experimentos em dez tarefas robóticas, com três tentativas por condição. A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) lista execuções com robôs reais e publica resultados por tarefa, decisões e duração. Na tarefa de pegar uma toalha, o GPT-6 Astra teve sucesso em duas de três tentativas com um vídeo humano e em nenhuma das três sem ele. Para pegar um caderno, o resultado também passou de zero em três sem demonstração para duas em três com uma demonstração.

As tarefas com contato mostram por que o contexto adicional não é uma solução geral. Para desrosquear a tampa de uma garrafa, vídeos do robô levaram a dois sucessos em três tentativas; com referências alinhadas de ações do robô, foram três em três. Para retirar e recolocar um plugue, a condição apenas com vídeo não teve nenhum sucesso em três tentativas, enquanto vídeo e referências de ação chegaram a dois. São contagens pequenas por condição, não estimativas de confiabilidade.

O projeto também relata três sucessos em três tentativas em tarefas de organização de blocos e frutas com base em imagem-alvo e em duas tarefas de interação humana. Usando o histórico de auto-interação, o artigo relata três sucessos em três tentativas tanto em “Lemon to Pink Plate” quanto em “Movable Exploration”. Nesta última, o robô evitou obstáculos ativamente enquanto procurava o alvo; o tempo médio foi de 25,53 minutos. A Figura 1 também mostra a recuperação móvel de objetos. Esses resultados ampliam o escopo para além da manipulação de objetos sobre uma mesa, mas continuam limitados a tarefas selecionadas com três tentativas por condição. As execuções levaram minutos: a página do projeto informa uma média de 18,9 minutos para pegar uma toalha com vídeo humano e 17,9 minutos para a tarefa da tampa com vídeo e referências de ação. Portanto, latência e custo operacional continuam sendo questões práticas em aberto, não detalhes já resolvidos.

O Apêndice B lista Morphi Kino, YAM e ARX X5 entre as configurações robóticas descritas no artigo. Identifica o Morphi Kino como uma plataforma móvel com cintura e cabeça, além de dois braços com sete articulações cada. Assim, o artigo inclui uma configuração de plataforma móvel além das plataformas com braços; o apêndice não identifica um Unitree G1.

## A tarefa móvel do artigo não comprova o cenário do Reddit

A [publicação no Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) afirma que o GPT-6 Astra controla um Unitree G1 em um ambiente desconhecido, lembra onde estão os objetos e depois os recupera a partir de pedidos vagos. O artigo relata a tarefa distinta “Movable Exploration” e descreve o Morphi Kino como uma plataforma com base móvel, mas o artigo, os materiais do projeto e o [repositório público no GitHub](https://github.com/cheng-haha/GPT-Policy) não identificam o cenário do G1 descrito no Reddit como um experimento do GPT-Policy. A publicação continua sendo uma alegação separada e não verificada; essa comparação não a refuta.

A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) dos autores contém vídeos dos experimentos. Eles são evidência das tarefas relatadas, não uma validação independente. O [repositório público de código](https://github.com/cheng-haha/GPT-Policy) lista atualmente adaptadores para ARX X5 e I2RT/YAM e informa que o repositório público não inclui hosts de implantação, prompts privados, gravações das execuções, calibração específica dos locais nem histórico das avaliações. Essa lista descreve o repositório publicado; não define todo o escopo do artigo, que também relata exploração móvel e lista o Morphi Kino no Apêndice B. Os materiais disponíveis não trazem detalhes suficientes para que a BIG CHANGE reproduza as execuções relatadas, e não testamos um robô.

## O limite do controle continua importante

A página do projeto relata sequências de ações longas e menciona dificuldades de execução. A discussão diz que as colisões observadas entre braços mostraram que as salvaguardas existentes não eram suficientes para uma implantação autônoma segura. Os autores defendem monitoramento independente da separação física e do contato, além de controle de baixo nível mais rápido e recuperação mais segura. O fato de um controlador rejeitar alguns movimentos inválidos não o torna, por si só, um sistema de segurança completo.

O estudo oferece um resultado de pesquisa concreto: o contexto pode ajudar um VLM geral a orientar ferramentas robóticas em determinadas tarefas, e o tipo de contexto faz diferença. O tamanho da avaliação, o tempo de cada execução, a falta de materiais públicos completos para reprodução e as colisões relatadas deixam os resultados muito longe de demonstrar um robô humanoide doméstico que entenda e execute pedidos abertos com confiabilidade.

## Fontes e leitura complementar

- [Cheng et al., “Aprendizado robótico em contexto com agentes VLM” (arXiv:2609.19138, versão 1, enviado em 16 de setembro de 2026)](https://arxiv.org/abs/2609.19138) — O preprint primário sobre o método, a avaliação e as limitações declaradas; não é evidência revisada por pares nem um relatório de implantação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Descrições dos experimentos, vídeos, resultados por condição e discussão. São materiais dos próprios autores.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Documenta os adaptadores atuais para braços robóticos e o que não está incluído no repositório público; a disponibilidade do repositório, por si só, não comprova que seja possível reproduzir os experimentos relatados.
- [A publicação no Reddit que motivou esta reportagem](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação sobre o Unitree G1; a publicação não apresenta evidências que relacionem esse cenário ao artigo.

## Sources

- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — Preprint primário, enviado em 16 de setembro; apresenta o método GPT-Policy proposto e relata a avaliação e as limitações indicadas pelos autores; não é evidência revisada por pares nem de implantação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Materiais primários dos autores para a descrição do sistema, experimentos, tabelas de resultados, vídeos e discussão; não constituem validação independente.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Evidência primária dos adaptadores publicados e do conteúdo e das omissões do repositório; não apresenta todos os dados de calibração, prompts ou histórico de avaliação necessários para uma reprodução pronta para uso.
- [Publicação no Reddit que afirma que o GPT-6 Astra controla um Unitree G1 em um ambiente desconhecido](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação viral em análise; não é evidência de que o artigo ou as plataformas de braços robóticos listadas tenham executado o cenário descrito.
