AI-translated from English; not yet reviewed by a fluent editor.

# O GPT-Policy testa o contexto em tarefas com braço robótico e exploração móvel

> Um preprint de setembro relata uma tarefa de exploração móvel com três tentativas, além de experiências com braços robóticos. Não verifica a alegação separada do Reddit sobre o GPT-6 Astra e um Unitree G1.

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Um preprint de setembro, [«Aprendizagem robótica em contexto com agentes VLM»](https://arxiv.org/html/2609.19138v1), apresenta o GPT-Policy, que liga um modelo fixo de visão e linguagem a ferramentas robóticas através de demonstrações, imagens e histórico de interações. As experiências incluem tarefas com braços robóticos e exploração móvel. Não validam a [alegação de uma publicação no Reddit sobre o GPT-6 Astra e um Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).

## A grande mudança

- **O que mudou:** O GPT-Policy oferece a um modelo geral de visão e linguagem uma forma estruturada de transformar demonstrações e imagens atuais das câmaras em pedidos às ferramentas do robô. Em seguida, utiliza o resultado da execução para escolher outra ação, sem atualizar os pesos do modelo para a tarefa específica.
- **Porque é importante:**A abordagem separa o raciocínio visual amplo das verificações de movimento e da execução. Nos testes limitados dos autores, mais contexto ajudou em algumas tarefas; ações sensíveis ao contacto exigiram, por vezes, demonstrações robóticas com referências de ação alinhadas.
- **O que acompanhar:**O artigo relata apenas três tentativas por condição e descreve execuções lentas e sujeitas a falhas, incluindo colisões entre braços. A reprodução, avaliações mais amplas e controlos de segurança independentes são importantes antes de concluir que os resultados se aplicam a robôs que trabalham perto de pessoas.

## O que faz o GPT-Policy

O artigo foi submetido ao arXiv a 16 de setembro. Investiga se um modelo geral de visão e linguagem consegue utilizar exemplos e respostas para executar uma tarefa a partir de um novo estado inicial, sem ajuste fino nem alteração dos parâmetros do modelo específicos da tarefa. Os autores chamam à estrutura GPT-Policy e incluem o GPT-6 Astra entre os modelos avaliados.

O sistema reúne diferentes tipos de contexto: uma instrução para a tarefa, imagens atuais das câmaras e o estado do robô, além de vídeos opcionais de demonstrações humanas, demonstrações robóticas com referências de ação, uma imagem-alvo, tentativas anteriores do robô ou interação humana. Um compilador de contexto seleciona transições visuais relevantes para a tarefa e combina-as com instruções, restrições e esquemas de ferramentas. Em seguida, o VLM propõe um pedido estruturado ao robô.

Esse pedido é encaminhado para um controlador específico de cada tipo de robô. Os autores descrevem a verificação de soluções de cinemática inversa, a amostragem de posições cartesianas e a temporização de referências articulares antes de executar ou rejeitar um movimento. O controlador devolve observações e respostas da execução para a decisão seguinte do modelo. O modelo propõe ações; código específico do robô valida-as e executa-as.

Este ciclo é o principal contributo do artigo. Permite que um VLM fixo adapte a ação seguinte com base em exemplos e resultados recentes, sem atualização por gradiente. Neste caso, «aprendizagem em contexto» descreve a forma como o sistema utiliza informação fornecida durante uma tarefa. Não significa que o modelo tenha aprendido permanentemente uma nova competência nem que qualquer robô possa utilizar a mesma interface de ferramentas.

## O que mediram as experiências

Os autores relatam cinco categorias de experiências em dez tarefas robóticas, com três tentativas por condição. A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) apresenta execuções com robôs reais e publica resultados por tarefa, decisões e duração. Na tarefa de agarrar uma toalha, o GPT-6 Astra teve sucesso em duas de três tentativas com um vídeo humano e em nenhuma das três sem esse vídeo. Para agarrar um caderno, o resultado também passou de zero em três sem demonstração para duas em três com uma demonstração.

As tarefas com contacto mostram por que razão o contexto adicional não é uma solução geral. Para desenroscar a tampa de uma garrafa, os vídeos do robô levaram a dois sucessos em três tentativas; com referências de ação do robô alinhadas, foram três em três. Para retirar e voltar a colocar uma ficha, a condição apenas com vídeo não teve qualquer sucesso em três tentativas, enquanto a combinação de vídeo e referências de ação chegou a dois. São contagens reduzidas por condição, não estimativas de fiabilidade.

O projeto também relata três sucessos em três tentativas em tarefas de organização de blocos e fruta com base numa imagem-alvo e em duas tarefas de interação humana. Utilizando o histórico de auto-interação, o artigo relata três sucessos em três tentativas tanto em «Lemon to Pink Plate» como em «Movable Exploration». Nesta última, o robô evitou ativamente obstáculos enquanto procurava o alvo; o tempo médio foi de 25,53 minutos. A Figura 1 mostra também a recuperação móvel de objetos. Estes resultados alargam o âmbito para além da manipulação de objetos sobre uma mesa, mas continuam limitados a tarefas selecionadas com três tentativas por condição. As execuções demoraram minutos: a página do projeto indica médias de 18,9 minutos para agarrar uma toalha com vídeo humano e 17,9 minutos para a tarefa da tampa com vídeo e referências de ação. Por isso, a latência e o custo operacional continuam a ser questões práticas em aberto, não problemas já resolvidos.

O Apêndice B lista Morphi Kino, YAM e ARX X5 entre as configurações robóticas descritas no artigo. Identifica o Morphi Kino como uma plataforma móvel com cintura e cabeça, além de dois braços com sete articulações cada. Assim, o artigo inclui uma configuração de plataforma móvel, além de plataformas com braços; o apêndice não identifica um Unitree G1.

## A tarefa móvel do artigo não comprova o cenário do Reddit

A [publicação no Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) afirma que o GPT-6 Astra controla um Unitree G1 num ambiente desconhecido, memoriza a localização dos objetos e depois os recupera a partir de pedidos vagos. O artigo relata a tarefa distinta «Movable Exploration» e descreve o Morphi Kino como uma plataforma com base móvel, mas o artigo, os materiais do projeto e o [repositório público no GitHub](https://github.com/cheng-haha/GPT-Policy) não identificam o cenário do G1 descrito no Reddit como uma experiência do GPT-Policy. A publicação continua a ser uma alegação separada e não verificada; esta comparação não a refuta.

A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) dos autores contém vídeos das experiências. São provas das tarefas relatadas, não uma validação independente. O [repositório público de código](https://github.com/cheng-haha/GPT-Policy) lista atualmente adaptadores para ARX X5 e I2RT/YAM e indica que o repositório público não inclui hosts de implementação, instruções privadas, gravações das execuções, calibração específica dos locais nem histórico das avaliações. Esta lista descreve o repositório publicado; não define todo o âmbito do artigo, que também relata exploração móvel e lista o Morphi Kino no Apêndice B. Os materiais disponíveis não contêm pormenores suficientes para a BIG CHANGE reproduzir as execuções relatadas, e não testámos um robô.

## O limite do controlo continua a ser importante

A página do projeto relata sequências de ações longas e menciona dificuldades de execução. A discussão afirma que as colisões observadas entre braços mostraram que as salvaguardas existentes não eram suficientes para uma implementação autónoma segura. Os autores defendem a monitorização independente da separação física e do contacto, além de um controlo de baixo nível mais rápido e de uma recuperação mais segura. O facto de um controlador rejeitar alguns movimentos inválidos não o transforma, por si só, num sistema de segurança completo.

O estudo apresenta um resultado de investigação concreto: o contexto pode ajudar um VLM geral a orientar ferramentas robóticas em determinadas tarefas, e o tipo de contexto faz diferença. A dimensão da avaliação, o tempo de cada execução, a falta de materiais públicos completos para reprodução e as colisões relatadas deixam os resultados muito aquém de demonstrarem um robô humanoide doméstico capaz de compreender e executar pedidos abertos de forma fiável.

## Fontes e leituras complementares

- [Cheng et al., «In-Context Robot Learning with VLM Agents» (arXiv:2609.19138, versão 1, submetida a 16 de setembro de 2026)](https://arxiv.org/abs/2609.19138) — O preprint primário sobre o método, a avaliação e as limitações declaradas; não é prova revista por pares nem um relatório de implementação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Descrições das experiências, vídeos, resultados por condição e discussão. São materiais dos próprios autores.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Documenta os adaptadores atuais para braços robóticos e o que não está incluído no repositório público; a disponibilidade do repositório, por si só, não comprova que seja possível reproduzir as experiências relatadas.
- [A publicação no Reddit que motivou esta reportagem](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação sobre o Unitree G1; a publicação não apresenta provas que relacionem esse cenário com o artigo.

## Sources

- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — Preprint primário, submetido a 16 de setembro; apresenta o método GPT-Policy proposto e relata a avaliação e as limitações indicadas pelos autores; não é prova revista por pares nem de implementação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Materiais primários dos autores para a descrição do sistema, experiências, tabelas de resultados, vídeos e discussão; não constituem validação independente.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Provas primárias dos adaptadores publicados e do conteúdo e das omissões do repositório; não apresenta todos os dados de calibração, instruções ou histórico de avaliação necessários para uma reprodução pronta a utilizar.
- [Publicação no Reddit que afirma que o GPT-6 Astra controla um Unitree G1 num ambiente desconhecido](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação viral em análise; não é prova de que o artigo ou as plataformas de braços robóticos listadas tenham executado o cenário descrito.
