AI-translated from English; not yet reviewed by a fluent editor.
# O GPT-Policy testa o contexto em tarefas com braço robótico e exploração móvel
> Um preprint de setembro relata uma tarefa de exploração móvel com três tentativas, além de experiências com braços robóticos. Não verifica a alegação separada do Reddit sobre o GPT-6 Astra e um Unitree G1.
By BIG CHANGE Editorial
Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

AI-generated conceptual illustration by BIG CHANGE.
Um preprint de setembro, [«Aprendizagem robótica em contexto com agentes VLM»](https://arxiv.org/html/2609.19138v1), apresenta o GPT-Policy, que liga um modelo fixo de visão e linguagem a ferramentas robóticas através de demonstrações, imagens e histórico de interações. As experiências incluem tarefas com braços robóticos e exploração móvel. Não validam a [alegação de uma publicação no Reddit sobre o GPT-6 Astra e um Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).
## A grande mudança
- **O que mudou:** O GPT-Policy oferece a um modelo geral de visão e linguagem uma forma estruturada de transformar demonstrações e imagens atuais das câmaras em pedidos às ferramentas do robô. Em seguida, utiliza o resultado da execução para escolher outra ação, sem atualizar os pesos do modelo para a tarefa específica.
- **Porque é importante:**A abordagem separa o raciocínio visual amplo das verificações de movimento e da execução. Nos testes limitados dos autores, mais contexto ajudou em algumas tarefas; ações sensíveis ao contacto exigiram, por vezes, demonstrações robóticas com referências de ação alinhadas.
- **O que acompanhar:**O artigo relata apenas três tentativas por condição e descreve execuções lentas e sujeitas a falhas, incluindo colisões entre braços. A reprodução, avaliações mais amplas e controlos de segurança independentes são importantes antes de concluir que os resultados se aplicam a robôs que trabalham perto de pessoas.
## O que faz o GPT-Policy
O artigo foi submetido ao arXiv a 16 de setembro. Investiga se um modelo geral de visão e linguagem consegue utilizar exemplos e respostas para executar uma tarefa a partir de um novo estado inicial, sem ajuste fino nem alteração dos parâmetros do modelo específicos da tarefa. Os autores chamam à estrutura GPT-Policy e incluem o GPT-6 Astra entre os modelos avaliados.
O sistema reúne diferentes tipos de contexto: uma instrução para a tarefa, imagens atuais das câmaras e o estado do robô, além de vídeos opcionais de demonstrações humanas, demonstrações robóticas com referências de ação, uma imagem-alvo, tentativas anteriores do robô ou interação humana. Um compilador de contexto seleciona transições visuais relevantes para a tarefa e combina-as com instruções, restrições e esquemas de ferramentas. Em seguida, o VLM propõe um pedido estruturado ao robô.
Esse pedido é encaminhado para um controlador específico de cada tipo de robô. Os autores descrevem a verificação de soluções de cinemática inversa, a amostragem de posições cartesianas e a temporização de referências articulares antes de executar ou rejeitar um movimento. O controlador devolve observações e respostas da execução para a decisão seguinte do modelo. O modelo propõe ações; código específico do robô valida-as e executa-as.
Este ciclo é o principal contributo do artigo. Permite que um VLM fixo adapte a ação seguinte com base em exemplos e resultados recentes, sem atualização por gradiente. Neste caso, «aprendizagem em contexto» descreve a forma como o sistema utiliza informação fornecida durante uma tarefa. Não significa que o modelo tenha aprendido permanentemente uma nova competência nem que qualquer robô possa utilizar a mesma interface de ferramentas.
## O que mediram as experiências
Os autores relatam cinco categorias de experiências em dez tarefas robóticas, com três tentativas por condição. A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) apresenta execuções com robôs reais e publica resultados por tarefa, decisões e duração. Na tarefa de agarrar uma toalha, o GPT-6 Astra teve sucesso em duas de três tentativas com um vídeo humano e em nenhuma das três sem esse vídeo. Para agarrar um caderno, o resultado também passou de zero em três sem demonstração para duas em três com uma demonstração.
As tarefas com contacto mostram por que razão o contexto adicional não é uma solução geral. Para desenroscar a tampa de uma garrafa, os vídeos do robô levaram a dois sucessos em três tentativas; com referências de ação do robô alinhadas, foram três em três. Para retirar e voltar a colocar uma ficha, a condição apenas com vídeo não teve qualquer sucesso em três tentativas, enquanto a combinação de vídeo e referências de ação chegou a dois. São contagens reduzidas por condição, não estimativas de fiabilidade.
O projeto também relata três sucessos em três tentativas em tarefas de organização de blocos e fruta com base numa imagem-alvo e em duas tarefas de interação humana. Utilizando o histórico de auto-interação, o artigo relata três sucessos em três tentativas tanto em «Lemon to Pink Plate» como em «Movable Exploration». Nesta última, o robô evitou ativamente obstáculos enquanto procurava o alvo; o tempo médio foi de 25,53 minutos. A Figura 1 mostra também a recuperação móvel de objetos. Estes resultados alargam o âmbito para além da manipulação de objetos sobre uma mesa, mas continuam limitados a tarefas selecionadas com três tentativas por condição. As execuções demoraram minutos: a página do projeto indica médias de 18,9 minutos para agarrar uma toalha com vídeo humano e 17,9 minutos para a tarefa da tampa com vídeo e referências de ação. Por isso, a latência e o custo operacional continuam a ser questões práticas em aberto, não problemas já resolvidos.
O Apêndice B lista Morphi Kino, YAM e ARX X5 entre as configurações robóticas descritas no artigo. Identifica o Morphi Kino como uma plataforma móvel com cintura e cabeça, além de dois braços com sete articulações cada. Assim, o artigo inclui uma configuração de plataforma móvel, além de plataformas com braços; o apêndice não identifica um Unitree G1.
## A tarefa móvel do artigo não comprova o cenário do Reddit
A [publicação no Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) afirma que o GPT-6 Astra controla um Unitree G1 num ambiente desconhecido, memoriza a localização dos objetos e depois os recupera a partir de pedidos vagos. O artigo relata a tarefa distinta «Movable Exploration» e descreve o Morphi Kino como uma plataforma com base móvel, mas o artigo, os materiais do projeto e o [repositório público no GitHub](https://github.com/cheng-haha/GPT-Policy) não identificam o cenário do G1 descrito no Reddit como uma experiência do GPT-Policy. A publicação continua a ser uma alegação separada e não verificada; esta comparação não a refuta.
A [página do projeto](https://cheng-haha.github.io/GPT-Policy/) dos autores contém vídeos das experiências. São provas das tarefas relatadas, não uma validação independente. O [repositório público de código](https://github.com/cheng-haha/GPT-Policy) lista atualmente adaptadores para ARX X5 e I2RT/YAM e indica que o repositório público não inclui hosts de implementação, instruções privadas, gravações das execuções, calibração específica dos locais nem histórico das avaliações. Esta lista descreve o repositório publicado; não define todo o âmbito do artigo, que também relata exploração móvel e lista o Morphi Kino no Apêndice B. Os materiais disponíveis não contêm pormenores suficientes para a BIG CHANGE reproduzir as execuções relatadas, e não testámos um robô.
## O limite do controlo continua a ser importante
A página do projeto relata sequências de ações longas e menciona dificuldades de execução. A discussão afirma que as colisões observadas entre braços mostraram que as salvaguardas existentes não eram suficientes para uma implementação autónoma segura. Os autores defendem a monitorização independente da separação física e do contacto, além de um controlo de baixo nível mais rápido e de uma recuperação mais segura. O facto de um controlador rejeitar alguns movimentos inválidos não o transforma, por si só, num sistema de segurança completo.
O estudo apresenta um resultado de investigação concreto: o contexto pode ajudar um VLM geral a orientar ferramentas robóticas em determinadas tarefas, e o tipo de contexto faz diferença. A dimensão da avaliação, o tempo de cada execução, a falta de materiais públicos completos para reprodução e as colisões relatadas deixam os resultados muito aquém de demonstrarem um robô humanoide doméstico capaz de compreender e executar pedidos abertos de forma fiável.
## Fontes e leituras complementares
- [Cheng et al., «In-Context Robot Learning with VLM Agents» (arXiv:2609.19138, versão 1, submetida a 16 de setembro de 2026)](https://arxiv.org/abs/2609.19138) — O preprint primário sobre o método, a avaliação e as limitações declaradas; não é prova revista por pares nem um relatório de implementação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Descrições das experiências, vídeos, resultados por condição e discussão. São materiais dos próprios autores.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Documenta os adaptadores atuais para braços robóticos e o que não está incluído no repositório público; a disponibilidade do repositório, por si só, não comprova que seja possível reproduzir as experiências relatadas.
- [A publicação no Reddit que motivou esta reportagem](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação sobre o Unitree G1; a publicação não apresenta provas que relacionem esse cenário com o artigo.
## Sources
- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — Preprint primário, submetido a 16 de setembro; apresenta o método GPT-Policy proposto e relata a avaliação e as limitações indicadas pelos autores; não é prova revista por pares nem de implementação.
- [Página do projeto GPT-Policy dos autores](https://cheng-haha.github.io/GPT-Policy/) — Materiais primários dos autores para a descrição do sistema, experiências, tabelas de resultados, vídeos e discussão; não constituem validação independente.
- [Repositório público de código do GPT-Policy dos autores](https://github.com/cheng-haha/GPT-Policy) — Provas primárias dos adaptadores publicados e do conteúdo e das omissões do repositório; não apresenta todos os dados de calibração, instruções ou histórico de avaliação necessários para uma reprodução pronta a utilizar.
- [Publicação no Reddit que afirma que o GPT-6 Astra controla um Unitree G1 num ambiente desconhecido](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origem da alegação viral em análise; não é prova de que o artigo ou as plataformas de braços robóticos listadas tenham executado o cenário descrito.
Newsletter BIG CHANGE
A perspetiva geral, ao seu ritmo.
Histórias recentes sobre IA e robótica, mudanças que vale a pena acompanhar e ideias práticas para utilizar. Escolha um briefing diário, um resumo semanal ou uma perspetiva mensal.
Enviada às 09:00, hora de Belgrado: diariamente, às segundas-feiras ou no primeiro dia do mês. A sua primeira edição chegará no próximo envio agendado após a confirmação.
A sua privacidade, a sua escolha.
O armazenamento necessário ajuda a proteger o site e a memorizar as suas escolhas. O Google Analytics opcional permanece desativado até que o autorize. Pode ler todos os artigos utilizando apenas o armazenamento necessário. Detalhes de privacidade