Um preprint de setembro, «Aprendizagem robótica em contexto com agentes VLM», apresenta o GPT-Policy, que liga um modelo fixo de visão e linguagem a ferramentas robóticas através de demonstrações, imagens e histórico de interações. As experiências incluem tarefas com braços robóticos e exploração móvel. Não validam a alegação de uma publicação no Reddit sobre o GPT-6 Astra e um Unitree G1.

A grande mudança

  • O que mudou: O GPT-Policy oferece a um modelo geral de visão e linguagem uma forma estruturada de transformar demonstrações e imagens atuais das câmaras em pedidos às ferramentas do robô. Em seguida, utiliza o resultado da execução para escolher outra ação, sem atualizar os pesos do modelo para a tarefa específica.
  • Porque é importante:A abordagem separa o raciocínio visual amplo das verificações de movimento e da execução. Nos testes limitados dos autores, mais contexto ajudou em algumas tarefas; ações sensíveis ao contacto exigiram, por vezes, demonstrações robóticas com referências de ação alinhadas.
  • O que acompanhar:O artigo relata apenas três tentativas por condição e descreve execuções lentas e sujeitas a falhas, incluindo colisões entre braços. A reprodução, avaliações mais amplas e controlos de segurança independentes são importantes antes de concluir que os resultados se aplicam a robôs que trabalham perto de pessoas.

O que faz o GPT-Policy

O artigo foi submetido ao arXiv a 16 de setembro. Investiga se um modelo geral de visão e linguagem consegue utilizar exemplos e respostas para executar uma tarefa a partir de um novo estado inicial, sem ajuste fino nem alteração dos parâmetros do modelo específicos da tarefa. Os autores chamam à estrutura GPT-Policy e incluem o GPT-6 Astra entre os modelos avaliados.

O sistema reúne diferentes tipos de contexto: uma instrução para a tarefa, imagens atuais das câmaras e o estado do robô, além de vídeos opcionais de demonstrações humanas, demonstrações robóticas com referências de ação, uma imagem-alvo, tentativas anteriores do robô ou interação humana. Um compilador de contexto seleciona transições visuais relevantes para a tarefa e combina-as com instruções, restrições e esquemas de ferramentas. Em seguida, o VLM propõe um pedido estruturado ao robô.

Esse pedido é encaminhado para um controlador específico de cada tipo de robô. Os autores descrevem a verificação de soluções de cinemática inversa, a amostragem de posições cartesianas e a temporização de referências articulares antes de executar ou rejeitar um movimento. O controlador devolve observações e respostas da execução para a decisão seguinte do modelo. O modelo propõe ações; código específico do robô valida-as e executa-as.

Este ciclo é o principal contributo do artigo. Permite que um VLM fixo adapte a ação seguinte com base em exemplos e resultados recentes, sem atualização por gradiente. Neste caso, «aprendizagem em contexto» descreve a forma como o sistema utiliza informação fornecida durante uma tarefa. Não significa que o modelo tenha aprendido permanentemente uma nova competência nem que qualquer robô possa utilizar a mesma interface de ferramentas.

O que mediram as experiências

Os autores relatam cinco categorias de experiências em dez tarefas robóticas, com três tentativas por condição. A página do projeto apresenta execuções com robôs reais e publica resultados por tarefa, decisões e duração. Na tarefa de agarrar uma toalha, o GPT-6 Astra teve sucesso em duas de três tentativas com um vídeo humano e em nenhuma das três sem esse vídeo. Para agarrar um caderno, o resultado também passou de zero em três sem demonstração para duas em três com uma demonstração.

As tarefas com contacto mostram por que razão o contexto adicional não é uma solução geral. Para desenroscar a tampa de uma garrafa, os vídeos do robô levaram a dois sucessos em três tentativas; com referências de ação do robô alinhadas, foram três em três. Para retirar e voltar a colocar uma ficha, a condição apenas com vídeo não teve qualquer sucesso em três tentativas, enquanto a combinação de vídeo e referências de ação chegou a dois. São contagens reduzidas por condição, não estimativas de fiabilidade.

O projeto também relata três sucessos em três tentativas em tarefas de organização de blocos e fruta com base numa imagem-alvo e em duas tarefas de interação humana. Utilizando o histórico de auto-interação, o artigo relata três sucessos em três tentativas tanto em «Lemon to Pink Plate» como em «Movable Exploration». Nesta última, o robô evitou ativamente obstáculos enquanto procurava o alvo; o tempo médio foi de 25,53 minutos. A Figura 1 mostra também a recuperação móvel de objetos. Estes resultados alargam o âmbito para além da manipulação de objetos sobre uma mesa, mas continuam limitados a tarefas selecionadas com três tentativas por condição. As execuções demoraram minutos: a página do projeto indica médias de 18,9 minutos para agarrar uma toalha com vídeo humano e 17,9 minutos para a tarefa da tampa com vídeo e referências de ação. Por isso, a latência e o custo operacional continuam a ser questões práticas em aberto, não problemas já resolvidos.

O Apêndice B lista Morphi Kino, YAM e ARX X5 entre as configurações robóticas descritas no artigo. Identifica o Morphi Kino como uma plataforma móvel com cintura e cabeça, além de dois braços com sete articulações cada. Assim, o artigo inclui uma configuração de plataforma móvel, além de plataformas com braços; o apêndice não identifica um Unitree G1.

A tarefa móvel do artigo não comprova o cenário do Reddit

A publicação no Reddit afirma que o GPT-6 Astra controla um Unitree G1 num ambiente desconhecido, memoriza a localização dos objetos e depois os recupera a partir de pedidos vagos. O artigo relata a tarefa distinta «Movable Exploration» e descreve o Morphi Kino como uma plataforma com base móvel, mas o artigo, os materiais do projeto e o repositório público no GitHub não identificam o cenário do G1 descrito no Reddit como uma experiência do GPT-Policy. A publicação continua a ser uma alegação separada e não verificada; esta comparação não a refuta.

A página do projeto dos autores contém vídeos das experiências. São provas das tarefas relatadas, não uma validação independente. O repositório público de código lista atualmente adaptadores para ARX X5 e I2RT/YAM e indica que o repositório público não inclui hosts de implementação, instruções privadas, gravações das execuções, calibração específica dos locais nem histórico das avaliações. Esta lista descreve o repositório publicado; não define todo o âmbito do artigo, que também relata exploração móvel e lista o Morphi Kino no Apêndice B. Os materiais disponíveis não contêm pormenores suficientes para a BIG CHANGE reproduzir as execuções relatadas, e não testámos um robô.

O limite do controlo continua a ser importante

A página do projeto relata sequências de ações longas e menciona dificuldades de execução. A discussão afirma que as colisões observadas entre braços mostraram que as salvaguardas existentes não eram suficientes para uma implementação autónoma segura. Os autores defendem a monitorização independente da separação física e do contacto, além de um controlo de baixo nível mais rápido e de uma recuperação mais segura. O facto de um controlador rejeitar alguns movimentos inválidos não o transforma, por si só, num sistema de segurança completo.

O estudo apresenta um resultado de investigação concreto: o contexto pode ajudar um VLM geral a orientar ferramentas robóticas em determinadas tarefas, e o tipo de contexto faz diferença. A dimensão da avaliação, o tempo de cada execução, a falta de materiais públicos completos para reprodução e as colisões relatadas deixam os resultados muito aquém de demonstrarem um robô humanoide doméstico capaz de compreender e executar pedidos abertos de forma fiável.

Fontes e leituras complementares