Um preprint de setembro, “Aprendizado robótico em contexto com agentes VLM”, apresenta o GPT-Policy, que conecta um modelo de visão e linguagem fixo a ferramentas robóticas por meio de demonstrações, imagens e histórico de interações. Os experimentos incluem tarefas com braços robóticos e exploração móvel. Eles não validam a alegação de uma publicação no Reddit sobre o GPT-6 Astra e um Unitree G1.

A grande mudança

  • O que mudou: O GPT-Policy oferece a um modelo geral de visão e linguagem uma forma estruturada de transformar demonstrações e imagens atuais das câmeras em solicitações às ferramentas do robô. Em seguida, usa o retorno da execução para escolher outra ação, sem atualizar os pesos do modelo para a tarefa específica.
  • Por que isso importa: A abordagem separa o raciocínio visual amplo das verificações de movimento e da execução. Nos testes limitados dos autores, mais contexto ajudou em algumas tarefas; ações sensíveis ao contato às vezes exigiram referências alinhadas de ações robóticas.
  • O que acompanhar: O artigo relata apenas três tentativas por condição e descreve execuções lentas e sujeitas a falhas, inclusive colisões entre braços. Reprodução, avaliações maiores e controles de segurança independentes são importantes antes de se concluir que os resultados se aplicam a robôs trabalhando perto de pessoas.

O que o GPT-Policy faz

O artigo foi enviado ao arXiv em 16 de setembro. Investiga se um modelo geral de visão e linguagem consegue usar exemplos e feedback para executar uma tarefa a partir de um novo estado inicial, sem ajuste fino nem alteração dos parâmetros do modelo específicos da tarefa. Os autores chamam a estrutura de GPT-Policy e incluem o GPT-6 Astra entre os modelos avaliados.

O sistema reúne diferentes tipos de contexto: uma instrução para a tarefa, imagens atuais das câmeras e o estado do robô, além de vídeos opcionais de demonstrações humanas, demonstrações robóticas com referências de ação, uma imagem-alvo, tentativas anteriores do robô ou interação humana. Um compilador de contexto seleciona transições visuais relevantes para a tarefa e as combina com instruções, restrições e esquemas de ferramentas. Em seguida, o VLM propõe uma solicitação estruturada ao robô.

Essa solicitação é encaminhada a um controlador específico para cada tipo de robô. Os autores descrevem a verificação de soluções de cinemática inversa, a amostragem de posições cartesianas e a temporização de referências articulares antes de executar ou rejeitar um movimento. O controlador devolve observações e feedback da execução para a próxima decisão do modelo. O modelo propõe ações; código específico do robô as valida e executa.

Esse ciclo é a principal contribuição do artigo. Ele permite que um VLM fixo adapte sua próxima ação com base em exemplos e resultados recentes, sem atualização por gradiente. Aqui, “aprendizado em contexto” descreve como o sistema usa informações fornecidas durante uma tarefa. Não significa que o modelo tenha aprendido permanentemente uma nova habilidade nem que qualquer robô possa usar a mesma interface de ferramentas.

O que os testes mediram

Os autores relatam cinco famílias de experimentos em dez tarefas robóticas, com três tentativas por condição. A página do projeto lista execuções com robôs reais e publica resultados por tarefa, decisões e duração. Na tarefa de pegar uma toalha, o GPT-6 Astra teve sucesso em duas de três tentativas com um vídeo humano e em nenhuma das três sem ele. Para pegar um caderno, o resultado também passou de zero em três sem demonstração para duas em três com uma demonstração.

As tarefas com contato mostram por que o contexto adicional não é uma solução geral. Para desrosquear a tampa de uma garrafa, vídeos do robô levaram a dois sucessos em três tentativas; com referências alinhadas de ações do robô, foram três em três. Para retirar e recolocar um plugue, a condição apenas com vídeo não teve nenhum sucesso em três tentativas, enquanto vídeo e referências de ação chegaram a dois. São contagens pequenas por condição, não estimativas de confiabilidade.

O projeto também relata três sucessos em três tentativas em tarefas de organização de blocos e frutas com base em imagem-alvo e em duas tarefas de interação humana. Usando o histórico de auto-interação, o artigo relata três sucessos em três tentativas tanto em “Lemon to Pink Plate” quanto em “Movable Exploration”. Nesta última, o robô evitou obstáculos ativamente enquanto procurava o alvo; o tempo médio foi de 25,53 minutos. A Figura 1 também mostra a recuperação móvel de objetos. Esses resultados ampliam o escopo para além da manipulação de objetos sobre uma mesa, mas continuam limitados a tarefas selecionadas com três tentativas por condição. As execuções levaram minutos: a página do projeto informa uma média de 18,9 minutos para pegar uma toalha com vídeo humano e 17,9 minutos para a tarefa da tampa com vídeo e referências de ação. Portanto, latência e custo operacional continuam sendo questões práticas em aberto, não detalhes já resolvidos.

O Apêndice B lista Morphi Kino, YAM e ARX X5 entre as configurações robóticas descritas no artigo. Identifica o Morphi Kino como uma plataforma móvel com cintura e cabeça, além de dois braços com sete articulações cada. Assim, o artigo inclui uma configuração de plataforma móvel além das plataformas com braços; o apêndice não identifica um Unitree G1.

A tarefa móvel do artigo não comprova o cenário do Reddit

A publicação no Reddit afirma que o GPT-6 Astra controla um Unitree G1 em um ambiente desconhecido, lembra onde estão os objetos e depois os recupera a partir de pedidos vagos. O artigo relata a tarefa distinta “Movable Exploration” e descreve o Morphi Kino como uma plataforma com base móvel, mas o artigo, os materiais do projeto e o repositório público no GitHub não identificam o cenário do G1 descrito no Reddit como um experimento do GPT-Policy. A publicação continua sendo uma alegação separada e não verificada; essa comparação não a refuta.

A página do projeto dos autores contém vídeos dos experimentos. Eles são evidência das tarefas relatadas, não uma validação independente. O repositório público de código lista atualmente adaptadores para ARX X5 e I2RT/YAM e informa que o repositório público não inclui hosts de implantação, prompts privados, gravações das execuções, calibração específica dos locais nem histórico das avaliações. Essa lista descreve o repositório publicado; não define todo o escopo do artigo, que também relata exploração móvel e lista o Morphi Kino no Apêndice B. Os materiais disponíveis não trazem detalhes suficientes para que a BIG CHANGE reproduza as execuções relatadas, e não testamos um robô.

O limite do controle continua importante

A página do projeto relata sequências de ações longas e menciona dificuldades de execução. A discussão diz que as colisões observadas entre braços mostraram que as salvaguardas existentes não eram suficientes para uma implantação autônoma segura. Os autores defendem monitoramento independente da separação física e do contato, além de controle de baixo nível mais rápido e recuperação mais segura. O fato de um controlador rejeitar alguns movimentos inválidos não o torna, por si só, um sistema de segurança completo.

O estudo oferece um resultado de pesquisa concreto: o contexto pode ajudar um VLM geral a orientar ferramentas robóticas em determinadas tarefas, e o tipo de contexto faz diferença. O tamanho da avaliação, o tempo de cada execução, a falta de materiais públicos completos para reprodução e as colisões relatadas deixam os resultados muito longe de demonstrar um robô humanoide doméstico que entenda e execute pedidos abertos com confiabilidade.

Fontes e leitura complementar