Un preprint de arXiv de septiembre, «In-Context Robot Learning with VLM Agents», presenta GPT-Policy, que conecta un modelo de visión y lenguaje fijo con herramientas robóticas mediante demostraciones, imágenes e historial de interacciones. Sus experimentos incluyen tareas con brazos robóticos y exploración móvil. No validan la afirmación independiente de la publicación de Reddit sobre GPT-6 Astra y un Unitree G1.

El gran cambio

  • Qué ha cambiado: GPT-Policy ofrece a un modelo general de visión y lenguaje una forma estructurada de convertir demostraciones y vistas actuales de cámara en solicitudes a herramientas robóticas y, luego, usar la respuesta de ejecución para elegir otra acción, sin actualizar los pesos del modelo específicos para la tarea.
  • Por qué importa: El enfoque separa el razonamiento visual general de las comprobaciones de movimiento y la ejecución. En los ensayos limitados de los autores, añadir contexto ayudó en algunas tareas, mientras que las acciones sensibles al contacto a veces requirieron referencias alineadas de acciones robóticas.
  • Qué conviene observar: El artículo informa solo tres ensayos por condición y describe ejecuciones lentas y propensas a fallos, incluidas colisiones entre brazos. Antes de sacar conclusiones sobre robots que trabajen cerca de personas, hacen falta reproducciones, evaluaciones más amplias y controles de seguridad independientes.

Qué hace GPT-Policy

El artículo se envió a arXiv el 16 de septiembre. Examina si un modelo general de visión y lenguaje puede usar ejemplos y comentarios de ejecución para realizar una tarea desde un nuevo estado inicial, sin ajuste fino ni cambios en los parámetros del modelo específicos de esa tarea. Los autores llaman GPT-Policy a su marco e indican que evaluaron, entre otros, GPT-6 Astra.

El sistema reúne varios tipos de contexto: una instrucción para la tarea, vistas actuales de cámara y estado, además de vídeos opcionales de demostraciones humanas, demostraciones robóticas con referencias de acciones, una imagen objetivo, intentos robóticos anteriores o interacción humana. Un compilador de contexto selecciona transiciones visuales pertinentes para la tarea y las combina con instrucciones, restricciones y esquemas de herramientas. A continuación, el modelo de visión y lenguaje propone una solicitud estructurada a la herramienta robótica.

Esa solicitud se envía a un controlador específico para el tipo de robot. Los autores describen cómo comprueban soluciones de cinemática inversa, muestrean poses cartesianas y programan referencias articulares antes de ejecutar o rechazar un movimiento. El controlador devuelve observaciones y comentarios sobre la ejecución para la siguiente decisión del modelo. El modelo propone acciones; el código específico del robot las valida y ejecuta.

Este ciclo es la principal aportación del artículo. Permite que un modelo de visión y lenguaje fijo adapte su siguiente acción a ejemplos y resultados recientes sin actualizar sus gradientes. Aquí, «aprendizaje en contexto» describe cómo el sistema utiliza la información proporcionada durante una tarea. No significa que el modelo haya aprendido permanentemente una nueva habilidad ni que todos los robots puedan usar la misma interfaz de herramientas.

Qué midieron los ensayos

Los autores informan de cinco familias de experimentos en diez tareas robóticas, con tres ensayos por condición. Su página del proyecto enumera ejecuciones con robots reales y publica resultados por tarea, decisiones y tiempo transcurrido. Al recoger una toalla, GPT-6 Astra tuvo éxito en dos de tres ensayos con un vídeo humano y en ninguno de tres sin él. En la tarea de recoger un cuaderno, los resultados también mejoraron: de cero de tres sin demostración a dos de tres con ella.

Las tareas con contacto muestran por qué el contexto adicional no es una solución general. Al desenroscar el tapón de una botella, el vídeo del robot produjo dos éxitos de tres ensayos; al añadir referencias alineadas de acciones robóticas, se lograron tres de tres. Para retirar y volver a insertar un enchufe, la condición con solo vídeo no tuvo ningún éxito en tres ensayos, mientras que el vídeo más las referencias de acción alcanzó dos. Son recuentos pequeños por condición, no estimaciones de fiabilidad.

El proyecto también informa de tres éxitos de tres ensayos al ordenar bloques y frutas según una imagen objetivo, además de dos tareas de interacción humana. Con el historial de interacción propia, el artículo informa de tres éxitos de tres ensayos tanto en «Lemon to Pink Plate» como en «Movable Exploration». En esta última, el robot evitó activamente obstáculos mientras buscaba el objetivo; el tiempo medio fue de 25,53 minutos. La figura 1 también muestra la recuperación móvil de objetos. Estos resultados amplían el artículo más allá de la manipulación en mesa, aunque siguen siendo tareas seleccionadas con tres ensayos por condición. Las ejecuciones duraron minutos: la página del proyecto indica una media de 18,9 minutos para recoger una toalla con un vídeo humano y de 17,9 minutos para la tarea del tapón de botella con vídeo y referencias de acción. Por tanto, la latencia y el coste de operación siguen siendo cuestiones prácticas, no aspectos resueltos.

El apéndice B enumera Morphi Kino junto con YAM y ARX X5 entre las configuraciones robóticas descritas en el artículo. Identifica a Morphi Kino como un robot con base móvil, cintura y cabeza, además de dos brazos de siete articulaciones. Por tanto, el artículo incluye una configuración de plataforma móvil, además de plataformas con brazos; el apéndice no identifica ningún Unitree G1.

La tarea móvil del artículo no demuestra el escenario de Reddit

La publicación de Reddit afirma que GPT-6 Astra controla un Unitree G1 en una habitación desconocida, recuerda dónde están los objetos y luego los recupera ante peticiones imprecisas. El artículo informa de la tarea distinta «Movable Exploration» y describe Morphi Kino como una plataforma con base móvil, pero ni el artículo, ni los materiales del proyecto ni el repositorio público de GitHub identifican el escenario de Reddit con el G1 como un experimento de GPT-Policy. La publicación sigue siendo una afirmación independiente sin verificar; esta comparación no la refuta.

La página del proyecto de los autores contiene vídeos de sus experimentos, que documentan las tareas que presentan, pero no constituyen una validación independiente. El repositorio público de código actualmente enumera adaptadores para ARX X5 e I2RT/YAM e indica que el árbol público no incluye los servidores de despliegue, las instrucciones privadas, las grabaciones de las ejecuciones, la calibración específica del lugar ni el historial de evaluación. Esa lista describe el repositorio publicado, pero no define todo el alcance del artículo, que también informa sobre exploración móvil y enumera Morphi Kino en el apéndice B. Los materiales disponibles no ofrecen suficiente información para que BIG CHANGE reproduzca las ejecuciones comunicadas; tampoco probamos un robot.

El límite de control sigue siendo importante

La página del proyecto informa de secuencias de acciones largas y señala dificultades de ejecución. En su debate, los autores dicen que las colisiones observadas entre brazos demostraron que las protecciones existentes no bastaban para un despliegue autónomo seguro. Piden supervisión independiente de la separación física y el contacto, junto con un control de bajo nivel más rápido y una recuperación más segura. Que un controlador rechace algunos movimientos inválidos no lo convierte, por sí solo, en un sistema de seguridad completo.

El estudio ofrece un resultado de investigación concreto: el contexto puede ayudar a un modelo general de visión y lenguaje a guiar herramientas robóticas en ciertas tareas, y el tipo de contexto importa. El tamaño de la evaluación, el tiempo por ejecución, la falta de materiales públicos completos para reproducirla y las colisiones comunicadas mantienen estos resultados muy lejos de demostrar que un robot humanoide doméstico entienda y cumpla de manera fiable peticiones abiertas.

Fuentes y lecturas adicionales