LE MONDE NE S’ARRÊTE PAS.RSS
BIG CHANGE.

Édition Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy met à l’épreuve le rôle du contexte dans des tâches de robotique mobile et à bras manipulateur

> Une prépublication de septembre présente une tâche d’exploration mobile menée en trois essais, aux côtés d’expériences avec un bras robotique. Elle ne confirme pas l’affirmation distincte de Reddit au sujet de GPT-6 Astra et d’un Unitree G1.

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Une prépublication arXiv de septembre, intitulée [« In-Context Robot Learning with VLM Agents »](https://arxiv.org/html/2609.19138v1), présente GPT-Policy, qui relie un modèle de vision-langage fixe à des outils robotiques à l’aide de démonstrations, d’images et de l’historique des interactions. Ses expériences comprennent des tâches avec un bras robotique et de l’exploration mobile. Elles ne valident pas l’affirmation distincte publiée dans le [post Reddit au sujet de GPT-6 Astra et d’un Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).

## Le grand changement

- **Ce qui a changé :** GPT-Policy fournit à un modèle général de vision-langage une méthode structurée pour transformer des démonstrations et des vues caméra actuelles en requêtes adressées aux outils du robot, puis exploiter les retours d’exécution afin de choisir l’action suivante, sans modifier les poids du modèle propres à la tâche.
- **Pourquoi c’est important :** Cette approche sépare le raisonnement visuel général des vérifications de mouvement et de l’exécution. Dans les essais limités des auteurs, l’ajout de contexte a aidé pour certaines tâches, tandis que les actions sensibles au contact nécessitaient parfois des références d’actions robotiques alignées.
- **À suivre :** L’article ne rapporte que trois essais par condition et décrit des exécutions lentes sujettes aux échecs, notamment des collisions entre les bras. Il faudra reproduire les résultats, mener des évaluations plus vastes et mettre en place des contrôles de sécurité indépendants avant de pouvoir en tirer des conclusions sur des robots opérant à proximité de personnes.

## Ce que fait GPT-Policy

L’article a été soumis à arXiv le 16 septembre. Il examine si un modèle général de vision-langage peut s’appuyer sur des exemples et des retours pour accomplir une tâche à partir d’un nouvel état initial, sans réglage fin ni modification des paramètres du modèle propres à la tâche. Les auteurs nomment leur cadre GPT-Policy et indiquent avoir évalué GPT-6 Astra parmi les modèles.

Le système rassemble plusieurs types de contexte : une consigne de tâche, les vues caméra et l’état actuels, ainsi que, en option, des vidéos de démonstration humaine, des démonstrations robotiques accompagnées de références d’action, une image cible, des tentatives robotiques antérieures ou des interactions humaines. Un compilateur de contexte sélectionne les transitions visuelles pertinentes pour la tâche et les combine avec des consignes, des contraintes et des schémas d’outils. Le modèle de vision-langage propose ensuite une requête structurée à destination des outils robotiques.

Cette requête est transmise à un contrôleur propre à la configuration robotique. Les auteurs décrivent la vérification de solutions de cinématique inverse, l’échantillonnage de poses cartésiennes et la planification temporelle des consignes articulaires avant d’exécuter ou de rejeter un mouvement. Le contrôleur renvoie des observations et des retours d’exécution pour la décision suivante du modèle. Le modèle propose des actions ; un code propre au robot les valide et les exécute.

Cette boucle constitue la principale contribution de l’article. Elle permet à un modèle de vision-langage fixe d’adapter l’action suivante en fonction d’exemples et des résultats récents, sans mise à jour par descente de gradient. Ici, « apprentissage en contexte » désigne l’utilisation par le système des informations fournies pendant une tâche. Cela ne signifie pas que le modèle a appris durablement une nouvelle compétence ni que tous les robots peuvent utiliser la même interface d’outils.

## Ce que mesurent les essais

Les auteurs rapportent cinq familles d’expériences couvrant dix tâches robotiques, avec trois essais par condition. Leur [page de projet](https://cheng-haha.github.io/GPT-Policy/) répertorie des exécutions sur de vrais robots et publie les résultats par tâche, les décisions et le temps écoulé. Pour le ramassage d’une serviette, GPT-6 Astra réussit deux essais sur trois avec une vidéo humaine et aucun sur trois sans vidéo. Pour le ramassage d’un carnet, les résultats passent également de zéro sur trois sans démonstration à deux sur trois avec démonstration.

Les tâches impliquant un contact montrent pourquoi l’ajout de contexte n’est pas une solution générale. Pour dévisser un bouchon de bouteille, une vidéo du robot donne deux réussites sur trois ; l’ajout de références d’actions robotiques alignées porte le résultat à trois sur trois. Pour retirer puis rebrancher une prise, la condition avec vidéo seule n’obtient aucune réussite sur trois, tandis que la combinaison vidéo et références d’action en obtient deux. Ces nombres sont de petits décomptes par condition, pas des estimations de fiabilité.

Le projet rapporte aussi trois réussites sur trois pour des arrangements de blocs et de fruits guidés par une image cible, ainsi que pour deux tâches d’interaction humaine. Avec l’historique des interactions du robot lui-même, l’article rapporte trois réussites sur trois pour « Lemon to Pink Plate » et « Movable Exploration ». Dans cette dernière tâche, le robot évite activement les obstacles tout en recherchant la cible ; le temps moyen écoulé est de 25,53 minutes. La figure 1 montre également la récupération d’un objet par un robot mobile. Ces résultats élargissent le périmètre de l’article au-delà de la manipulation sur table, mais restent limités à des tâches sélectionnées et à trois essais par condition. Les exécutions durent plusieurs minutes : la page du projet indique une moyenne de 18,9 minutes pour le ramassage d’une serviette avec vidéo humaine et de 17,9 minutes pour le bouchon de bouteille avec vidéo et références d’action. La latence et le coût d’exploitation restent donc des questions pratiques, et non des aspects résolus.

L’annexe B cite Morphi Kino aux côtés de YAM et d’ARX X5 parmi les configurations robotiques décrites dans l’article. Elle indique que Morphi Kino est équipé d’une base mobile, d’un torse et d’une tête, ainsi que de deux bras à sept articulations. L’article comprend donc une configuration sur plateforme mobile en plus des plateformes à bras ; l’annexe ne mentionne pas Unitree G1.

## La tâche mobile de l’article n’établit pas le scénario de Reddit

Le [post Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) affirme que GPT-6 Astra pilote un Unitree G1 dans une pièce inconnue, mémorise l’emplacement des objets et les récupère ensuite à partir de demandes vagues. L’article présente la tâche distincte « Movable Exploration » et décrit Morphi Kino comme une plateforme à base mobile, mais ni l’article, ni les ressources du projet, ni le [dépôt GitHub public](https://github.com/cheng-haha/GPT-Policy) ne désignent le scénario de Reddit impliquant un G1 comme une expérience GPT-Policy. Le post reste une affirmation distincte qui n’a pas été vérifiée ; cette comparaison ne la réfute pas.

La [page du projet](https://cheng-haha.github.io/GPT-Policy/) des auteurs contient des vidéos de leurs expériences, qui témoignent des tâches qu’ils rapportent, mais ne constituent pas une validation indépendante. Le [dépôt de code public](https://github.com/cheng-haha/GPT-Policy) répertorie actuellement des adaptateurs pour ARX X5 et I2RT/YAM et précise que les hôtes de déploiement, les invites privées, les enregistrements d’exécution, l’étalonnage propre à chaque site et l’historique d’évaluation ne figurent pas dans l’arborescence publique. Cette liste d’adaptateurs décrit le dépôt publié ; elle ne définit pas toute l’étendue de l’article, qui rapporte aussi l’exploration mobile et cite Morphi Kino en annexe B. Les ressources disponibles ne donnent pas suffisamment de détails pour que BIG CHANGE puisse reproduire les exécutions rapportées, et nous n’avons pas testé de robot.

## La limite de sécurité reste déterminante

La page du projet fait état de séquences d’actions longues et de difficultés d’exécution. Selon la discussion des auteurs, les collisions observées entre les bras montrent que les protections en place ne suffisaient pas à garantir un déploiement autonome sûr. Ils préconisent une surveillance indépendante de la distance physique et des contacts, ainsi qu’un contrôle de bas niveau plus rapide et des procédures de récupération plus sûres. Le fait qu’un contrôleur rejette certains mouvements invalides ne suffit pas à en faire un système de sécurité complet.

L’étude apporte un résultat de recherche concret : le contexte peut aider un modèle général de vision-langage à guider les outils d’un robot dans certaines tâches, et le type de contexte compte. L’ampleur de l’évaluation, la durée des exécutions, le manque de ressources publiques permettant de reproduire entièrement les résultats et les collisions rapportées sont loin de constituer une preuve qu’un humanoïde domestique comprendrait de manière fiable des demandes ouvertes et les exécuterait.

## Sources et lectures complémentaires

- [Cheng et al., « In-Context Robot Learning with VLM Agents » (arXiv:2609.19138, version 1, soumis le 16 septembre 2026)](https://arxiv.org/abs/2609.19138) — Prépublication principale décrivant la méthode, l’évaluation et les limites exposées ; il ne s’agit ni d’un article évalué par les pairs ni d’un rapport de déploiement.
- [Page du projet GPT-Policy des auteurs](https://cheng-haha.github.io/GPT-Policy/) — Descriptions des expériences, vidéos, résultats par condition et discussion. Il s’agit des propres ressources des auteurs.
- [Dépôt public du code GPT-Policy des auteurs](https://github.com/cheng-haha/GPT-Policy) — Documente les adaptateurs robotiques actuellement publiés et les éléments absents du dépôt public ; la disponibilité du dépôt ne suffit pas à établir que les expériences rapportées peuvent être reproduites.
- [Le post Reddit à l’origine de cet article](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Source de l’affirmation concernant Unitree G1 ; le post ne cite aucun élément reliant ce scénario à l’article.

## Sources

- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — Prépublication principale, soumise le 16 septembre ; décrit la méthode GPT-Policy proposée et présente l’évaluation des auteurs ainsi que ses limites ; ne constitue ni une preuve évaluée par les pairs ni une preuve de déploiement.
- [Page du projet GPT-Policy des auteurs](https://cheng-haha.github.io/GPT-Policy/) — Ressources primaires des auteurs pour la description du système, les expériences, les tableaux de résultats, les vidéos et la discussion ; elles ne constituent pas une validation indépendante.
- [Dépôt public du code GPT-Policy des auteurs](https://github.com/cheng-haha/GPT-Policy) — Source primaire sur les adaptateurs publiés et le contenu inclus ou omis du dépôt ; ne fournit pas l’ensemble des données d’étalonnage, des invites ou de l’historique d’évaluation nécessaires à une reproduction clé en main.
- [Post Reddit affirmant que GPT-6 Astra pilote un Unitree G1 dans une pièce inconnue](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Origine de l’affirmation virale examinée ; ne prouve pas que l’article ou les plateformes robotiques à bras qui y sont citées ont réalisé le scénario décrit.
La newsletter BIG CHANGE

Prendre du recul, à votre rythme.

Articles récents sur l’IA et la robotique, évolutions à surveiller et idées pratiques à utiliser. Choisissez un briefing quotidien, une synthèse hebdomadaire ou une analyse mensuelle.