AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy、ロボットアームと移動探索の実験を報告

> 9月のプレプリントは、ロボットアームの実験に加え、移動ロボットによる探索課題を3回試行したと報告している。一方、GPT-6 AstraとUnitree G1を組み合わせたという別のReddit投稿の主張を裏付けるものではない。

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

9月に公開された[arXivプレプリント「In-Context Robot Learning with VLM Agents」](https://arxiv.org/html/2609.19138v1)は、実演映像、画像、やり取りの履歴を使い、固定された視覚言語モデルをロボットツールにつなぐGPT-Policyを紹介している。実験にはロボットアームを使う課題と移動探索が含まれる。これらは、別途流通している[GPT-6 AstraとUnitree G1に関するReddit投稿の主張](https://www.reddit.com/r/singularity/s/tjaYXdzfnI)を検証するものではない。

## 大きな変化

- **変わったこと：**GPT-Policyは、汎用の視覚言語モデルが実演例と現在のカメラ映像をロボットツールへの要求に変換し、その実行結果を受けて次の行動を選ぶための構造化された方法を示す。モデル固有のタスク重みは更新しない。
- **なぜ重要か：**この方法は、広範な視覚的推論と動作の確認・実行を分担する。著者らの限られた試行では、追加の文脈が一部の課題に役立つ一方、接触を伴う動作では、対応するロボット動作の参照情報が必要な場合もあった。
- **今後の注目点：**論文が報告する試行は各条件3回に限られ、時間がかかり失敗しやすい実行や、ロボットアームの衝突も記述されている。人のそばでロボットが動く結果として評価するには、再現、大規模な評価、独立した安全制御が重要になる。

## GPT-Policyの仕組み

この論文は9月16日にarXivへ投稿された。汎用の視覚言語モデルが、ファインチューニングやタスク固有のモデルパラメーター変更を行わずに、例とフィードバックを使って、新しい初期状態から課題を実行できるかを検証している。著者らは提案手法をGPT-Policyと名付け、評価したモデルの一つにGPT-6 Astraを挙げている。

システムは複数の種類の文脈を組み合わせる。課題の指示、現在のカメラ映像と状態に加え、人による実演動画、ロボット動作の参照情報を含む実演、目標画像、過去のロボット試行、または人とのやり取りを任意で利用する。文脈コンパイラーは課題に関係する視覚的な変化を選び、指示、制約、ツールのスキーマと組み合わせる。次に視覚言語モデルが、構造化されたロボットツール要求を提案する。

その要求は、ロボットの形態に応じたコントローラーに渡される。著者らによると、コントローラーは逆運動学の解を確認し、直交座標上の姿勢をサンプリングし、関節の参照軌道のタイミングを調整したうえで、動作を実行するか拒否する。コントローラーは観測情報と実行結果を返し、それを次のモデル判断に利用する。行動を提案するのはモデルだが、ロボット固有のコードが検証して実行する。

このループが論文の主な貢献だ。勾配更新を行わず、固定された視覚言語モデルが例と直近の結果に応じて次の行動を調整できる。ここでいう「文脈内学習」とは、課題の実行中に与えられる情報を使う仕組みを指す。モデルが新しい技能を恒久的に学んだことや、すべてのロボットが同じツールインターフェースを使えることを意味しない。

## 試行で測定したこと

著者らは、10種類のロボット課題にわたる5つの実験群を報告し、各条件で3回ずつ試行した。著者らの[プロジェクトページ](https://cheng-haha.github.io/GPT-Policy/)には、実機での実行映像と、課題の結果、判断、所要時間が掲載されている。タオルを拾う課題では、GPT-6 Astraは人の実演動画がある条件で3回中2回成功し、動画なしでは3回とも成功しなかった。ノートを拾う課題も、実演なしでは成功0回だったが、実演を与えると3回中2回成功した。

接触を伴う課題を見ると、追加の文脈が万能な解決策ではないことが分かる。瓶のふたを開ける課題では、ロボットの実演動画だけの場合は3回中2回成功し、動作が対応付けられたロボット動作の参照情報も加えると3回すべて成功した。プラグの抜き差しでは、動画のみの条件は3回とも失敗した一方、動画に動作参照を加えた条件では3回中2回成功した。これは条件ごとの少数の試行結果であり、信頼性の推定値ではない。

プロジェクトは、目標画像に基づくブロック配置と果物の配置、および人とのやり取りを含む2つの課題でも3回中3回の成功を報告している。自己の過去のやり取りを使う条件では、「レモンをピンクの皿へ」と「移動探索」の両方で、3回中3回成功したと論文は報告する。後者では、ロボットは目標を探す間に能動的に障害物を避け、平均所要時間は25.53分だった。図1には移動ロボットによる物体回収も描かれている。これらの結果は、論文が卓上操作以外の課題も扱っていることを示すが、各条件3回の選定課題にとどまる。実行には数分かかった。プロジェクトページによると、人の実演動画を使ったタオル拾いは平均18.9分、動画と動作参照を使った瓶のふた開けは17.9分だった。したがって、遅延と運用コストは実用上の課題として残っており、解決済みではない。

付録Bは、論文に記載されたロボット構成の一つとして、YAM、ARX X5とともにMorphi Kinoを挙げている。同機は移動台座、胴体、頭部に加え、7関節の腕を2本備えると記されている。つまり論文はアーム型の構成に加えて移動台座を持つ構成も扱うが、付録BにUnitree G1の記載はない。

## この論文の移動課題はRedditのシナリオを裏付けない

この[Reddit投稿](https://www.reddit.com/r/singularity/s/tjaYXdzfnI)は、GPT-6 Astraが見慣れない部屋でUnitree G1を操作し、物体の場所を記憶して、曖昧な指示を受けた後に物体を取りに行くと主張している。論文は別の「移動探索」課題を報告し、Morphi Kinoを移動台座付きのプラットフォームとして説明している。しかし、論文、プロジェクト資料、[公開GitHubリポジトリ](https://github.com/cheng-haha/GPT-Policy)のいずれにも、Reddit投稿のG1シナリオがGPT-Policyの実験だったとは記されていない。この投稿は別個の未検証の主張であり、今回の比較だけで誤りと証明されたわけではない。

著者らの[プロジェクトページ](https://cheng-haha.github.io/GPT-Policy/)には実験映像があり、報告された課題が実施されたことを示す資料ではあるが、独立した検証ではない。公開されている[コードリポジトリ](https://github.com/cheng-haha/GPT-Policy)には現在、ARX X5とI2RT／YAM用のアダプターが掲載されている。配置先のホスト、非公開プロンプト、実行記録、現場固有の調整、評価履歴は公開ツリーに含まれないと説明されている。アダプターの一覧は公開リポジトリの内容を示すものであり、移動探索も報告し付録BでMorphi Kinoを挙げる論文全体の範囲を定めるものではない。公開資料だけでは報告された実験をBIG CHANGEが再現するのに十分な詳細がなく、当社はロボットを試験していない。

## 制御の境界は依然として重要だ

プロジェクトページは、長い動作の連なりと実行上の困難を報告している。そこでの説明によると、観察された腕同士の衝突から、自律運用を安全に行うには既存の安全策が不十分だと分かった。物理的な距離と接触を独立に監視することに加え、低レベル制御の高速化と、より安全な復旧が必要だとしている。不適切な動作の一部をコントローラーが拒否できることだけで、完全な安全システムになるわけではない。

この研究は具体的な成果を示している。文脈は、汎用の視覚言語モデルが特定の課題でロボットツールを操作するのに役立ち、どの種類の文脈を使うかも重要だ。しかし、評価規模、1試行あたりの時間、公開再現資料の不足、報告された衝突を踏まえると、この結果は家庭用ヒューマノイドが自由形式の指示を安定して理解し実行する証拠からは大きく隔たっている。

## 出典・関連資料

- [Chengほか「In-Context Robot Learning with VLM Agents」（arXiv:2609.19138、バージョン1、2026年9月16日投稿）](https://arxiv.org/abs/2609.19138)。これは手法、評価、明記された制約についての主要なプレプリントであり、査読済みの証拠でも実運用に関する報告でもない。
- [著者らのGPT-Policyプロジェクトページ](https://cheng-haha.github.io/GPT-Policy/)。実験の説明、映像、条件ごとの結果、考察を掲載する。著者ら自身が作成した資料であり、独立した検証ではない。
- [著者らのGPT-Policy公開コードリポジトリ](https://github.com/cheng-haha/GPT-Policy)。公開されているアダプターと、公開ツリーに含まれないものを記録している。リポジトリが利用可能であることだけでは、報告された実験を再現できるとは限らない。
- [今回の報告のきっかけとなったReddit投稿](https://www.reddit.com/r/singularity/s/tjaYXdzfnI)。Unitree G1に関する主張の出所だが、投稿はそのシナリオと論文を結びつける証拠を示していない。

## Sources

- [Chengほか「In-Context Robot Learning with VLM Agents」、arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — 9月16日投稿の主要なプレプリント。提案されたGPT-Policy手法と著者らの評価、制約を報告している。査読済みの論文でも、実運用を示す証拠でもない。
- [著者らのGPT-Policyプロジェクトページ](https://cheng-haha.github.io/GPT-Policy/) — システム説明、実験、結果表、映像、考察に関する著者側の主要資料。独立した検証ではない。
- [著者らのGPT-Policy公開コードリポジトリ](https://github.com/cheng-haha/GPT-Policy) — 公開済みのアダプターとリポジトリの内容・欠落を確認する主要資料。即時再現に必要な調整情報、プロンプト、評価履歴がすべて含まれるわけではない。
- [GPT-6 AstraがUnitree G1を見慣れない部屋で操作すると主張するReddit投稿](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — 検証対象となった広く共有された主張の出所。論文や、記載されたアーム型ロボットが投稿のシナリオを実行した証拠ではない。
