CaltechとStanfordの研究チームはHomeBodyを実演した。これはGPT Astraがナビゲーションや操作の技能を呼び出し、Unitree G1にキッチンで作業させる研究システムだ。ロボットはまず室内を探索し、物体を見かけた場所を記録する。チームのデモでは、コーヒーの袋を集め、指定された紙パックを捨て、薬瓶がカメラの視界から外れた後で引き出しから取り出す。

大きな変化

  • 変わったこと:HomeBodyは、視覚言語モデルに、探索済みの部屋の空間記録とロボット技能の共通インターフェースを提供する。モデルが技能と目標位置を選び、ローカルソフトウェアが動きを計画して実行し、その結果をモデルに返す。
  • なぜ重要か:このモデルは、キッチン専用の行動ポリシーを新たに学習させずに、場所をまたいで計画し、実行結果を使って次の行動を決められる。チームの実演は、記憶と既存の運動技能を組み合わせ、より長い作業を行う方法を示している。
  • まだ分からないこと:公開資料にあるのは選ばれたデモであり、成功率を調べる対照実験ではない。9月27日時点で論文とロボットのコードは公開されていないため、公開資料だけでは報告された性能を独立に再現できない。

ロボットは部屋をどう記憶するか

HomeBodyは室内の探索から始まる。プロジェクトの導入説明によると、G1はiPhoneの広角映像、D435iカメラの観測、LiDARスキャン、関節姿勢、モデルが選んだ経由地点を収集する。LiDARを使ったSLAM地図から、計測された室内形状を得る。Astraはそれらの情報を使い、Nvidia Isaac Sim内にデジタルツインを構築する。チームは地図と再構成を位置合わせし、記録済みのカメラ映像とロボットの現在位置が同じ座標系を使うようにする。

この準備は、ロボットが今は見ていない物体を指す指示を受けたときに役立つ。薬を探す実演では、HomeBodyが記録済みのカメラ映像の要所を思い出して引き出しを見つけ、その場所まで移動し、引き出しを開けて薬瓶を取るとチームは説明している。部屋のモデルは移動と場所の想起を支え、実際に物体をつかむ最終段階では、現在のカメラ映像が引き続き使われる。

プロジェクトページのキッチン作業の対話型再現は、説明上のデモと明記され、再構成された室内で行われる。同ページは、G1がキッチンで作業する映像を別に掲載し、ナビゲーション、把持、配置、引き出し操作の技能映像を実機の記録と表示している。これらの映像はチームが選んだ実行例を示し、シミュレーションによる再現は計画の流れを説明する。

モデルの判断から動きへ

モデルには、作業内容、現在のカメラ映像、地図の情報、グリッパーの状態、想起した観測、直前の技能の実行結果が渡される。モデルは技能と目標を指定する構造化された呼び出しを返す。物体をつかむ場合、目標は0~1000の尺度で示す画像上の点と、使う手の選択だ。ローカルの認識処理が物体を切り出し、ステレオ画像から奥行きを推定して、選択位置を3Dの把持点に変換する。次に腕の動作計画器が経路を計算し、安全性を確認する。ナビゲーションでは地図上の座標で2Dの目標地点と向きを指定し、物体を置く場合は3Dの解放位置を使う。引き出しを開ける技能では、取っ手への位置合わせ、引っかけ、後退動作が一つの動作にまとめられている。

技能ごとにローカルで小さな修正を行う。チームによると、接近時は視覚追跡を行い、把持に失敗した場合は回数を限って再試行する。回復できなければ、技能が理由をAstraに返し、次の判断を促す。歩行と腕の動作には、AMOという事前学習済みの全身コントローラーを使う。同ページによると、腕と手の指令は毎秒250回、AMOポリシーの更新は毎秒50回行われる。Astraは遠隔で動作し、認識、動作計画、技能はRTX 4090 GPUを搭載したノートPC上で実行される。

Astraは「何を」試すかという行動と「どこで」行うかを選び、技能ライブラリとコントローラーが「どのように」G1を動かすかを決める。チームによると、キッチンの実演では環境固有の学習データや追加のポリシー学習を使っていない。ただし、事前学習済みの制御器と、室内の詳細な再構成は引き続きシステムの一部だ。

実演で確認できること

プロジェクトページは、未知のキッチンで行った2種類の実機作業を紹介している。一方ではコーヒーの袋をまとめ、指定された牛乳とオレンジジュースの紙パックを捨てる。もう一方では、曖昧な指示から薬瓶を探し、G1が引き出しから取り出して手渡した後、紙パックを捨てる。技能映像には個別の動作と記録された再試行が含まれる。同ページによると、プレビュー映像の多くは早送りで、引き出しから薬瓶を取る場面では連続して再試行する様子も示されている。

公開資料には試行回数、作業の成功率、学習済み視覚言語行動ポリシーとの比較、キッチン作業1回あたりの時間やコストは示されていない。したがって、確認できるのはシステム構成の実演であり、別のキッチンでも安定して動くことを測定した結果ではない。公開リポジトリには現在「コードは近日公開」と記され、プロジェクトページの「論文」欄にも原稿へのリンクはない。リポジトリにあるのはウェブサイトの素材、イラスト、映像で、ロボットの実装や評価用ファイルは含まれていない。BIG CHANGEはHomeBodyを実行しておらず、ロボットもテストしていない。

BIG CHANGEが以前に紹介したGPT-Policyのレポートは、ロボットの行動に関する文脈を扱った別チームの論文を取り上げた。HomeBodyの資料は、その論文がこのシステムの一部だとは述べていない。

チームは実用上の制約も挙げている。デジタルツインの構築には準備時間とAPI利用料がかかり、Astraの遠隔推論によって技能の間に待ち時間が生じる。G1の可動範囲や操作能力にも限界があり、長時間使うと指のサーボが過熱することがある。ローカルのソフトウェア一式にはRTX 4090搭載ノートPCが必要で、より重い技能にはさらに多くの計算資源が必要になる場合がある。

出典・関連資料

  • CaltechとStanfordの研究者によるHomeBodyプロジェクトページ — システム構成、キッチンでの実機デモ、シミュレーションによる再現、技能インターフェース、制御スタック、明記された制約についての主要な著者側資料。2026年9月付。掲載された選定映像と説明はチームによる証拠であり、独立した評価ではない。「論文」欄には原稿へのリンクがない。
  • Stanford TMLのHomeBody公開リポジトリ — プロジェクトページからリンクされている。2026年9月27日に確認した時点で、READMEにはコードは近日公開とある。公開ツリーにはウェブサイトとメディアが含まれ、ロボットの実装や論文全文はない。リポジトリの作成時期は、実験の実施時期を裏付ける証拠ではない。