一份 9 月的arXiv 預印本《In-Context Robot Learning with VLM Agents》介紹 GPT-Policy:將固定的視覺語言模型連接至機器人工具,並使用示範、影像和互動歷程。實驗涵蓋機器人手臂任務及移動探索,但並未驗證另一則Reddit 貼文中關於 GPT-6 Astra 與 Unitree G1 的說法。

核心變化

  • 有哪些改變:GPT-Policy 提供一種結構化方式,讓通用視覺語言模型將示範和即時相機畫面轉換為機器人工具請求,再依據執行回饋選擇下一步動作,而不必更新模型專屬任務的權重。
  • 為何重要:這種方法將廣泛的視覺推理與動作檢查、執行流程分開。在作者有限的試驗中,增加情境資料對部分任務有幫助;但對接觸敏感的動作,有時需要與機器人動作相互對齊的參考資料。
  • 後續觀察重點:論文每種條件僅報告三次試驗,並指出執行時間長、容易失敗,包括手臂碰撞。在這些結果能說明機器人如何在人類周遭工作之前,仍須進行重現、更大規模的評估,並採用獨立安全控制。

GPT-Policy 的運作方式

論文於 9 月 16 日提交至 arXiv,探討通用視覺語言模型能否運用範例與回饋,在不微調或變更任務專屬模型參數的情況下,從新的初始狀態執行任務。作者將其框架稱為 GPT-Policy,並將 GPT-6 Astra 列為評估模型之一。

系統會組合多種情境資料:任務指示、目前的相機畫面與狀態,以及可選的人類示範影片、附有動作參考的機器人示範、目標影像、先前機器人嘗試或人機互動紀錄。情境編譯器會挑選與任務相關的視覺變化,並與指示、限制及工具結構描述組合。接著,視覺語言模型會提出結構化的機器人工具請求。

該請求會交由特定機器人本體的控制器處理。作者表示,控制器會在執行或拒絕動作前,檢查反向運動學解、取樣笛卡兒姿態並安排關節參考。之後,控制器會回傳觀察結果及執行回饋,供模型決定下一步。模型提出動作;機器人專屬程式碼則負責驗證並執行。

這個迴圈是論文的主要貢獻。固定的視覺語言模型可以根據範例與近期結果調整下一步動作,而不必更新梯度。此處的「情境學習」指系統如何使用任務期間提供的資訊;這不代表模型永久學會新技能,也不代表每種機器人都能使用相同的工具介面。

試驗測量了什麼

作者報告了十種機器人任務、五類實驗,每種條件各進行三次試驗。他們的專案頁面列出真實機器人執行項目,並公布任務結果、決策及耗時。毛巾拾取任務中,GPT-6 Astra 使用人類影片示範時三次成功兩次,未使用示範時三次皆未成功。筆記本拾取任務也從未提供示範時三次皆未成功,提升至提供示範後三次成功兩次。

接觸類任務顯示,增加情境資料並非萬靈丹。旋開瓶蓋任務中,使用機器人影片時三次成功兩次;再加入對齊的機器人動作參考後,三次皆成功。拔出並重新插入插頭的任務中,只提供影片時三次都未成功,影片加上動作參考則成功兩次。這些是各條件下的小樣本次數,不能視為可靠度估計。

專案另報告了目標影像方塊與水果排列,以及兩項人機互動任務均三次成功三次。在使用自我互動歷程的條件下,論文報告「檸檬放到粉紅盤子」和「可移動探索」兩項任務都三次成功三次。後者中,機器人會在尋找目標時主動避開障礙物;平均耗時為 25.53 分鐘。圖 1 也呈現移動式物件取回。這些結果擴展了論文的範圍,使其不只涵蓋桌面操作,但仍是每種條件三次試驗的特定任務。執行時間以分鐘計:專案頁面報告,使用人類影片拾取毛巾平均需 18.9 分鐘,使用影片與動作參考完成瓶蓋任務平均需 17.9 分鐘。因此,延遲與營運成本仍是實務問題,並未獲得解決。

附錄 B 將 Morphi Kino 與 YAM、ARX X5 一同列為論文介紹的機器人配置之一。附錄指出,Morphi Kino 具有移動底座、腰部與頭部,以及兩支七關節手臂。因此論文除手臂平台外,也包含移動平台配置;附錄並未列出 Unitree G1。

論文中的移動任務無法證實 Reddit 情境

該Reddit 貼文聲稱 GPT-6 Astra 能在陌生房間控制 Unitree G1、記住物品位置,並在之後依據含糊的要求取回物品。論文報告的是另一項「可移動探索」任務,並將 Morphi Kino 描述為移動底座平台;然而,論文、專案資料和公開 GitHub 儲存庫都未指出 Reddit 貼文所述的 G1 情境是 GPT-Policy 實驗。該貼文仍是另一項未經查證的說法;這項比較也不能反過來證明貼文為假。

作者的專案頁面包含實驗影片,可作為作者所報告任務的佐證,但不構成獨立驗證。公開的程式碼儲存庫目前列出 ARX X5 與 I2RT/YAM 的介接器,並說明公開目錄未包含部署主機、私有提示、執行記錄、場地專屬校準或評估歷程。這份介接器清單描述的是已發布的儲存庫,並不代表論文的完整範圍;論文也報告移動探索,並在附錄 B 列出 Morphi Kino。現有資料不足以讓 BIG CHANGE 重現所報告的執行結果,我們也未測試機器人。

控制邊界仍然重要

專案頁面報告了耗時較長的動作序列,也提到執行上的困難。作者在討論中表示,觀察到手臂彼此碰撞,顯示現有防護措施不足以支援安全的自主部署。他們呼籲獨立監測實體間距與接觸情形,同時提升低階控制速度,並改善安全復原機制。控制器能拒絕某些無效動作,單憑這一點並不足以構成完整的安全系統。

這項研究提出一個具體結果:情境資料可以協助通用視覺語言模型引導機器人工具完成某些任務,而且情境資料的類型會造成影響。但評估規模、每次執行時間、公開重現資料不完整,以及報告中的碰撞事件,都表示這些結果距離證明家用人形機器人能可靠理解並執行開放式要求還有很大差距。

資料來源與延伸閱讀