世界從未停止變化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# HomeBody 結合人形機器人的空間記憶與可重複使用技能

> 加州理工學院與史丹佛大學研究人員展示 Unitree G1 如何運用記住的廚房地圖與可重複使用技能。公開資料只有經挑選的示範,沒有受控測試結果、完整論文或機器人程式碼。

By BIG CHANGE Editorial

Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

![Conceptual charcoal illustration of a white humanoid robot walking toward a closed drawer in a light wood kitchen.](https://bigchange.ai/api/media/file/homebody-kitchen-g1-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

加州理工學院與史丹佛大學研究團隊[展示了 HomeBody](https://tml.stanford.edu/homebody/)。這套研究系統讓 GPT Astra 透過呼叫導航與操作技能,引導 Unitree G1 執行廚房任務。機器人會先探索房間,並記下曾看見物品的位置。研究團隊展示的任務包括收集咖啡包、丟棄指定紙盒,以及在藥瓶離開攝影機視野後,從抽屜中找回藥瓶。

## 核心變化

- **有哪些改變:**HomeBody 讓視覺語言模型取得已探索房間的空間紀錄,並透過共用介面呼叫機器人技能。模型選擇技能與目標;本機軟體規劃並執行動作,再回報結果。
- **為何重要:**模型能跨越不同位置規劃工作並利用回饋,不必為這間廚房重新訓練動作策略。團隊的示範呈現了如何組合記憶與既有動作技能,完成較長的任務。
- **尚待確認之處:**公開資料展示的是經挑選的示範,而非受控的成功率研究。截至 9 月 27 日,論文與機器人程式碼尚未公開,因此外界還無法依發布資料獨立重現其報告的表現。

## 機器人如何記住房間

HomeBody 從探索環境開始。根據[專案的部署說明](https://tml.stanford.edu/homebody/),G1 會收集 iPhone 廣角影片、D435i 相機觀測、LiDAR 掃描、關節姿態,以及由模型選定的路徑點。LiDAR 定位與建圖(SLAM)地圖提供實測的房間幾何資訊。Astra 利用這些資料,在 Nvidia Isaac Sim 中建立數位分身。團隊將地圖與重建場景對齊,使記錄下來的相機畫面與機器人目前位置共用同一座標系。

若指令提到機器人當下看不見的物品,這項準備就很重要。以尋找藥瓶的指令為例,團隊表示 HomeBody 會回想已儲存的相機關鍵影格來定位抽屜,接著移動到抽屜前、打開抽屜並拿起藥瓶。房間模型支援導航與位置回想;最後的實際操作仍由即時相機畫面引導。

專案頁面上的[互動式廚房展示](https://tml.stanford.edu/homebody/)明確標示為示意內容,場景是在重建的房間中運行。頁面另行展示 G1 執行廚房任務的影片,並將導航、抓取、放置及開抽屜技能片段標示為真實機器人畫面。這些影片記錄團隊挑選的實際執行結果,而模擬回放則用來說明規劃流程。

## 從模型決策到機器人動作

模型會收到任務、目前相機畫面、地圖脈絡、夾爪狀態、回想出的觀測資料,以及前一項技能的結果。接著,它會送出一個結構化呼叫,指出要執行的技能與目標。抓取任務的目標是 0 至 1000 刻度上的影像位置點,並須選擇使用哪隻手臂。本機感知模組會分割物體、依據立體影像估算深度,並將選定位置轉換成 3D 抓取點。接著,手臂規劃器計算並檢查動作路徑。導航則在地圖座標中使用 2D 目標與面向點;放置任務使用 3D 釋放位置。開抽屜技能把手把對齊、勾住把手及向後行走整合成一個動作。

各項技能會在本機處理細部修正。團隊描述了接近目標時的視覺追蹤,以及抓取失敗時有限次數的重試。若仍無法復原,技能會回傳原因,供 Astra 再次決策。行走與伸手依賴預先訓練的全身控制器 AMO。專案頁面表示,手臂與手部指令以 250 Hz 執行,AMO 策略則以 50 Hz 更新。Astra 在遠端運行;感知、動作規劃及技能則在配備 RTX 4090 GPU 的筆電上執行。

Astra 選擇*要嘗試的*動作,並決定*目標位置*;技能庫與控制器則決定*G1 如何移動*。團隊表示,廚房示範沒有使用特定環境的訓練資料,也沒有額外進行策略學習。不過,系統仍使用既有的預訓練控制器,並需要大量重建房間環境。

## 示範能證明什麼

專案頁面描述了在一間先前未見過的廚房中,執行的兩組實體任務。一組任務是收集咖啡包,並丟棄指定的牛奶盒和柳橙汁盒。另一組則是讓 G1 從資訊不完整的指令中找出藥瓶,從抽屜取出並遞交,再丟棄一個紙盒。技能片段展示個別動作及記錄下來的重試;頁面說大多數預覽影片經過加速,並指出一段抽屜抓取過程連續重試。

公開資料沒有提供試驗次數、任務成功率、與經訓練的視覺語言動作策略之比較,或每次廚房任務完成所需的時間與成本。因此,它呈現的是系統架構示範,不能據此宣稱此設計在其他廚房也能可靠運作。[連結的公開程式碼庫](https://github.com/Stanford-TML/homebody)目前標示「程式碼即將推出」,而專案頁面的論文欄位沒有連結到任何手稿。程式碼庫目前只有網站、插圖與影片,沒有機器人實作或評估檔案。BIG CHANGE 未執行 HomeBody,也未測試機器人。

BIG CHANGE 先前的[GPT-Policy 報導](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents)檢視另一個團隊有關機器人動作脈絡的論文。HomeBody 的資料並未指出該論文屬於這套系統。

團隊列出幾項實務限制:建立數位分身需要前置設定時間並產生 API 費用;Astra 的遠端推理會讓技能之間出現停頓;G1 的伸手與操作能力有限;手指伺服馬達在長時間運作時可能過熱。本機系統需要配備 RTX 4090 的筆電,較耗資源的技能可能需要更高運算能力。

## 來源與延伸閱讀

- [加州理工學院與史丹佛大學研究團隊的 HomeBody 專案頁面](https://tml.stanford.edu/homebody/)——主要資料來源,介紹系統架構、廚房示範、模擬回放、技能介面、控制系統與團隊所述的限制。頁面日期為 2026 年 9 月;其中挑選的影片與文字說明是團隊提供的證據,並非獨立評估。
- [史丹佛大學 TML 的 HomeBody 公開程式碼庫](https://github.com/Stanford-TML/homebody)——由專案頁面連結。查閱日期為 2026 年 9 月 27 日,README 標示程式碼即將推出;公開目錄提供網站素材,沒有機器人實作或完整論文。

## Sources

- [加州理工學院與史丹佛大學研究團隊的 HomeBody 專案頁面](https://tml.stanford.edu/homebody/) — 作者對系統架構、實體廚房示範、明確標示為示意的模擬展示、技能介面、運算配置及限制所作的說明。頁面挑選的影片與文字並非受控的獨立評估;論文欄位也沒有連結至手稿。
- [史丹佛大學 TML 的 HomeBody 公開程式碼庫](https://github.com/Stanford-TML/homebody) — README 標示程式碼即將推出。公開目錄包含專案網站與媒體素材,沒有機器人實作或評估檔案。建立程式碼庫的時間不能證明實驗何時進行。
BIG CHANGE 電子報

掌握全貌,按照自己的步調。

關於人工智慧和機器人技術的近期報導、值得關注的轉變,以及可運用的實用想法。選擇每日快訊、每週摘要或每月觀點。