AI-translated from English; not yet reviewed by a fluent editor.

# HomeBody 結合人形機器人的空間記憶與可重複使用技能

> 加州理工學院與史丹佛大學研究人員展示 Unitree G1 如何運用記住的廚房地圖與可重複使用技能。公開資料只有經挑選的示範，沒有受控測試結果、完整論文或機器人程式碼。

By BIG CHANGE Editorial

Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

![Conceptual charcoal illustration of a white humanoid robot walking toward a closed drawer in a light wood kitchen.](https://bigchange.ai/api/media/file/homebody-kitchen-g1-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

加州理工學院與史丹佛大學研究團隊[展示了 HomeBody](https://tml.stanford.edu/homebody/)。這套研究系統讓 GPT Astra 透過呼叫導航與操作技能，引導 Unitree G1 執行廚房任務。機器人會先探索房間，並記下曾看見物品的位置。研究團隊展示的任務包括收集咖啡包、丟棄指定紙盒，以及在藥瓶離開攝影機視野後，從抽屜中找回藥瓶。

## 核心變化

- **有哪些改變：**HomeBody 讓視覺語言模型取得已探索房間的空間紀錄，並透過共用介面呼叫機器人技能。模型選擇技能與目標；本機軟體規劃並執行動作，再回報結果。
- **為何重要：**模型能跨越不同位置規劃工作並利用回饋，不必為這間廚房重新訓練動作策略。團隊的示範呈現了如何組合記憶與既有動作技能，完成較長的任務。
- **尚待確認之處：**公開資料展示的是經挑選的示範，而非受控的成功率研究。截至 9 月 27 日，論文與機器人程式碼尚未公開，因此外界還無法依發布資料獨立重現其報告的表現。

## 機器人如何記住房間

HomeBody 從探索環境開始。根據[專案的部署說明](https://tml.stanford.edu/homebody/)，G1 會收集 iPhone 廣角影片、D435i 相機觀測、LiDAR 掃描、關節姿態，以及由模型選定的路徑點。LiDAR 定位與建圖（SLAM）地圖提供實測的房間幾何資訊。Astra 利用這些資料，在 Nvidia Isaac Sim 中建立數位分身。團隊將地圖與重建場景對齊，使記錄下來的相機畫面與機器人目前位置共用同一座標系。

若指令提到機器人當下看不見的物品，這項準備就很重要。以尋找藥瓶的指令為例，團隊表示 HomeBody 會回想已儲存的相機關鍵影格來定位抽屜，接著移動到抽屜前、打開抽屜並拿起藥瓶。房間模型支援導航與位置回想；最後的實際操作仍由即時相機畫面引導。

專案頁面上的[互動式廚房展示](https://tml.stanford.edu/homebody/)明確標示為示意內容，場景是在重建的房間中運行。頁面另行展示 G1 執行廚房任務的影片，並將導航、抓取、放置及開抽屜技能片段標示為真實機器人畫面。這些影片記錄團隊挑選的實際執行結果，而模擬回放則用來說明規劃流程。

## 從模型決策到機器人動作

模型會收到任務、目前相機畫面、地圖脈絡、夾爪狀態、回想出的觀測資料，以及前一項技能的結果。接著，它會送出一個結構化呼叫，指出要執行的技能與目標。抓取任務的目標是 0 至 1000 刻度上的影像位置點，並須選擇使用哪隻手臂。本機感知模組會分割物體、依據立體影像估算深度，並將選定位置轉換成 3D 抓取點。接著，手臂規劃器計算並檢查動作路徑。導航則在地圖座標中使用 2D 目標與面向點；放置任務使用 3D 釋放位置。開抽屜技能把手把對齊、勾住把手及向後行走整合成一個動作。

各項技能會在本機處理細部修正。團隊描述了接近目標時的視覺追蹤，以及抓取失敗時有限次數的重試。若仍無法復原，技能會回傳原因，供 Astra 再次決策。行走與伸手依賴預先訓練的全身控制器 AMO。專案頁面表示，手臂與手部指令以 250 Hz 執行，AMO 策略則以 50 Hz 更新。Astra 在遠端運行；感知、動作規劃及技能則在配備 RTX 4090 GPU 的筆電上執行。

Astra 選擇*要嘗試的*動作，並決定*目標位置*；技能庫與控制器則決定*G1 如何移動*。團隊表示，廚房示範沒有使用特定環境的訓練資料，也沒有額外進行策略學習。不過，系統仍使用既有的預訓練控制器，並需要大量重建房間環境。

## 示範能證明什麼

專案頁面描述了在一間先前未見過的廚房中，執行的兩組實體任務。一組任務是收集咖啡包，並丟棄指定的牛奶盒和柳橙汁盒。另一組則是讓 G1 從資訊不完整的指令中找出藥瓶，從抽屜取出並遞交，再丟棄一個紙盒。技能片段展示個別動作及記錄下來的重試；頁面說大多數預覽影片經過加速，並指出一段抽屜抓取過程連續重試。

公開資料沒有提供試驗次數、任務成功率、與經訓練的視覺語言動作策略之比較，或每次廚房任務完成所需的時間與成本。因此，它呈現的是系統架構示範，不能據此宣稱此設計在其他廚房也能可靠運作。[連結的公開程式碼庫](https://github.com/Stanford-TML/homebody)目前標示「程式碼即將推出」，而專案頁面的論文欄位沒有連結到任何手稿。程式碼庫目前只有網站、插圖與影片，沒有機器人實作或評估檔案。BIG CHANGE 未執行 HomeBody，也未測試機器人。

BIG CHANGE 先前的[GPT-Policy 報導](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents)檢視另一個團隊有關機器人動作脈絡的論文。HomeBody 的資料並未指出該論文屬於這套系統。

團隊列出幾項實務限制：建立數位分身需要前置設定時間並產生 API 費用；Astra 的遠端推理會讓技能之間出現停頓；G1 的伸手與操作能力有限；手指伺服馬達在長時間運作時可能過熱。本機系統需要配備 RTX 4090 的筆電，較耗資源的技能可能需要更高運算能力。

## 來源與延伸閱讀

- [加州理工學院與史丹佛大學研究團隊的 HomeBody 專案頁面](https://tml.stanford.edu/homebody/)——主要資料來源，介紹系統架構、廚房示範、模擬回放、技能介面、控制系統與團隊所述的限制。頁面日期為 2026 年 9 月；其中挑選的影片與文字說明是團隊提供的證據，並非獨立評估。
- [史丹佛大學 TML 的 HomeBody 公開程式碼庫](https://github.com/Stanford-TML/homebody)——由專案頁面連結。查閱日期為 2026 年 9 月 27 日，README 標示程式碼即將推出；公開目錄提供網站素材，沒有機器人實作或完整論文。

## Sources

- [加州理工學院與史丹佛大學研究團隊的 HomeBody 專案頁面](https://tml.stanford.edu/homebody/) — 作者對系統架構、實體廚房示範、明確標示為示意的模擬展示、技能介面、運算配置及限制所作的說明。頁面挑選的影片與文字並非受控的獨立評估；論文欄位也沒有連結至手稿。
- [史丹佛大學 TML 的 HomeBody 公開程式碼庫](https://github.com/Stanford-TML/homebody) — README 標示程式碼即將推出。公開目錄包含專案網站與媒體素材，沒有機器人實作或評估檔案。建立程式碼庫的時間不能證明實驗何時進行。
