AI-translated from English; not yet reviewed by a fluent editor.

# HomeBody 将空间记忆与可复用机器人技能连接起来，赋予人形机器人新的能力

> 加州理工学院和斯坦福大学的研究人员展示了 Unitree G1 如何利用记忆中的厨房地图和可复用技能完成任务。此次发布展示了精选演示，但没有对照测试结果、完整论文或机器人代码。

By BIG CHANGE Editorial

Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

![Conceptual charcoal illustration of a white humanoid robot walking toward a closed drawer in a light wood kitchen.](https://bigchange.ai/api/media/file/homebody-kitchen-g1-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

加州理工学院和斯坦福大学的团队[展示了 HomeBody](https://tml.stanford.edu/homebody/)，这是一个由 GPT Astra 调度 Unitree G1 完成厨房任务的研究系统，具体做法是调用导航和操作技能。机器人先探索房间，并记录看到物体的位置。在团队的演示中，它收集咖啡袋、丢弃指定纸盒，并在药瓶离开摄像头视野后，从抽屉中将其取出。

## 主要变化

- **发生了什么变化：**HomeBody 让视觉语言模型能够访问已探索房间的空间记录，并通过统一接口调用机器人技能。模型选择技能和目标；本地软件规划并执行动作，随后报告结果。
- **为何重要：**无需为这个厨房重新训练动作策略，模型便能跨地点规划并利用反馈。团队的演示展示了如何组合记忆与现有运动技能，以完成较长的任务。
- **尚待观察：**公开发布展示的是精选演示，并非受控的成功率研究。截至 9 月 27 日，论文和机器人代码尚未公开，因此目前无法根据发布材料独立复现其所报告的性能。

## 机器人如何记住房间布局

HomeBody 从探索环境开始。根据[项目部署说明](https://tml.stanford.edu/homebody/)，G1 会采集广角 iPhone 视频、D435i 相机观测、激光雷达扫描、关节姿态和模型选择的路径点。基于激光雷达的 SLAM 地图提供实测房间几何信息。Astra 利用这些材料在 Nvidia Isaac Sim 中构建数字孪生。团队将地图与重建结果对齐，使记录的相机视角和机器人当前位置共用同一坐标系。

当指令涉及机器人当前看不到的物体时，这些准备工作就很重要。对于取药瓶的请求，团队称，HomeBody 会调取存储的相机关键帧来找到抽屉，前往那里、打开抽屉并拿起药瓶。房间模型支持导航和位置回忆；而最后的实体操作仍由实时摄像头引导。

项目页面上的[互动式厨房运行演示](https://tml.stanford.edu/homebody/)明确标注为示意内容，场景是在重建房间中进行的。页面还分别展示 G1 执行厨房任务的视频，并将导航、抓取、放置和开抽屉等技能片段标记为真实机器人拍摄画面。这些视频记录了团队挑选的运行实例，而模拟回放则解释了规划过程。

## 从模型决策到机器人动作

模型接收任务、当前摄像头画面、地图背景、夹爪状态、调取的观测信息，以及前一项技能的执行结果。它会发出结构化调用，指定技能和目标。抓取任务的目标是一个按 0 至 1000 刻度表示的图像点，以及所用机械手的选择。本地感知模块会分割物体，根据立体图像估算深度，并将选择转换为三维抓取位置。随后，机械臂规划器计算并检查运动路径。导航任务使用地图坐标中的二维目标点和朝向点；放置任务使用三维释放点。开抽屉则将把手对准、勾住把手和向后行走打包成一个动作。

技能会在本地进行小幅修正。团队介绍了接近目标时的视觉跟踪，以及抓取失败时有限次数的重试。如果仍无法恢复，技能会将原因返回给 Astra，由其作出下一步决定。行走和伸手依赖预训练的全身控制器 AMO。页面称，机械臂和手部指令以 250 Hz 运行，AMO 策略则以 50 Hz 更新。Astra 在远程运行；感知、运动规划和技能则在配备 RTX 4090 GPU 的笔记本电脑上运行。

Astra 决定尝试采取*什么*行动以及*在哪里*；技能库和控制器则决定*如何*驱动 G1 移动。团队称，厨房演示没有使用针对特定环境的训练数据，也没有额外训练策略。不过，整个系统仍依赖已有的预训练控制器和大量房间重建工作。

## 这些演示能够说明什么

项目页面描述了在一间此前未见过的厨房中进行的两组实体任务。一组任务是收拢咖啡袋，并丢弃指定的牛奶盒和橙汁盒。另一组中，G1 根据较为含糊的请求找到药瓶，从抽屉中取出并递交，然后丢弃一个纸盒。其技能片段展示了单项动作和记录下来的重试；页面称，大多数预览视频经过加速，并指出其中一个抽屉取物过程包含连续重试。

此次发布没有给出试验次数、任务成功率、与学习型视觉语言动作策略的对比结果，也没有说明每次厨房任务运行所需的时间和成本。因此，这些材料支持的是架构演示，而非该设计能在其他厨房可靠运行的实测结论。[关联的公开代码库](https://github.com/Stanford-TML/homebody)目前写着“代码即将发布”，项目页面上的“论文”标签也没有链接到任何手稿。代码库包含网站、插图和视频，但没有机器人实现代码或评估文件。BIG CHANGE 没有运行 HomeBody，也没有测试机器人。

BIG CHANGE 早前发布的[GPT-Policy 报道](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents)研究了另一支团队有关机器人动作上下文的论文。HomeBody 材料并未将那篇论文列为该系统的一部分。

团队列出了一些实际限制：构建数字孪生需要准备时间并产生 API 费用；Astra 的远程推理会使技能之间出现停顿；G1 的伸展范围和操作能力有所限制；手指伺服电机在长时间运行时可能过热。本地系统需要配备 RTX 4090 的笔记本电脑，较重的技能可能需要更多算力。

## 来源与延伸阅读

- [加州理工学院和斯坦福大学研究人员的 HomeBody 项目页面](https://tml.stanford.edu/homebody/)— 系统、厨房演示、模拟回放、技能接口、控制系统和所述限制的第一手说明。页面标注日期为 2026 年 9 月；其中精选视频和描述是团队提供的证据，并非独立评估。
- [斯坦福大学 TML 的 HomeBody 公开代码库](https://github.com/Stanford-TML/homebody)— 由项目页面链接。2026 年 9 月 27 日查阅时，README 写着代码即将发布；公开目录中是网站素材，而非机器人实现或完整论文。

## Sources

- [加州理工学院和斯坦福大学研究人员的 HomeBody 项目页面](https://tml.stanford.edu/homebody/) — 关于系统架构、厨房实体演示、明确标注为示意的模拟运行演示、技能接口、算力配置和所述限制的作者一手说明。页面精选的视频与描述并非受控的独立评估。“论文”标签没有链接到手稿。
- [斯坦福大学 TML 的 HomeBody 公开代码库](https://github.com/Stanford-TML/homebody) — README 写着“代码即将发布”。公开目录包含项目网站和媒体素材，没有机器人实现代码或评估文件。代码库的创建时间不能证明实验何时进行。
