Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# HomeBody 将空间记忆与可复用机器人技能连接起来,赋予人形机器人新的能力
> 加州理工学院和斯坦福大学的研究人员展示了 Unitree G1 如何利用记忆中的厨房地图和可复用技能完成任务。此次发布展示了精选演示,但没有对照测试结果、完整论文或机器人代码。
By BIG CHANGE Editorial
Published: 2026-09-27T14:28:31.966Z
Updated: 2026-09-27T14:28:31.966Z
Canonical: https://bigchange.ai/blog/homebody-humanoid-spatial-memory-robot-skills

AI-generated conceptual illustration by BIG CHANGE.
加州理工学院和斯坦福大学的团队[展示了 HomeBody](https://tml.stanford.edu/homebody/),这是一个由 GPT Astra 调度 Unitree G1 完成厨房任务的研究系统,具体做法是调用导航和操作技能。机器人先探索房间,并记录看到物体的位置。在团队的演示中,它收集咖啡袋、丢弃指定纸盒,并在药瓶离开摄像头视野后,从抽屉中将其取出。
## 主要变化
- **发生了什么变化:**HomeBody 让视觉语言模型能够访问已探索房间的空间记录,并通过统一接口调用机器人技能。模型选择技能和目标;本地软件规划并执行动作,随后报告结果。
- **为何重要:**无需为这个厨房重新训练动作策略,模型便能跨地点规划并利用反馈。团队的演示展示了如何组合记忆与现有运动技能,以完成较长的任务。
- **尚待观察:**公开发布展示的是精选演示,并非受控的成功率研究。截至 9 月 27 日,论文和机器人代码尚未公开,因此目前无法根据发布材料独立复现其所报告的性能。
## 机器人如何记住房间布局
HomeBody 从探索环境开始。根据[项目部署说明](https://tml.stanford.edu/homebody/),G1 会采集广角 iPhone 视频、D435i 相机观测、激光雷达扫描、关节姿态和模型选择的路径点。基于激光雷达的 SLAM 地图提供实测房间几何信息。Astra 利用这些材料在 Nvidia Isaac Sim 中构建数字孪生。团队将地图与重建结果对齐,使记录的相机视角和机器人当前位置共用同一坐标系。
当指令涉及机器人当前看不到的物体时,这些准备工作就很重要。对于取药瓶的请求,团队称,HomeBody 会调取存储的相机关键帧来找到抽屉,前往那里、打开抽屉并拿起药瓶。房间模型支持导航和位置回忆;而最后的实体操作仍由实时摄像头引导。
项目页面上的[互动式厨房运行演示](https://tml.stanford.edu/homebody/)明确标注为示意内容,场景是在重建房间中进行的。页面还分别展示 G1 执行厨房任务的视频,并将导航、抓取、放置和开抽屉等技能片段标记为真实机器人拍摄画面。这些视频记录了团队挑选的运行实例,而模拟回放则解释了规划过程。
## 从模型决策到机器人动作
模型接收任务、当前摄像头画面、地图背景、夹爪状态、调取的观测信息,以及前一项技能的执行结果。它会发出结构化调用,指定技能和目标。抓取任务的目标是一个按 0 至 1000 刻度表示的图像点,以及所用机械手的选择。本地感知模块会分割物体,根据立体图像估算深度,并将选择转换为三维抓取位置。随后,机械臂规划器计算并检查运动路径。导航任务使用地图坐标中的二维目标点和朝向点;放置任务使用三维释放点。开抽屉则将把手对准、勾住把手和向后行走打包成一个动作。
技能会在本地进行小幅修正。团队介绍了接近目标时的视觉跟踪,以及抓取失败时有限次数的重试。如果仍无法恢复,技能会将原因返回给 Astra,由其作出下一步决定。行走和伸手依赖预训练的全身控制器 AMO。页面称,机械臂和手部指令以 250 Hz 运行,AMO 策略则以 50 Hz 更新。Astra 在远程运行;感知、运动规划和技能则在配备 RTX 4090 GPU 的笔记本电脑上运行。
Astra 决定尝试采取*什么*行动以及*在哪里*;技能库和控制器则决定*如何*驱动 G1 移动。团队称,厨房演示没有使用针对特定环境的训练数据,也没有额外训练策略。不过,整个系统仍依赖已有的预训练控制器和大量房间重建工作。
## 这些演示能够说明什么
项目页面描述了在一间此前未见过的厨房中进行的两组实体任务。一组任务是收拢咖啡袋,并丢弃指定的牛奶盒和橙汁盒。另一组中,G1 根据较为含糊的请求找到药瓶,从抽屉中取出并递交,然后丢弃一个纸盒。其技能片段展示了单项动作和记录下来的重试;页面称,大多数预览视频经过加速,并指出其中一个抽屉取物过程包含连续重试。
此次发布没有给出试验次数、任务成功率、与学习型视觉语言动作策略的对比结果,也没有说明每次厨房任务运行所需的时间和成本。因此,这些材料支持的是架构演示,而非该设计能在其他厨房可靠运行的实测结论。[关联的公开代码库](https://github.com/Stanford-TML/homebody)目前写着“代码即将发布”,项目页面上的“论文”标签也没有链接到任何手稿。代码库包含网站、插图和视频,但没有机器人实现代码或评估文件。BIG CHANGE 没有运行 HomeBody,也没有测试机器人。
BIG CHANGE 早前发布的[GPT-Policy 报道](https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents)研究了另一支团队有关机器人动作上下文的论文。HomeBody 材料并未将那篇论文列为该系统的一部分。
团队列出了一些实际限制:构建数字孪生需要准备时间并产生 API 费用;Astra 的远程推理会使技能之间出现停顿;G1 的伸展范围和操作能力有所限制;手指伺服电机在长时间运行时可能过热。本地系统需要配备 RTX 4090 的笔记本电脑,较重的技能可能需要更多算力。
## 来源与延伸阅读
- [加州理工学院和斯坦福大学研究人员的 HomeBody 项目页面](https://tml.stanford.edu/homebody/)— 系统、厨房演示、模拟回放、技能接口、控制系统和所述限制的第一手说明。页面标注日期为 2026 年 9 月;其中精选视频和描述是团队提供的证据,并非独立评估。
- [斯坦福大学 TML 的 HomeBody 公开代码库](https://github.com/Stanford-TML/homebody)— 由项目页面链接。2026 年 9 月 27 日查阅时,README 写着代码即将发布;公开目录中是网站素材,而非机器人实现或完整论文。
## Sources
- [加州理工学院和斯坦福大学研究人员的 HomeBody 项目页面](https://tml.stanford.edu/homebody/) — 关于系统架构、厨房实体演示、明确标注为示意的模拟运行演示、技能接口、算力配置和所述限制的作者一手说明。页面精选的视频与描述并非受控的独立评估。“论文”标签没有链接到手稿。
- [斯坦福大学 TML 的 HomeBody 公开代码库](https://github.com/Stanford-TML/homebody) — README 写着“代码即将发布”。公开目录包含项目网站和媒体素材,没有机器人实现代码或评估文件。代码库的创建时间不能证明实验何时进行。
BIG CHANGE 新闻通讯
纵览全局,按自己的节奏。
关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。
于贝尔格莱德时间 09:00 发送:每日、每周一或每月第一天。确认后,您的第一期将在下一个预定发送时间送达。