一篇于 9 月发布的arXiv 预印本《In-Context Robot Learning with VLM Agents》介绍了 GPT-Policy:该系统通过示范、图像和交互历史,将固定的视觉语言模型连接到机器人工具。实验包括机械臂任务和移动探索,但不能验证另一则Reddit 帖子声称 GPT-6 Astra 控制 Unitree G1 的说法。
主要变化
- 发生了什么变化:GPT-Policy 为通用视觉语言模型提供了一种结构化方式,可将示范和当前摄像头画面转换为机器人工具请求;系统再利用执行反馈选择下一步动作,而无需更新模型针对特定任务的权重。
- 为何重要:这一方法将广泛的视觉推理与运动检查和执行分开。在作者有限的试验中,增加上下文有助于部分任务;但对接触敏感的动作,有时需要与机器人动作对应的参考信息。
- 接下来关注什么:论文报告每种条件仅进行了三次试验,并描述了运行缓慢且容易失败的情况,包括机械臂碰撞。在这些结果能够说明机器人如何在人身边工作之前,仍需要复现、更大规模评估和独立的安全控制。
GPT-Policy 的工作方式
论文于 9 月 16 日提交至 arXiv。研究考察了通用视觉语言模型能否通过示例和反馈,在新的初始状态下完成任务,而无需微调或改变模型针对特定任务的参数。作者将这一框架称为 GPT-Policy,并称评估中使用了 GPT-6 Astra 等模型。
系统会组合多种上下文:任务指令、当前摄像头画面和状态,以及可选的人类示范视频、附有动作参考的机器人示范、目标图像、先前的机器人尝试或人机交互信息。上下文编译器会选取与任务相关的视觉变化,并将其与指令、限制条件和工具模式结合。随后,视觉语言模型提出结构化的机器人工具请求。
该请求会交给适配具体机器人形态的控制器。作者介绍了在执行动作前检查逆运动学解、采样笛卡尔姿态并校验关节参考时序的做法。控制器返回观测和执行反馈,供模型作出下一步决定。模型提出动作;针对机器人的代码负责验证并执行。
这一循环是论文的主要贡献。它让固定的视觉语言模型能够根据示例和近期结果调整下一步动作,而无需进行梯度更新。这里的“上下文学习”是指系统如何使用任务期间提供的信息,并不意味着模型永久学会了新技能,也不代表所有机器人都能运行相同的工具接口。
试验测量了什么
作者报告称,十项机器人任务分属五类实验,每种条件各进行三次试验。他们的项目页面列出了真实机器人运行记录,并公布任务结果、决策过程和耗时。在毛巾拾取任务中,GPT-6 Astra 在有人类视频示范时三次成功两次,无示范时三次均未成功。拾取笔记本电脑的任务也从无示范时三次均未成功,变为提供示范后成功两次。
接触类任务表明,额外上下文并非通用解决方案。拧开瓶盖的任务中,使用机器人视频的条件下三次成功两次;加入对齐的机器人动作参考后,三次全部成功。对于拔出并重新插入插头的任务,仅用视频的条件下三次均未成功,而视频加动作参考时成功两次。这些是每种条件下的小样本计数,不是可靠性估计。
项目还报告了目标图像条件下的方块和水果摆放任务,以及两项人机交互任务,均三次成功三次。在自我交互历史条件下,论文称“将柠檬放到粉色盘子上”和“可移动探索”两项任务都三次成功三次。后一项中,机器人在寻找目标时主动避开障碍物;平均耗时为 25.53 分钟。图 1 还展示了移动物体取回任务。这些结果将论文范围扩展到桌面操作之外,但仍是每种条件三次试验的精选任务。运行耗时以分钟计:项目页面报告,提供人类视频的毛巾拾取任务平均耗时 18.9 分钟,视频加动作参考的瓶盖任务平均耗时 17.9 分钟。因此,延迟和运行成本仍是实际问题,而非已解决的细节。
附录 B 将 Morphi Kino 与 YAM 和 ARX X5 一同列为论文介绍的机器人配置。附录称,Morphi Kino 配有移动底座、腰部和头部,以及两条七关节机械臂。因此,除机械臂平台外,论文还包含一种移动平台配置;但附录没有提到 Unitree G1。
论文中的移动任务并不能证实 Reddit 所说的场景
该Reddit 帖子声称 GPT-6 Astra 控制 Unitree G1 在陌生房间中行动,记住物品位置,并根据含糊的请求在之后将物品取回。论文报告的是另一项“可移动探索”任务,并将 Morphi Kino 描述为配有移动底座的平台;但论文、项目材料和公开 GitHub 代码库都没有将 Reddit 帖子所述的 G1 场景认定为 GPT-Policy 实验。该帖子仍是一项未经核实的独立说法;本文的比较并未证伪它。
作者的项目页面包含其实验视频,这些视频是作者报告相关任务的证据,并非独立验证。公开的代码库目前列出了 ARX X5 和 I2RT/YAM 的适配器,并称公开目录不包含部署主机、私有提示、运行录屏、场地专用校准资料和评估历史。适配器列表描述的是已发布代码库;它并未界定论文的全部范围,论文还报告了移动探索,并在附录 B 列出了 Morphi Kino。现有材料不足以让 BIG CHANGE 复现所报告的运行,我们也没有测试机器人。
控制边界仍然重要
项目页面报告了较长的动作序列,也提到了执行困难。讨论指出,观察到的双臂碰撞表明现有防护措施不足以支持安全的自主部署。作者呼吁独立监测物理间距和接触情况,同时改进低层控制速度和安全恢复机制。控制器能够拒绝某些无效动作,并不意味着它本身就是完整的安全系统。
这项研究给出了一个具体的研究结果:上下文可以帮助通用视觉语言模型通过机器人工具执行某些任务,而上下文的类型也很重要。但评估规模有限、单次运行耗时较长、公开复现材料不完整且报告中出现碰撞,因此这些结果远不足以证明家用人形机器人能够可靠理解并执行开放式请求。
来源与延伸阅读
- Cheng 等人:《In-Context Robot Learning with VLM Agents》(arXiv:2609.19138,第 1 版,2026 年 9 月 16 日提交)— 方法、评估和所述局限性的主要预印本来源;并非经同行评审的证据或部署报告。
- 作者的 GPT-Policy 项目页面— 实验说明、视频、各条件结果及讨论。这些是作者自己的材料。
- 作者公开的 GPT-Policy 代码库— 说明当前发布的机器人机械臂适配器及公开目录中未包含的内容;代码库可用本身并不能证明所报告的实验可以复现。
- 引出本篇报道的 Reddit 帖子— Unitree G1 说法的来源;该帖子没有提供证据,将所述场景与论文联系起来。



