Runway 已宣布推出 Praxis-1,这是一种机器人策略模型,公司称它基于其世界模型所采用的大规模视频预训练。公司报告称,已与选定的机器人合作伙伴在其自有设备上进行了测试。Runway 计划在未来数月内公开发布模型权重;BIG CHANGE 于 10 月 3 日查看时,公告页面尚未提供这些权重。Runway 将页面标注为 2026 年 9 月,但未给出具体日期。

其背后的问题是,日常视频能否在机器人策略从机器人演示中学习之前,为其提供有用知识。Runway 给出了物体放置误差对比以及若干精选任务片段,但仍未公布复现结果所需的细节。

重大变化

  • 变化:Runway 将视频预训练应用到机器人动作预测中,并报告了在多种合作伙伴硬件上的测试。这可能让资源丰富的第三人称视频用在机器人演示数据成本高昂的领域。Praxis-1 仍只向特定合作伙伴开放。
  • 意义:Runway 的图表显示,微调后的最终物体放置误差中,网络视频预训练为 16.1 厘米,遥操作机器人视频预训练为 16.0 厘米。图中两项点估计很接近。覆盖 93 对评估样本的 ±1 个均值标准误差范围,既不能证明差异显著,也不能证明二者等效;已公开的测试方案也过于有限,无法判断它在其他机器人上的表现。
  • 关注点:公开发布权重、提供任务级评估细节并公布合作伙伴测试结果,可以让研究者评估视频预训练贡献有多大,以及每种机器人需要何种适配。Runway 已承诺发布权重,但没有给出明确日期。

视频如何进入机器人策略

Runway 的Praxis-1 研究页面称,其大型视频模型会学习物体行为、手部动作和物理任务中的模式。公司称,Praxis-1 将这类预训练用于通用机器人策略。其主张是,第三人称视频能为机器人开始针对特定任务训练之前提供有用起点。页面称,增加第三人称视频数据规模能够提升策略表现。

页面没有介绍 Praxis-1 的观测格式、动作输出、微调流程、推理接口或控制频率,也没有提供权重文件或硬件要求。对于希望估算特定摄像头、夹爪或移动底盘需要多少适配的工程师而言,这些遗漏很重要。Runway 另有一款GWM-1 策略模型产品页面,介绍了定制微调和云端 SDK 的方案。不能想当然地认为这套接口和商业条款也适用于 Praxis-1。

Runway 发布的片段展示了放置网球的指令、移动底盘靠近货架并拿起一本书,以及涉及重复物体、杂乱场景、透明材料和布料的例子。另有片段的说明称,同一策略无需重新训练,就能从工作室环境切换到厨房环境。这些是开发者挑选的示例;页面没有报告相关试验次数或成功率。

物体放置误差图表能说明什么

Runway 页面上唯一一项数值对比是微调后的最终物体放置误差,以厘米为单位,数值越低越好。图表标注了从零开始的视频预训练结果为16.1 厘米,以及从零开始的遥操作机器人视频预训练结果为16.0 厘米。Runway 绘制了预训练视频小时数,并称误差线和带状范围代表覆盖 93 对评估样本的 ±1 个均值标准误差。图表注释称,小于误差线的差异不显著。

图中点估计相差 0.1 厘米。在该页面上,Runway 尚未公布任务组成、机器人或环境数量、93 对样本如何形成、微调使用了多少机器人数据,也没有提供完整的统计检验。就 Runway 选择展示的对比而言,微调后报告的最终物体放置误差点估计很接近。图表并未证明该指标上的差异具有统计显著性,也未证明二者等效;它也无法证明图中较长任务能够可靠完成,或能减少现实部署所需的数据量。

Runway 还引用了模拟与真实世界机器人策略结果之间0.95 的相关性。该数字来自其此前关于策略评估的研究,研究在一台 Franka Panda 机械臂上比较了八种策略执行桌面任务的表现。这是另一项关于策略评估的研究,并非 Praxis-1 的实地性能指标。

目前的访问情况

Runway 将Noble Machines、Standard Bots 和 Ultra列为早期合作伙伴,他们正在自己的硬件上使用 Praxis-1。公告这一部分提到双手操作、六自由度机械臂和移动底盘。Runway 表示,团队正在不同机器人形态和环境中评估效果与安全性;在普遍开放前,计划只邀请部分其他合作伙伴联系其机器人团队。

对于该计划之外的研究者,目前可获得的资料只有公告、图表和视频片段。页面没有链接公开的 Praxis-1 权重下载、已发布的集成步骤或可复现评估套件。Runway 没有说明访问费用、未来的权重许可、计算要求或普遍发布的日期。考虑申请早期访问的团队可以根据公开信息,围绕自己的硬件和评估需求开展讨论,但仅凭公告无法复现报告中的对比。BIG CHANGE 没有申请访问,也没有测试机器人。

我们此前关于GPT-Policy 的报道和HomeBody 的报道探讨的是不同研究问题。GPT-Policy 通过演示和机器人反馈提示一个固定的视觉语言模型;HomeBody 将人形机器人的房间记忆与可复用技能相连接。Praxis-1 关注的是广泛的视频预训练能否提升机器人策略本身。Runway 尚未发布具体实现,也没有提供足够评估细节来核查其已报告对比之外的性能。

来源与延伸阅读