开发 Atria Dawn Preview 的团队在参与者明确回答是否使用 AI 的 739 项任务中,有 713 项使用了 AI。在团队对自身开发工作的研究中,在有关方法或参数的已记录决策里,仍有 85.5% 是由人作出最终选择。论文标题提到了“智能体超级智能”,但任务记录更具体地展现了团队如何分工。

这篇预印本于 2026 年 9 月 14 日提交,并于 9 月 17 日修订。研究依据一个模型开发项目中 56 名参与者的 769 条任务记录,以及智能体日志。作者将这些记录描述为一项案例研究,考察团队如何使用智能体开发 Atria Dawn Preview。

主要变化

  • 发生了什么变化:团队记录了在一个模型开发项目中,智能体与人如何分担具体研究决策,并区分了方案提议与最终选择。
  • 为何重要:智能体可以生成方法并执行修订,但研究人员仍可以选择目标、批准方法,并判断结果是否符合任务标准。只统计智能体采取的行动,会忽略这些不同角色。
  • 接下来关注什么:这些观察来自一个团队的工作,且许多决策证据由参与者提供。研究结果不能说明其他 AI 实验室如何分配决策权,也不能证明智能体能够自主开发其后继系统。

智能体提出了许多方法,但大多数由人选择

执行角色的参与者共记录了 567 项有关方法或参数的决策,这是最清楚的区分。论文称,在 64.6% 的这类决策中,选项由 AI 提出。最大的一类占 55.4%,即“AI 提议、人类选择”。85.5% 的最终选择由人作出,9.2% 由 AI 作出。其余决策归因于外部限制。

不同问题上的分工有所不同。在 603 项有关目标或范围的决策中,人作出最终选择的比例为 93.4%;在 542 项有关验收标准的决策中,这一比例为 81.9%。与目标相比,AI 在方法问题上提出方案的情况要常见得多。论文图表还记录,在参与者认为没有 AI 就无法完成的 151 项任务中,有 144 项的最终目标由人选择。

这些百分比描述的是参与者报告的决策角色,并不衡量每项人类选择是否知情充分。作者将这一模式解读为:研究人员把握方向,智能体则在人员设定的方向内生成选项。这项案例研究记录了该项目中由智能体执行工作、由人保留最终决定权的分工。

人类反馈常常让智能体返工

参与者回忆了每项任务中影响最大的困难。在有记录说明困难及应对方式的 588 项任务中,447 项(76.0%)在人的帮助下继续推进;135 项(23.0%)由智能体独立恢复。主要的帮助方式是补充背景信息或澄清要求(207 项任务),以及诊断问题或更换方法(204 项)。有 4 项任务由人接手主要工作。

输出记录也显示出类似的分工。在 627 项已知主要 AI 输出处置方式的任务中,有 354 项需要实质性修订。在这些修订任务中,75.4% 的改动由智能体在收到人类反馈后完成,19.2% 由人直接编辑。研究人员可以指示改动,而不必亲自进行编辑。

开发过程中,一项日志指标也有所上升:在由 22 名参与者组成的群体中,每条人类提示对应的智能体每日行动数中位数,从 8 月 7 日的 11.0 增至 9 月 4 日的 28.5。该指标采用此前七天的时间窗口;每天有有效比值的参与者为 21 或 22 人。它统计的是活动量,因此不能证明智能体获得了更大权限,也不能证明其输出有所改善。

任务记录能够说明什么

参与者估计,在任务范围、质量和其他资源相同的情况下,如果不用 AI,他们能否完成自己承担的部分。在有可用回答的 455 项已完成 AI 辅助任务中,参与者认为其中 151 项(33.2%)在没有 AI 时无法完成。这是参与者对反事实情形的自我报告,并非团队在不使用智能体的情况下重新完成这些任务的实验。它不能证明在不同条件下,人们绝不会尝试这些工作。

论文没有说明 56 名参与者或 769 条任务记录的抽样方法;其公开链接也未提供底层任务回答或智能体日志,供外部独立重新分析。论文的基准测试结果评估的是 Atria Dawn Preview 这一模型,并未表明 AI 系统能够自主改进其后继系统。对于决定将哪些工作交给智能体的团队而言,研究报告的边界很明确:在这个项目中,智能体经常提出方案并修订工作,而参与者称目标、方法和验收标准的大多数选择仍由他们作出。