Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# 在一个 AI 模型项目中,智能体提出方法,研究人员作出最终选择
> Atria Dawn 团队研究了自身模型开发中的 769 条任务记录。智能体经常提出方法并修改输出,而参与者表示,大多数最终选择由他们作出。研究结果仅描述这一个项目。
By BIG CHANGE Editorial
Published: 2026-09-27T17:05:31.968Z
Updated: 2026-09-27T17:05:31.968Z
Canonical: https://bigchange.ai/blog/atria-dawn-ai-agents-human-research-decisions

AI-generated conceptual illustration by BIG CHANGE.
开发 Atria Dawn Preview 的团队在参与者明确回答是否使用 AI 的 739 项任务中,有 713 项使用了 AI。在团队对自身开发工作的[研究](https://arxiv.org/html/2609.15818v2)中,在有关方法或参数的已记录决策里,仍有 85.5% 是由人作出最终选择。论文标题提到了“智能体超级智能”,但任务记录更具体地展现了团队如何分工。
这篇[预印本](https://arxiv.org/abs/2609.15818)于 2026 年 9 月 14 日提交,并于 9 月 17 日修订。研究依据一个模型开发项目中 56 名参与者的 769 条任务记录,以及智能体日志。作者将这些记录描述为一项案例研究,考察团队如何使用智能体开发 Atria Dawn Preview。
## 主要变化
- **发生了什么变化:**团队记录了在一个模型开发项目中,智能体与人如何分担具体研究决策,并区分了方案提议与最终选择。
- **为何重要:**智能体可以生成方法并执行修订,但研究人员仍可以选择目标、批准方法,并判断结果是否符合任务标准。只统计智能体采取的行动,会忽略这些不同角色。
- **接下来关注什么:**这些观察来自一个团队的工作,且许多决策证据由参与者提供。研究结果不能说明其他 AI 实验室如何分配决策权,也不能证明智能体能够自主开发其后继系统。
## 智能体提出了许多方法,但大多数由人选择
执行角色的参与者共记录了 567 项有关方法或参数的决策,这是最清楚的区分。论文称,在 64.6% 的这类决策中,选项由 AI 提出。最大的一类占 55.4%,即“AI 提议、人类选择”。85.5% 的最终选择由人作出,9.2% 由 AI 作出。其余决策归因于外部限制。
不同问题上的分工有所不同。在 603 项有关目标或范围的决策中,人作出最终选择的比例为 93.4%;在 542 项有关验收标准的决策中,这一比例为 81.9%。与目标相比,AI 在方法问题上提出方案的情况要常见得多。论文图表还记录,在参与者认为没有 AI 就无法完成的 151 项任务中,有 144 项的最终目标由人选择。
这些百分比描述的是参与者报告的决策角色,并不衡量每项人类选择是否知情充分。作者将这一模式解读为:研究人员把握方向,智能体则在人员设定的方向内生成选项。这项案例研究记录了该项目中由智能体执行工作、由人保留最终决定权的分工。
## 人类反馈常常让智能体返工
参与者回忆了每项任务中影响最大的困难。在有记录说明困难及应对方式的 588 项任务中,447 项(76.0%)在人的帮助下继续推进;135 项(23.0%)由智能体独立恢复。主要的帮助方式是补充背景信息或澄清要求(207 项任务),以及诊断问题或更换方法(204 项)。有 4 项任务由人接手主要工作。
输出记录也显示出类似的分工。在 627 项已知主要 AI 输出处置方式的任务中,有 354 项需要实质性修订。在这些修订任务中,75.4% 的改动由智能体在收到人类反馈后完成,19.2% 由人直接编辑。研究人员可以指示改动,而不必亲自进行编辑。
开发过程中,一项日志指标也有所上升:在由 22 名参与者组成的群体中,每条人类提示对应的智能体每日行动数中位数,从 8 月 7 日的 11.0 增至 9 月 4 日的 28.5。该指标采用此前七天的时间窗口;每天有有效比值的参与者为 21 或 22 人。它统计的是活动量,因此不能证明智能体获得了更大权限,也不能证明其输出有所改善。
## 任务记录能够说明什么
参与者估计,在任务范围、质量和其他资源相同的情况下,如果不用 AI,他们能否完成自己承担的部分。在有可用回答的 455 项已完成 AI 辅助任务中,参与者认为其中 151 项(33.2%)在没有 AI 时无法完成。这是参与者对反事实情形的自我报告,并非团队在不使用智能体的情况下重新完成这些任务的实验。它不能证明在不同条件下,人们绝不会尝试这些工作。
论文没有说明 56 名参与者或 769 条任务记录的抽样方法;其公开链接也未提供底层任务回答或智能体日志,供外部独立重新分析。论文的基准测试结果评估的是 Atria Dawn Preview 这一模型,并未表明 AI 系统能够自主改进其后继系统。对于决定将哪些工作交给智能体的团队而言,研究报告的边界很明确:在这个项目中,智能体经常提出方案并修订工作,而参与者称目标、方法和验收标准的大多数选择仍由他们作出。
## Sources
- [Atria 团队:《Atria Dawn:智能体超级智能的黎明》,arXiv 第二版](https://arxiv.org/html/2609.15818v2) — 主要案例研究。第 4 节和图 6 至图 10 给出了任务、决策、人工干预、修订和日志指标。记录来自作者自己的模型开发项目;论文没有说明具有代表性的抽样方法,也未提供底层参与者回答和智能体日志。
- [Atria Dawn 的 arXiv 记录与版本历史](https://arxiv.org/abs/2609.15818) — 确认预印本于 9 月 14 日提交、第二版于 9 月 17 日修订,并提供完整 PDF 链接。论文标题本身并不能证明已经实现了自主超级智能。
- [Atria Dawn Preview 公开代码库](https://github.com/atria-asi/Atria-Dawn-Preview) — 该公开代码库提供模型发布材料和论文 PDF 链接。检查时,未发现可用于重新分析人类与智能体决策图表的任务级研究回答、智能体日志或脚本。
- [The Decoder:《AI 智能体承担了更多模型开发工作,但决策仍由人作出》](https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions/) — 引出本篇任务的二手报道。BIG CHANGE 对照原始论文核查了其中的研究主张,并将“没有 AI 就无法完成”的发现视为参与者判断,而非证明这些工作根本不会启动。
BIG CHANGE 新闻通讯
纵览全局,按自己的节奏。
关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。
于贝尔格莱德时间 09:00 发送:每日、每周一或每月第一天。确认后,您的第一期将在下一个预定发送时间送达。