AI-translated from English; not yet reviewed by a fluent editor.

# 在一个 AI 模型项目中，智能体提出方法，研究人员作出最终选择

> Atria Dawn 团队研究了自身模型开发中的 769 条任务记录。智能体经常提出方法并修改输出，而参与者表示，大多数最终选择由他们作出。研究结果仅描述这一个项目。

By BIG CHANGE Editorial

Published: 2026-09-27T17:05:31.968Z
Updated: 2026-09-27T17:05:31.968Z
Canonical: https://bigchange.ai/blog/atria-dawn-ai-agents-human-research-decisions

![Conceptual charcoal illustration of an anonymous researcher in profile considering code-like marks on a desktop monitor, with one hand on a mouse.](https://bigchange.ai/api/media/file/atria-dawn-research-choice-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

开发 Atria Dawn Preview 的团队在参与者明确回答是否使用 AI 的 739 项任务中，有 713 项使用了 AI。在团队对自身开发工作的[研究](https://arxiv.org/html/2609.15818v2)中，在有关方法或参数的已记录决策里，仍有 85.5% 是由人作出最终选择。论文标题提到了“智能体超级智能”，但任务记录更具体地展现了团队如何分工。

这篇[预印本](https://arxiv.org/abs/2609.15818)于 2026 年 9 月 14 日提交，并于 9 月 17 日修订。研究依据一个模型开发项目中 56 名参与者的 769 条任务记录，以及智能体日志。作者将这些记录描述为一项案例研究，考察团队如何使用智能体开发 Atria Dawn Preview。

## 主要变化

- **发生了什么变化：**团队记录了在一个模型开发项目中，智能体与人如何分担具体研究决策，并区分了方案提议与最终选择。
- **为何重要：**智能体可以生成方法并执行修订，但研究人员仍可以选择目标、批准方法，并判断结果是否符合任务标准。只统计智能体采取的行动，会忽略这些不同角色。
- **接下来关注什么：**这些观察来自一个团队的工作，且许多决策证据由参与者提供。研究结果不能说明其他 AI 实验室如何分配决策权，也不能证明智能体能够自主开发其后继系统。

## 智能体提出了许多方法，但大多数由人选择

执行角色的参与者共记录了 567 项有关方法或参数的决策，这是最清楚的区分。论文称，在 64.6% 的这类决策中，选项由 AI 提出。最大的一类占 55.4%，即“AI 提议、人类选择”。85.5% 的最终选择由人作出，9.2% 由 AI 作出。其余决策归因于外部限制。

不同问题上的分工有所不同。在 603 项有关目标或范围的决策中，人作出最终选择的比例为 93.4%；在 542 项有关验收标准的决策中，这一比例为 81.9%。与目标相比，AI 在方法问题上提出方案的情况要常见得多。论文图表还记录，在参与者认为没有 AI 就无法完成的 151 项任务中，有 144 项的最终目标由人选择。

这些百分比描述的是参与者报告的决策角色，并不衡量每项人类选择是否知情充分。作者将这一模式解读为：研究人员把握方向，智能体则在人员设定的方向内生成选项。这项案例研究记录了该项目中由智能体执行工作、由人保留最终决定权的分工。

## 人类反馈常常让智能体返工

参与者回忆了每项任务中影响最大的困难。在有记录说明困难及应对方式的 588 项任务中，447 项（76.0%）在人的帮助下继续推进；135 项（23.0%）由智能体独立恢复。主要的帮助方式是补充背景信息或澄清要求（207 项任务），以及诊断问题或更换方法（204 项）。有 4 项任务由人接手主要工作。

输出记录也显示出类似的分工。在 627 项已知主要 AI 输出处置方式的任务中，有 354 项需要实质性修订。在这些修订任务中，75.4% 的改动由智能体在收到人类反馈后完成，19.2% 由人直接编辑。研究人员可以指示改动，而不必亲自进行编辑。

开发过程中，一项日志指标也有所上升：在由 22 名参与者组成的群体中，每条人类提示对应的智能体每日行动数中位数，从 8 月 7 日的 11.0 增至 9 月 4 日的 28.5。该指标采用此前七天的时间窗口；每天有有效比值的参与者为 21 或 22 人。它统计的是活动量，因此不能证明智能体获得了更大权限，也不能证明其输出有所改善。

## 任务记录能够说明什么

参与者估计，在任务范围、质量和其他资源相同的情况下，如果不用 AI，他们能否完成自己承担的部分。在有可用回答的 455 项已完成 AI 辅助任务中，参与者认为其中 151 项（33.2%）在没有 AI 时无法完成。这是参与者对反事实情形的自我报告，并非团队在不使用智能体的情况下重新完成这些任务的实验。它不能证明在不同条件下，人们绝不会尝试这些工作。

论文没有说明 56 名参与者或 769 条任务记录的抽样方法；其公开链接也未提供底层任务回答或智能体日志，供外部独立重新分析。论文的基准测试结果评估的是 Atria Dawn Preview 这一模型，并未表明 AI 系统能够自主改进其后继系统。对于决定将哪些工作交给智能体的团队而言，研究报告的边界很明确：在这个项目中，智能体经常提出方案并修订工作，而参与者称目标、方法和验收标准的大多数选择仍由他们作出。

## Sources

- [Atria 团队：《Atria Dawn：智能体超级智能的黎明》，arXiv 第二版](https://arxiv.org/html/2609.15818v2) — 主要案例研究。第 4 节和图 6 至图 10 给出了任务、决策、人工干预、修订和日志指标。记录来自作者自己的模型开发项目；论文没有说明具有代表性的抽样方法，也未提供底层参与者回答和智能体日志。
- [Atria Dawn 的 arXiv 记录与版本历史](https://arxiv.org/abs/2609.15818) — 确认预印本于 9 月 14 日提交、第二版于 9 月 17 日修订，并提供完整 PDF 链接。论文标题本身并不能证明已经实现了自主超级智能。
- [Atria Dawn Preview 公开代码库](https://github.com/atria-asi/Atria-Dawn-Preview) — 该公开代码库提供模型发布材料和论文 PDF 链接。检查时，未发现可用于重新分析人类与智能体决策图表的任务级研究回答、智能体日志或脚本。
- [The Decoder：《AI 智能体承担了更多模型开发工作，但决策仍由人作出》](https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions/) — 引出本篇任务的二手报道。BIG CHANGE 对照原始论文核查了其中的研究主张，并将“没有 AI 就无法完成”的发现视为参与者判断，而非证明这些工作根本不会启动。
