世界從未停止變化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# 一項 AI 模型開發計畫中,代理程式提出方法,研究人員做出最終選擇

> Atria Dawn 團隊分析自身模型開發過程中的 769 筆任務紀錄。代理程式經常提出方法並修改輸出,而參與者表示,多數最終選擇仍由人做出。這些發現只描述單一計畫。

By BIG CHANGE Editorial

Published: 2026-09-27T17:05:31.968Z
Updated: 2026-09-27T17:05:31.968Z
Canonical: https://bigchange.ai/blog/atria-dawn-ai-agents-human-research-decisions

![Conceptual charcoal illustration of an anonymous researcher in profile considering code-like marks on a desktop monitor, with one hand on a mouse.](https://bigchange.ai/api/media/file/atria-dawn-research-choice-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

開發 Atria Dawn Preview 的團隊,在參與者明確回答是否使用 AI 的 739 項任務中,有 713 項使用了 AI。團隊針對自身開發工作的[研究](https://arxiv.org/html/2609.15818v2)則顯示,在有關方法或參數的已記錄決策中,有 85.5% 最後由人做出選擇。論文標題使用「代理式超級智慧」一詞,但任務紀錄呈現了更具體的工作分工。

這份[預印本](https://arxiv.org/abs/2609.15818)於 2026 年 9 月 14 日投稿,並於 9 月 17 日修訂。研究取材自單一模型開發計畫,包含 56 位參與者的 769 筆任務紀錄,以及代理程式日誌。作者將其描述為一項個案研究,探討團隊如何使用代理程式開發 Atria Dawn Preview。

## 核心變化

- **有哪些改變:**團隊記錄了模型開發計畫中,代理程式與人如何分擔具體研究決策,並區分「提出方案」與「做出最終選擇」。
- **為何重要:**代理程式可以提出方法並執行修改,但研究人員仍可能決定目標、核准方法,並判斷結果是否符合任務標準。只計算代理程式執行了多少動作,會忽略這些不同角色。
- **後續觀察重點:**這些是單一團隊的工作紀錄,其中許多決策資訊由參與者自述提供。研究結果無法證明其他 AI 實驗室如何分配決策,也無法證明代理程式能自主開發其後繼系統。

## 代理程式提出許多方法,人選定大多數方案

研究在執行職務的參與者中,記錄了 567 項有關方法或參數的決策。論文指出,其中 64.6% 的決策由 AI 提出選項;最常見的單一類型占 55.4%,即「AI 提議、人做選擇」。最後由人做出選擇的占 85.5%,由 AI 做出選擇的占 9.2%,其餘歸因於外部限制。

不同問題的決策分工也不同。在 603 項有關目標或範疇的決策中,93.4% 最後由人選擇;在 542 項有關驗收標準的決策中,則有 81.9% 由人選擇。AI 在方法上的提案遠比在目標上的提案常見。論文圖表另記錄,在參與者認為若無 AI 便不可行的 151 項任務中,有 144 項的最終目標由人選定。

這些百分比反映的是參與者所述的決策角色,並未衡量每項人為選擇是否基於充分資訊。作者將此模式解讀為:研究人員引導工作方向,代理程式則在人設定的方向內產生選項。這項個案研究記錄了該計畫如何委派執行工作,同時保留人類的最終決策權。

## 人類回饋經常讓代理程式重做

參與者回想每項任務中影響最大的困難。在 588 項同時記錄困難及應對方式的任務中,447 項(76.0%)在人的協助下繼續推進;代理程式自行恢復的有 135 項(23.0%)。最常見的協助方式是補充背景或釐清要求(207 項),以及診斷問題或更換方法(204 項)。有 4 項由人接手主要工作。

輸出紀錄呈現出相似的分工。在 627 項已知主要 AI 輸出後續處理方式的任務中,有 354 項需要實質修改。在這些需修改的任務中,75.4% 是代理程式在人提供回饋後自行修改,19.2% 則由人直接編輯。研究人員可以指示修改方向,而不必親自動手修改。

開發期間有一項日誌指標也上升:在 22 位參與者的群組中,每個人類提示所對應的代理程式每日動作數中位數,從 8 月 7 日的 11.0 上升至 9 月 4 日的 28.5。此指標採用前 7 日的資料;每一天都有 21 或 22 人具備可用的比率數據。它計算的是活動量,無法證明代理程式取得更多決策權,或其輸出有所改善。

## 任務紀錄能說明什麼

參與者估計,在範疇、品質及其他資源條件相同的情況下,若沒有 AI,自己能否完成任務。在 455 項有可用回答、且曾使用 AI 完成的任務中,參與者認為 151 項(33.2%)若無 AI 就不可行。這是參與者對假設情境的自我評估,不是團隊在沒有代理程式的情況下重新執行任務的實驗,因此不能證明若條件不同,這些工作就完全不會嘗試。

論文沒有交代 56 位參與者或 769 筆任務紀錄的抽樣程序;公開連結也沒有提供底層任務回答或代理程式日誌,供外部人士獨立重新分析。論文的基準測試評估的是 Atria Dawn Preview 這個模型,並未顯示 AI 系統能自主改良其後繼系統。對考慮委派工作的團隊而言,報告所呈現的界線很明確:在這項計畫中,代理程式經常提出方案並修改工作,而參與者表示,目標、方法及驗收標準的大多數選擇仍由人做出。

## Sources

- [Atria 團隊:《Atria Dawn:代理式超級智慧的黎明》,arXiv 第 2 版](https://arxiv.org/html/2609.15818v2) — 主要個案研究。第 4 節及圖 6 至 10 呈現任務、決策、介入、修改與日誌指標。紀錄來自作者自己的模型開發計畫;論文未說明具有代表性的抽樣方式,也未公開底層的參與者回答及代理程式日誌。
- [Atria Dawn 的 arXiv 紀錄與版本歷程](https://arxiv.org/abs/2609.15818) — 確認預印本於 9 月 14 日投稿、9 月 17 日修訂為第 2 版,並連結至完整 PDF。論文標題不能證明已實現自主超級智慧。
- [Atria Dawn Preview 公開程式碼庫](https://github.com/atria-asi/Atria-Dawn-Preview) — 所連結的公開程式碼庫提供模型發布資料及論文 PDF。檢視時未見任務層級的研究回答、代理程式日誌,或可用於重新分析人類與代理程式決策圖表的程式碼。
- [The Decoder:AI 代理在模型開發中承擔更多工作,但決策仍由人做出](https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions/) — 引出本次報導任務的第二手報導。BIG CHANGE 依據原始論文核對研究主張,並將「沒有 AI 就無法完成」視為參與者的判斷,而非證明團隊在任何情況下都不會開始該工作的依據。
BIG CHANGE 電子報

掌握全貌,按照自己的步調。

關於人工智慧和機器人技術的近期報導、值得關注的轉變,以及可運用的實用想法。選擇每日快訊、每週摘要或每月觀點。