開發 Atria Dawn Preview 的團隊,在參與者明確回答是否使用 AI 的 739 項任務中,有 713 項使用了 AI。團隊針對自身開發工作的研究則顯示,在有關方法或參數的已記錄決策中,有 85.5% 最後由人做出選擇。論文標題使用「代理式超級智慧」一詞,但任務紀錄呈現了更具體的工作分工。

這份預印本於 2026 年 9 月 14 日投稿,並於 9 月 17 日修訂。研究取材自單一模型開發計畫,包含 56 位參與者的 769 筆任務紀錄,以及代理程式日誌。作者將其描述為一項個案研究,探討團隊如何使用代理程式開發 Atria Dawn Preview。

核心變化

  • 有哪些改變:團隊記錄了模型開發計畫中,代理程式與人如何分擔具體研究決策,並區分「提出方案」與「做出最終選擇」。
  • 為何重要:代理程式可以提出方法並執行修改,但研究人員仍可能決定目標、核准方法,並判斷結果是否符合任務標準。只計算代理程式執行了多少動作,會忽略這些不同角色。
  • 後續觀察重點:這些是單一團隊的工作紀錄,其中許多決策資訊由參與者自述提供。研究結果無法證明其他 AI 實驗室如何分配決策,也無法證明代理程式能自主開發其後繼系統。

代理程式提出許多方法,人選定大多數方案

研究在執行職務的參與者中,記錄了 567 項有關方法或參數的決策。論文指出,其中 64.6% 的決策由 AI 提出選項;最常見的單一類型占 55.4%,即「AI 提議、人做選擇」。最後由人做出選擇的占 85.5%,由 AI 做出選擇的占 9.2%,其餘歸因於外部限制。

不同問題的決策分工也不同。在 603 項有關目標或範疇的決策中,93.4% 最後由人選擇;在 542 項有關驗收標準的決策中,則有 81.9% 由人選擇。AI 在方法上的提案遠比在目標上的提案常見。論文圖表另記錄,在參與者認為若無 AI 便不可行的 151 項任務中,有 144 項的最終目標由人選定。

這些百分比反映的是參與者所述的決策角色,並未衡量每項人為選擇是否基於充分資訊。作者將此模式解讀為:研究人員引導工作方向,代理程式則在人設定的方向內產生選項。這項個案研究記錄了該計畫如何委派執行工作,同時保留人類的最終決策權。

人類回饋經常讓代理程式重做

參與者回想每項任務中影響最大的困難。在 588 項同時記錄困難及應對方式的任務中,447 項(76.0%)在人的協助下繼續推進;代理程式自行恢復的有 135 項(23.0%)。最常見的協助方式是補充背景或釐清要求(207 項),以及診斷問題或更換方法(204 項)。有 4 項由人接手主要工作。

輸出紀錄呈現出相似的分工。在 627 項已知主要 AI 輸出後續處理方式的任務中,有 354 項需要實質修改。在這些需修改的任務中,75.4% 是代理程式在人提供回饋後自行修改,19.2% 則由人直接編輯。研究人員可以指示修改方向,而不必親自動手修改。

開發期間有一項日誌指標也上升:在 22 位參與者的群組中,每個人類提示所對應的代理程式每日動作數中位數,從 8 月 7 日的 11.0 上升至 9 月 4 日的 28.5。此指標採用前 7 日的資料;每一天都有 21 或 22 人具備可用的比率數據。它計算的是活動量,無法證明代理程式取得更多決策權,或其輸出有所改善。

任務紀錄能說明什麼

參與者估計,在範疇、品質及其他資源條件相同的情況下,若沒有 AI,自己能否完成任務。在 455 項有可用回答、且曾使用 AI 完成的任務中,參與者認為 151 項(33.2%)若無 AI 就不可行。這是參與者對假設情境的自我評估,不是團隊在沒有代理程式的情況下重新執行任務的實驗,因此不能證明若條件不同,這些工作就完全不會嘗試。

論文沒有交代 56 位參與者或 769 筆任務紀錄的抽樣程序;公開連結也沒有提供底層任務回答或代理程式日誌,供外部人士獨立重新分析。論文的基準測試評估的是 Atria Dawn Preview 這個模型,並未顯示 AI 系統能自主改良其後繼系統。對考慮委派工作的團隊而言,報告所呈現的界線很明確:在這項計畫中,代理程式經常提出方案並修改工作,而參與者表示,目標、方法及驗收標準的大多數選擇仍由人做出。