Atria Dawn Previewの開発チームは、AIの利用について参加者から明確な回答が得られた739件のタスクのうち、713件でAIを使用した。自社の開発作業に関する調査では、記録された手法やパラメーターの選択の85.5%で、人間が最終判断を下していた。論文のタイトルには「エージェント型の超知能」とあるが、タスク記録が示すのは、チーム内で作業をどう分担したかという、より具体的な状況だ。
このプレプリントは2026年9月14日に投稿され、9月17日に改訂された。1つのモデル開発プロジェクトにおける、56人の参加者による769件のタスク記録とエージェントのログを分析している。著者らは、自分たちのチームがエージェントを使ってAtria Dawn Previewを開発した方法を調べる事例研究だと説明している。
大きな変化
- 変わったこと:チームはモデル開発プロジェクトで、研究上の具体的な判断をエージェントと人間がどう分担したかを記録し、提案と最終判断を区別した。
- なぜ重要か:エージェントが手法を生み出して改訂を実行しても、研究者が目標を選び、手法を承認し、結果がタスクの基準を満たすかを判断することはできる。エージェントの行動だけを数えると、こうした役割の違いを見落とす。
- 今後の注目点:これは1つのチームの作業を観察した結果であり、判断の根拠の多くは参加者の申告による。別のAI研究所で判断がどう分担されているかや、エージェントが後継モデルを自律的に開発できるかを示すものではない。
エージェントは多くの手法を提示し、人間がその大半を選んだ
実行を担った参加者による、手法やパラメーターに関する567件の判断を見ると、役割の違いが最も明確に表れている。論文によると、その64.6%でAIが選択肢を提案した。単独で最も大きな区分は55.4%を占める「AIが提案し、人間が選択」だった。人間が最終判断を下した割合は85.5%、AIが下した割合は9.2%だった。残りは外部の制約による判断とされた。
判断の割合は質問の種類によって異なった。目標や範囲に関する603件の判断のうち93.4%、受け入れ基準に関する542件の判断のうち81.9%で、人間が最終判断を下した。手法についてはAIの提案が多かったが、目標についてはそうではなかった。論文の図表によると、AIなしでは実行できないと参加者が評価した151件のタスクのうち、144件で人間が最終目標を選んだ。
これらの割合は、報告された判断上の役割を示している。人間の判断が個々に十分な情報に基づいていたかを測るものではない。著者らは、この結果を、研究者が作業を方向付け、人間が設定した方向性の中でエージェントが選択肢を生み出していたと解釈している。この事例研究が記録したのは、最終権限を人間が保ちながら、実行を委任したプロジェクトの姿だ。
人間からのフィードバックを受けて、エージェントが作業に戻ることも多かった
参加者は各タスクで最も重大だった困難を振り返った。困難と対応が記録された588件のタスクのうち、447件(76.0%)は人間の支援を受けて進展した。エージェントが自力で立て直したのは135件(23.0%)だった。主な支援は、追加の背景情報や要件の明確化(207件)と、原因の特定や手法の変更(204件)だった。4件では人間が作業の中心部分を引き継いだ。
出力の記録にも、同様の分担が表れている。AIの主要な出力の扱いが分かる627件のタスクのうち、354件では実質的な修正が必要だった。この修正対象のうち、75.4%では人間のフィードバックを受けてエージェントが変更し、人間が直接編集したのは19.2%だった。研究者は、自ら編集せずに変更を指示することもできた。
開発中に増加したログ上の指標もある。22人の参加者からなるグループでは、人間の1回のプロンプト当たりに記録されたエージェントの行動数について、1日ごとの中央値が8月7日の11.0から9月4日の28.5に上がった。この指標は直前の7日間を対象とし、各日の有効な比率は21人または22人分だった。これは活動量を数えたものであり、エージェントの権限が拡大したことや、出力が改善したことを立証するものではない。
タスク記録から分かること
参加者は、同じ規模、質、その他のリソースの条件で、AIなしでも自分の担当部分を完了できたかを見積もった。AIを使って完了した455件のタスクのうち、有効な回答が得られた151件(33.2%)を、AIがなければ実行不可能と評価した。これは参加者による反実仮想の自己申告であり、エージェントを使わずにチームが同じタスクを繰り返す実験ではない。条件が異なれば、その作業には着手されなかったと立証できるものでもない。
論文は56人の参加者や769件のタスク記録の抽出方法を示しておらず、公開リンクからは独立して再分析できる基礎となるタスク回答やエージェントログを入手できない。ベンチマーク結果が評価するのは、モデルとしてのAtria Dawn Previewだ。AIシステムが自律的に後継モデルを改良したことを示すものではない。委任の範囲を決めるチームにとって、報告された境界は具体的だ。このプロジェクトではエージェントが頻繁に作業を提案し、修正した一方、参加者は目標、手法、受け入れ基準に関する選択の大半を自分たちが行ったと報告している。



