9月10日にarXivに投稿され、9月22日に改訂された調査論文は、AIシステムの改善にAIがどこまで関与するかを5段階に整理している。題名の「人間が作る最後のAI」は論文が掲げる目標であり、著者らが実現を報告した出来事ではない。論文の根拠は、システムが自らの開発手順の一部を改訂する限定的な事例までにとどまる。世代を重ねるごとに確実に優れた後継モデルを作り出すシステムが実現したとは示していない。
自動化されたAI研究の主張を評価する際、この区別が重要になる。エージェントが実験を実行し、知見を保存し、ベンチマークのスコアを改善しても、目標の設定、試験の管理、変更の採否を人間が担っている場合がある。より強い主張には、次の版を生み出す方法そのものが改善され、公平な比較で改訂後の方法の方が優れていたという根拠が必要だ。
大きな変化
- 何が変わったか:研究者は、割り当てられた更新の実行から、後の更新に使う手順の改訂まで、AIシステムが改善ループをどれだけ制御するかを、より正確に表現できるようになった。新しい調査論文は既存研究を整理したものであり、自律的に後継モデルを完成させたという発表ではない。
- なぜ重要か:AI研究所は、次のエージェントを作る能力が改善していると証明できなくても、より多くの実験を自動化できる。この違いは、研究者が性能の主張をどう解釈するか、どの段階で人間の確認と独立した試験を残すかに関わる。
- 今後の注目点:決定的な根拠となるのは、改訂した改善手法を受け継いで作られた後継システムの連続と、その手法を従来の方法と同等のリソースで保護されたタスクに対して試験した結果だ。調査対象の研究は、こうした条件で統計的に信頼できる累積的改善をまだ実証していない。
改善ループの制御を5段階で表す
論文はまず、単一タスク内の改訂をB0と呼び、継続的な改善と区別する。モデルがチェックに通るまで回答を編集しても、改善されたのはその回答だ。変更が後の独立したタスクにも引き継がれない限り、システム自体が持続的な更新を獲得したとはいえない。
レベル1では、人間が目標と成功判定を決め、AIが人間の定めたデータ品質ルールを適用するなどの更新を実行する。次にレベル2では、AIが割り当てられた目標に対する戦略も選ぶ。たとえば、コーディングエージェントの失敗を診断し、ツールの変更を提案する。ただし、目標と合格基準は引き続きシステムの外部で決まる。
レベル3では、システムが次に必要とする経験の選択にも関与する。たとえば、自ら見つけた弱点に取り組む練習タスクを選ぶ。レベル4では、継続利用から得られるフィードバックを加える。新たな条件に遭遇した後、メモリー、ルール、コンポーネントへの承認済み変更をシステムが保持する。論文はこの段階とレベル3のどちらも、フィードバックの質と、変更を保持するためのルールに左右されるとしている。
レベル5は、調査論文の中心的な考え方に到達する。AIは、後続の改善を導く手順、たとえば探索方針、評価器、後継モデルを提案するエージェントを改訂する。改訂した手順を保持し、次のサイクルで実際に使わなければならない。この段階でも、全体目標、保護された合格試験、リソースの管理を人間が続けることはできる。段階が示すのは委任された役割であって、進歩の保証や無制限の自律性ではない。
既存システムが示す境界
「Darwin Gödel Machine」の研究は、コーディングエージェントが、エージェントのコードを改変した複数の派生版と、成功版を登録するアーカイブを通じて、同研究のSWE-benchサブセットで20%から50%に成績を伸ばしたと報告している。一方、アーカイブの管理方法と、次の親モデルを選ぶルールは固定されていたとも著者らは記す。調査論文はこの例を使い、派生版の性能向上だけでは、その派生版を選ぶ過程そのものが改善された証拠にならないことを示している。
A-Evolve-Trainingは、より限定的なレベル5の例だ。300億パラメーターのモデルを使って、事後学習を4回実施した。メタエージェントは結果をまとめ、内部の開発スコアが外部のリーダーボードと連動しなくなった後、後続の作業者を導く研究方針を変更した。研究は最終スコア0.86を報告し、当時の人間による最上位提出の0.87と比較している。引き継がれた方針は、後の実験の選び方を変えた。一方、作業者の基盤システムと競技の目標は固定されたままだった。この例が示すのは、定義されたプロジェクト内で改訂した研究手順が機能したことであり、モデル開発のあらゆる側面を自律的に制御したことではない。
「HyperAgents」の研究は、改善されたエージェント構築手順が新しい領域にも応用できるかを試した。数学の採点に200回の反復を行った後、移転した改善を初期状態として始めた実行は、テストセットで0.640を記録した。初期エージェントから始めた実行は0.610だった。著者らによると、この差は統計的に有意ではなかった。この結果は転移の研究を後押しするが、試行を重ねるごとに確実に改善が積み上がることまでは示さない。
活動量が増えても、改善の証明にはならない
調査論文は、改訂した手順を再利用することを構造的再帰と呼び、有効な再帰と区別する。有効な再帰とは、同等の予算と独立した評価の下で、改訂した手順がより優れた後継システムを生み出すことだ。刺激的なタイトルを読む人がすでに起きたと考えがちなことを、実際にはこの二つ目の検証が確かめる。
活動を進歩と取り違える原因はいくつかある。システムが計算時間を増やして探索する、繰り返し参照したベンチマークに過剰適合する、あるタスクには役立つが別のタスクを損なう変更を保持する、といった場合だ。評価器自体も変更すれば、スコアの上昇は評価基準が変わった結果かもしれない。そのため論文は、何を改訂したかを記録し、改訂した部分が次のサイクルを実際に導いたことを示し、同じリソース条件下で旧版と比較し、独立したタスクで変更の定着と転移を試験するよう求めている。
著者らは、現在の結果が改善手法、評価器、研究方針への限定的な変更を支持する一方、「同等のリソース下で世代を超えて統計的に信頼できる累積的改善が得られるかは、未解決のままだ」と明記している。「人間が作る最後のAI」という表現は、彼らの枠組みが目指す到達点を指す。調査論文が示すのは、その実現に向けた進展を評価する基準だ。
出典と参考資料
- Duanほか、「人間が作る最後のAI」第3版(2026年9月22日)。B0とレベル1~5を定義し、構造的再帰と有効な再帰を区別する一次調査論文。根拠の限界も記載している。分類と解釈は著者らの枠組みであり、新システムの実演ではない。
- Zhangほか、「Darwin Gödel Machine」(第3版、2026年3月12日)。原著研究はコーディングのベンチマーク向上を報告し、アーカイブ管理と親モデルの選定が固定されていたと明記する。
- Shiほか、「A-Evolve-Training」(第3版、2026年9月8日)。原著プレプリントは事後学習の4サイクル、方針の改訂、報告されたリーダーボードの結果を説明する。目標と作業者の基盤システムは外部で固定されていた。
- Zhangほか、「HyperAgents」(2026年)。原著研究はエージェント構築手順の転移を試験し、ここで引用した200回の反復による比較では統計的有意差がなかったと報告する。
- Manuel Muñoz Pláによる詳細な分析(2026年9月18日)。調査論文の上位段階の例と根拠の限界を検討している。論文の以前の改訂版を扱っているため、この記事では第3版と引用した原著研究を事実関係の根拠としている。
- サウスチャイナ・モーニング・ポストの記事(2026年9月14日)。調査論文が示す5段階の道筋とAI研究の文脈を取り上げる二次報道であり、研究結果の根拠ではない。
- The Rundown AIの解説(2026年9月16日)。各段階を要約し、自動化されたAI研究をめぐる議論の中に論文を位置づける二次資料。事実に関する研究上の主張は論文と原著研究を根拠としている。



