Anthropicによると、同社が測定するAI研究開発作業の26%を、現在Claudeが「主導」している。これは、高いレベルの指示を受けたシステムが、タスクの大半を完了する間、人が監督するという意味だ。Anthropicは、測定対象の研究開発作業を完全に自律して行った例はないとも述べている。この違いは、ケンブリッジAI科学・政策プログラムによる新しいワーキングペーパーで重要となる。同論文は、AIが自らの研究開発をさらに担うことで、やがてAIの進歩が急激に加速する可能性があるかを問うている。

2026年9月付のこの論文には、大学、AI企業、市民社会から22人の著者が参加している。高性能なシステムがより優れたシステムの開発に協力し、新しいシステムがさらに研究を進めるという急速なフィードバックループは起こり得ると論じている。中心的な結論は、そうした経路があり得るという警告と、その進行を測定する必要性だ。加速がすでに始まったと報告しているわけではない。

大きな変化

  • 何が変わったのか: 複数機関の研究者によるワーキングペーパーが、AI主導の研究開発に関する証拠と、AIの進歩が加速する条件を整理した。先端AI企業に政府が求めるべき具体的な測定指標も提案している。
  • なぜ重要なのか: AIシステムを開発する企業の中で、研究作業を委ねられるタスクが増えている。委任の度合いを示す公開指標はまだ部分的であり、研究プロセス全体がどれだけ速くなっているかは分かりにくい。
  • 今後の注目点: AIが完了する作業の割合、AIの貢献が後続モデルを改善するか、計算資源、実験、人によるレビューがフィードバックループを遅らせるかについて、独立に検証された指標が必要だ。

証拠はあるが、指標が答える問いはそれぞれ異なる

Anthropicの9月の測定報告によると、同社の研究開発作業で「AIが主導」と判定された割合は、2026年2月の1%未満から8月には26%へ上がった。この評価段階でも人間の監督者が付く。Anthropicは、この指標は試作段階で、自社モデルが作業評価の一部を担っており、企業間で数値を比べる共通の方法もないと説明している。「測定対象の作業に完全な自律実行はない」という同社の説明も、26%という数字と合わせて見る必要がある。

OpenAIの9月の説明では、研究者がより多くのコーディングエージェントを使い、より速くコードを追加し、より多くの実験を行っている。OpenAIによると、実験数はエージェントの利用拡大と相関しており、利用できる計算資源も増えた。研究の優先順位を選び、どの結果を追うか決めるのは、引き続き人だとしている。コードや実験が増えれば研究に役立つ可能性はあるが、より高性能なモデルが生み出される速度も同じ割合で上がったとは言えない。

独立評価は、プロセスの一部を測定するのに役立つ。METRのTime Horizon 1.1更新では、同機関のテストセットで、従来より長い研究・ソフトウェア作業をモデルが完了できることが示された。METRは、完了時間の多くを人が推定した長時間タスクでは、不確実性が大きいとも報告している。タスクベンチマークが測るのは選定した課題での能力であり、AI研究所全体の研究生産性ではない。経験豊富なオープンソース開発者16人に246件の作業を依頼した別の無作為化研究では、METRは2025年初頭のAIツールを使うと完了時間が19%増えたと確認した。この当時のソフトウェア開発環境は、2026年9月の先端AI研究所を代表するものではない。それでも、ツールの利用やタスクベンチマークだけでは生産性の問いに答えられない理由を示している。

フィードバックループを減速させる複数の要因

CASPの論文は、ソフトウェアを通じたループに焦点を当てる。AIシステムが並行して作業することで、実質的な研究人員が拡大する。うまくいった改善によって次世代システムの研究能力が高まり、さらなる改善が可能になる。著者らは、予備的な証拠はこの仕組みと整合するとし、数年以内に研究開発の大部分が自動化される可能性は高いと判断している。数年分の進歩が数カ月以下に圧縮されるような、より急激な「知能爆発」は、ループが制約を上回る場合に限られる。これは条件付きのシナリオであり、何が起きるかを測定して示す予測ではない。

論文は重要な制約を4つ挙げている。研究努力をさらに増やした場合の収穫逓減、計算資源とデータの制限、自動化が難しいままの作業、そして長時間の学習実行など任意に短縮できないプロセスだ。これらの一部について証拠は混在または間接的であり、時間のかかるボトルネックの強さを直接示す証拠は不足しているという。研究開発が全面的に自動化した後、研究努力に対する推定効果が続き、新たなボトルネックが現れないという条件で、約1年半以内に進歩が10倍に加速する例もモデル計算として示されている。実際に観測された加速でも、条件を付けない時期の予測でもない。

ほかの研究も不確実性を掘り下げる。2025年のAI研究所4社を対象にした研究で、パーカー・ホイットフィル氏とチェリル・ウー氏は、研究計算資源のモデル化の仕方によって異なる結果を得た。あるモデルでは認知労働と計算資源は代替関係に見えたが、先端実験で必要となる計算資源の増加を考慮したモデルでは、両者は補完関係に見えた。著者らはデータとモデルに限界があると注意している。トビー・オード氏の2026年8月の分析では、改善サイクルを一つ完了するまでの時間も重要な変数として挙げている。これらの分析は急激な加速の可能性を否定しない。一方、エージェントの数や生成するコード量から、ループの速度を直接読み取ることはできないと示している。

著者らが測定を求める理由

ケンブリッジの著者らは、AI研究開発の自動化を把握すること、加速の可能性を方向付けて制約する方法を作ること、その潜在的影響に備えることの3点を政策上の優先事項として提案している。最も即時かつ検証しやすいのは測定だ。AIが生み出す研究上の貢献割合、アルゴリズムの改善ペース、人員と計算資源への支出配分、AIシステムが影響を与える研究判断、社内エージェントに関するインシデントの報告を提案している。独立監査も提案し、AI研究開発能力の最先端にあるシステムには、より厳しい要件を求めている。

追加導入の前提条件、指定された研究開発作業の一時停止方法、国際検証など、その後の提案には大きな制度設計とトレードオフが伴う。論文自体も、権限の設計が不適切なら、特定企業を優遇したり、有益な作業を遅らせたりしかねないと警告している。潜在的な便益と深刻な危害に関する説明は、先に示した条件付きの加速シナリオに基づく。極端なシナリオがすでに起きたと仮定せずとも、政策担当者は近い将来の報告制度の必要性を検討できる。

報告書を受けて考えるべき問いは、AIが突然超知能になるかどうかよりも範囲が狭い。各研究所は、研究のどの部分をAIが主導しているのか、人間の評価を通過してどの改善が残るのか、改善がどれだけ速く次世代システムに反映されるのかを、比較可能な形で示せるだろうか。企業横断で答えられるほどの公開証拠はまだない。

出典・参考資料