AI-translated from English; not yet reviewed by a fluent editor.

# ケンブリッジの報告書、AI主導の研究がAIの進歩を加速する可能性を検討

> ケンブリッジのワーキングペーパーは、AI主導の研究開発がAIの進歩を加速し得るかを検討する。Anthropicの26%という数値が示すのは監督下の作業であり、提案されたフィードバックループは条件付きのシナリオだ。

By BIG CHANGE Editorial

Published: 2026-09-28T23:34:31.964Z
Updated: 2026-09-28T23:34:31.964Z
Canonical: https://bigchange.ai/blog/casp-report-ai-automating-ai-research

![Conceptual charcoal illustration, seen from above, of one researcher comparing two sheets at a workbench while a desktop monitor faces away.](https://bigchange.ai/api/media/file/casp-research-review-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Anthropicによると、同社が測定するAI研究開発作業の26%を、現在Claudeが「主導」している。これは、高いレベルの指示を受けたシステムが、タスクの大半を完了する間、人が監督するという意味だ。Anthropicは、測定対象の研究開発作業を完全に自律して行った例はないとも述べている。この違いは、ケンブリッジAI科学・政策プログラムによる新しい[ワーキングペーパー](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)で重要となる。同論文は、AIが自らの研究開発をさらに担うことで、やがてAIの進歩が急激に加速する可能性があるかを問うている。

2026年9月付のこの論文には、大学、AI企業、市民社会から22人の著者が参加している。高性能なシステムがより優れたシステムの開発に協力し、新しいシステムがさらに研究を進めるという急速なフィードバックループは起こり得ると論じている。中心的な結論は、そうした経路があり得るという警告と、その進行を測定する必要性だ。加速がすでに始まったと報告しているわけではない。

## 大きな変化

- **何が変わったのか：** 複数機関の研究者によるワーキングペーパーが、AI主導の研究開発に関する証拠と、AIの進歩が加速する条件を整理した。先端AI企業に政府が求めるべき具体的な測定指標も提案している。
- **なぜ重要なのか：** AIシステムを開発する企業の中で、研究作業を委ねられるタスクが増えている。委任の度合いを示す公開指標はまだ部分的であり、研究プロセス全体がどれだけ速くなっているかは分かりにくい。
- **今後の注目点：** AIが完了する作業の割合、AIの貢献が後続モデルを改善するか、計算資源、実験、人によるレビューがフィードバックループを遅らせるかについて、独立に検証された指標が必要だ。

## 証拠はあるが、指標が答える問いはそれぞれ異なる

[Anthropicの9月の測定報告](https://www.anthropic.com/institute/measuring-pace-of-ai-development)によると、同社の研究開発作業で「AIが主導」と判定された割合は、2026年2月の1%未満から8月には26%へ上がった。この評価段階でも人間の監督者が付く。Anthropicは、この指標は試作段階で、自社モデルが作業評価の一部を担っており、企業間で数値を比べる共通の方法もないと説明している。「測定対象の作業に完全な自律実行はない」という同社の説明も、26%という数字と合わせて見る必要がある。

[OpenAIの9月の説明](https://openai.com/index/research-acceleration-view-inside-openai/)では、研究者がより多くのコーディングエージェントを使い、より速くコードを追加し、より多くの実験を行っている。OpenAIによると、実験数はエージェントの利用拡大と相関しており、利用できる計算資源も増えた。研究の優先順位を選び、どの結果を追うか決めるのは、引き続き人だとしている。コードや実験が増えれば研究に役立つ可能性はあるが、より高性能なモデルが生み出される速度も同じ割合で上がったとは言えない。

独立評価は、プロセスの一部を測定するのに役立つ。[METRのTime Horizon 1.1更新](https://metr.org/blog/2026-1-29-time-horizon-1-1/)では、同機関のテストセットで、従来より長い研究・ソフトウェア作業をモデルが完了できることが示された。METRは、完了時間の多くを人が推定した長時間タスクでは、不確実性が大きいとも報告している。タスクベンチマークが測るのは選定した課題での能力であり、AI研究所全体の研究生産性ではない。経験豊富なオープンソース開発者16人に246件の作業を依頼した別の無作為化研究では、[METRは2025年初頭のAIツールを使うと完了時間が19%増えたと確認した](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf)。この当時のソフトウェア開発環境は、2026年9月の先端AI研究所を代表するものではない。それでも、ツールの利用やタスクベンチマークだけでは生産性の問いに答えられない理由を示している。

## フィードバックループを減速させる複数の要因

CASPの論文は、ソフトウェアを通じたループに焦点を当てる。AIシステムが並行して作業することで、実質的な研究人員が拡大する。うまくいった改善によって次世代システムの研究能力が高まり、さらなる改善が可能になる。著者らは、予備的な証拠はこの仕組みと整合するとし、数年以内に研究開発の大部分が自動化される可能性は高いと判断している。数年分の進歩が数カ月以下に圧縮されるような、より急激な「知能爆発」は、ループが制約を上回る場合に限られる。これは条件付きのシナリオであり、何が起きるかを測定して示す予測ではない。

論文は重要な制約を4つ挙げている。研究努力をさらに増やした場合の収穫逓減、計算資源とデータの制限、自動化が難しいままの作業、そして長時間の学習実行など任意に短縮できないプロセスだ。これらの一部について証拠は混在または間接的であり、時間のかかるボトルネックの強さを直接示す証拠は不足しているという。研究開発が全面的に自動化した後、研究努力に対する推定効果が続き、新たなボトルネックが現れないという条件で、約1年半以内に進歩が10倍に加速する例もモデル計算として示されている。実際に観測された加速でも、条件を付けない時期の予測でもない。

ほかの研究も不確実性を掘り下げる。[2025年のAI研究所4社を対象にした研究](https://arxiv.org/abs/2507.23181)で、パーカー・ホイットフィル氏とチェリル・ウー氏は、研究計算資源のモデル化の仕方によって異なる結果を得た。あるモデルでは認知労働と計算資源は代替関係に見えたが、先端実験で必要となる計算資源の増加を考慮したモデルでは、両者は補完関係に見えた。著者らはデータとモデルに限界があると注意している。[トビー・オード氏の2026年8月の分析](https://arxiv.org/abs/2608.14426)では、改善サイクルを一つ完了するまでの時間も重要な変数として挙げている。これらの分析は急激な加速の可能性を否定しない。一方、エージェントの数や生成するコード量から、ループの速度を直接読み取ることはできないと示している。

## 著者らが測定を求める理由

ケンブリッジの著者らは、AI研究開発の自動化を把握すること、加速の可能性を方向付けて制約する方法を作ること、その潜在的影響に備えることの3点を政策上の優先事項として提案している。最も即時かつ検証しやすいのは測定だ。AIが生み出す研究上の貢献割合、アルゴリズムの改善ペース、人員と計算資源への支出配分、AIシステムが影響を与える研究判断、社内エージェントに関するインシデントの報告を提案している。独立監査も提案し、AI研究開発能力の最先端にあるシステムには、より厳しい要件を求めている。

追加導入の前提条件、指定された研究開発作業の一時停止方法、国際検証など、その後の提案には大きな制度設計とトレードオフが伴う。論文自体も、権限の設計が不適切なら、特定企業を優遇したり、有益な作業を遅らせたりしかねないと警告している。潜在的な便益と深刻な危害に関する説明は、先に示した条件付きの加速シナリオに基づく。極端なシナリオがすでに起きたと仮定せずとも、政策担当者は近い将来の報告制度の必要性を検討できる。

報告書を受けて考えるべき問いは、AIが突然超知能になるかどうかよりも範囲が狭い。各研究所は、研究のどの部分をAIが主導しているのか、人間の評価を通過してどの改善が残るのか、改善がどれだけ速く次世代システムに反映されるのかを、比較可能な形で示せるだろうか。企業横断で答えられるほどの公開証拠はまだない。

## 出典・参考資料

- [ケンブリッジAI科学・政策プログラム：ワーキングペーパー全文（2026年9月）](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)：著者らの主張、証拠のレビュー、モデルの前提、限界、政策提案を掲載。ワーキングペーパーと明記されており、外部査読済みだとする情報は公開資料で確認できない。
- [CASPエグゼクティブサマリー](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf)：著者らが示す条件付きシナリオと対応案の要約。著者の一部が執筆した。
- [Anthropic：AI主導の研究開発に関する測定](https://www.anthropic.com/institute/measuring-pace-of-ai-development)：26%の「AI主導」という数値、監督の程度、手法上の限界に関する一次情報。
- [OpenAI：OpenAI社内の研究加速](https://openai.com/index/research-acceleration-view-inside-openai/)：エージェントの利用、実験数、人による指示、研究の進歩を測る際の留保に関する同社の報告。
- [METR：Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/)：独立したタスク評価と、ベンチマークの時間幅をどう推定するかに関する不確実性。
- [ホイットフィル、ウー：計算資源のボトルネック](https://arxiv.org/abs/2507.23181)、および[オード：知能爆発のダイナミクス](https://arxiv.org/abs/2608.14426)：再帰的な研究ループを遅らせたり変化させたりする条件を扱う別々の分析。

## Sources

- [CASP：「AI研究開発の自動化は知能爆発を引き起こすのか？」](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf) — フロンティアAIワーキングペーパーシリーズ第2号（2026年）、全14ページの一次資料。全文を参照。仕組み、混在する証拠、前提、政策提案を掲載。
- [CASPエグゼクティブサマリー](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf) — 著者の一部による2ページの要約。全文と照合済み。
- [Anthropic：「フロンティア研究所におけるAI開発の速度を把握するための測定」](https://www.anthropic.com/institute/measuring-pace-of-ai-development) — 「AI主導」26%、測定対象の完全自律作業ゼロ、方法上の留保を報告する企業自身の測定。
- [OpenAI：「研究加速：OpenAIの内部から見た状況」](https://openai.com/index/research-acceleration-view-inside-openai/) — エージェント利用と研究活動に関する企業自身の測定。相関とモデルの進歩全体を区別している。
- [METR：「Time Horizon 1.1」](https://metr.org/blog/2026-1-29-time-horizon-1-1/) — タスク構成と不確実性に限界がある、独立したタスク時間軸の評価。
- [METR：「2025年初頭のAIが経験豊富なオープンソース開発者の生産性に与えた影響を測定」](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf) — 異なるソフトウェア開発環境での無作為化研究。ツール導入だけから生産性を推定することへの、限定的な反例。
- [ホイットフィル、ウー：「計算資源のボトルネックは知能爆発を防ぐのか？」](https://arxiv.org/abs/2507.23181) — 認知労働と計算資源の代替性に関する推計がモデルによって異なることを示す、モデルに基づく分析。データの限界も明示している。
- [トビー・オード：「知能爆発のダイナミクス」](https://arxiv.org/abs/2608.14426) — フィードバックを一巡させる時間を扱う理論的分析であり、実証的な予測ではない。
