AI-translated from English; not yet reviewed by a fluent editor.

# 劍橋報告探討 AI 主導研究能否加速 AI 發展

> 劍橋工作論文探討 AI 主導研發能否加速 AI 發展。Anthropic 提出的 26% 指標來自有人監督的工作；所設想的回饋循環仍有條件限制。

By BIG CHANGE Editorial

Published: 2026-09-28T23:34:31.964Z
Updated: 2026-09-28T23:34:31.964Z
Canonical: https://bigchange.ai/blog/casp-report-ai-automating-ai-research

![Conceptual charcoal illustration, seen from above, of one researcher comparing two sheets at a workbench while a desktop monitor faces away.](https://bigchange.ai/api/media/file/casp-research-review-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Anthropic 表示，Claude 目前主導公司所衡量 AI 研發工作的 26%。這表示在有人監督的情況下，系統可依較高層次的提示完成大部分任務。Anthropic 也表示，沒有任何受測研發工作是由 Claude 完全自主完成。這項區別很重要；劍橋 AI 科學與政策計畫的一篇新[工作論文](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)探討 AI 若承擔更多自身研發工作，是否終將使 AI 發展大幅加速。

這篇標示日期為 2026 年 9 月的論文匯集 22 位來自大學、AI 公司和公民社會的作者。論文指出，一種快速回饋循環是可能的：有能力的系統協助打造更好的系統，後者再執行更多研究。核心結論是提醒一條合理可能的發展路徑，並指出有必要測量其進展。論文沒有聲稱這種加速已經開始。

## 主要變化

- **發生了什麼變化：**一篇跨機構工作論文整理 AI 主導研發的證據、可能加快 AI 進展的條件，以及作者建議政府向前沿實驗室取得的特定測量資料。
- **為何重要：**開發 AI 系統的公司正把更多研究任務交由 AI 執行，但公開的委派程度指標仍不完整，因此難以判斷整體研究流程究竟加快多少。
- **接下來關注什麼：**值得關注的是經獨立核查的指標：AI 完成多少工作、其貢獻是否改進後續模型，以及算力、實驗和人工審查是否會減慢回饋循環。

## 證據確實存在，但各項指標回答的問題不同

[Anthropic 9 月發布的測量報告](https://www.anthropic.com/institute/measuring-pace-of-ai-development)表示，到 2026 年 8 月，其研發工作中由 AI「主導」的比例已達 26%，高於 2 月的不到 1%。不過，其評等類別仍包括人工監督。Anthropic 表示，這項指標仍是原型、自家模型也協助評等工作，而且各公司間沒有共通的比較方法。該公司也稱，沒有任何受測工作完全自主完成；這點應與 26% 數字一併看待。

[OpenAI 9 月發布的說明](https://openai.com/index/research-acceleration-view-inside-openai/)描述研究人員使用更多程式設計代理、更快貢獻程式碼並進行更多實驗。OpenAI 表示，實驗數量與代理使用量增加相關，而可用算力也同步成長。公司稱研究優先順序仍由人選擇，並由人決定後續追查哪些結果。更多程式碼和實驗可能有助研究，但不能證明更高能力模型的產出速度也等幅增加。

獨立評測有助於衡量其中一個環節。[METR 的 Time Horizon 1.1 更新](https://metr.org/blog/2026-1-29-time-horizon-1-1/)發現，在其測試套件中，模型能完成比早期系統更長的研究與軟體任務。METR 也指出，長時間任務的結果存在很大不確定性，其中許多人類完成時間是估算值。任務基準測試衡量模型在特定任務上的能力，並不衡量 AI 實驗室整體研究生產力。另一項隨機研究則由 16 位資深開源開發者完成 246 項任務，[METR 發現，使用 2025 年初的 AI 工具後，任務完成時間增加 19%](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf)。那個較早期的軟件場景不能代表 2026 年 9 月的前沿實驗室，但它說明，僅憑工具使用情況和任務基準測試，無法得出生產力是否提高的結論。

## 可能的回饋循環受到多重因素制約

CASP 論文聚焦於軟體驅動的循環：AI 系統透過平行工作擴大有效研究人力；成功改進使下一代系統成為更好的研究者，進而帶來更多改進。作者表示，初步證據與此機制一致，並認為未來幾年研發自動化大幅增加的可能性不低。更強烈的「智慧爆炸」情境——把數年進展壓縮到幾個月甚至更短——則取決於循環是否快過其限制。這是有條件的情境，不是對未來結果的實測預測。

論文列出四項重要限制：額外研究投入的邊際效益遞減、算力與資料有限、仍難以自動化的任務，以及無法任意加速的流程，例如長時間訓練。論文指出，部分限制的證據相互矛盾或屬間接資料，對耗時瓶頸影響程度也缺乏直接證據。論文舉例，在研發完全自動化後，若研究投入的估計效益持續且沒有新瓶頸出現，模型計算顯示進展速度可能在約 1.5 年內加快十倍。這不是已觀察到的加速，也不是無條件的時間預測。

其他研究進一步凸顯這些不確定性。在一項[2025 年對四家 AI 實驗室的研究](https://arxiv.org/abs/2507.23181)中，Parker Whitfill 和 Cheryl Wu 發現，研究算力的建模方式不同，結論也不同。在一種設定下，認知勞動和算力似乎可以互相替代；納入前沿實驗資源需求上升的模型，則顯示兩者可能互補。作者提醒，資料和模型均有限。[Toby Ord 於 2026 年 8 月發表的分析](https://arxiv.org/abs/2608.14426)將每輪改進所需時間列為另一項關鍵參數。這些分析並未排除快速加速，但顯示不能只看代理數量或其撰寫的程式碼量，就直接推斷回饋循環的速度。

## 作者希望測量什麼

劍橋論文作者提出三項政策優先事項：掌握 AI 研發自動化的情況、制定引導和限制可能加速的方式，並為潛在影響預作準備。其中最即時且可檢驗的是測量。作者建議公布 AI 產出的研究貢獻比例、演算法改進速度、實驗室在人力與算力間的支出分配、AI 系統影響的研究決策，以及內部代理事件。作者也建議進行獨立稽核，並對具備前沿 AI 研發能力的系統提出更嚴格要求。

部分後續建議，包括進一步部署前的要求、暫停特定研發工作負載的方式及國際查證，都需要大量設計並涉及取捨。論文也警告，設計不良的權力可能偏袒單一公司並延後有益工作。論文對潛在效益和重大危害的討論，建立在前述有條件的加速情境上。政策制定者可以先檢視近期的資訊揭露方案，不必先假設最極端情境已經發生。

讀完這份報告後，更值得追問的不是 AI 是否會突然變得超級智慧，而是各實驗室能否以可比較的方式說明：目前哪些研究環節由 AI 主導、哪些改進通過人工評估後仍然成立，以及這些改進多快能回饋到下一代系統。現有公開證據尚不足以跨公司回答這些問題。

## 來源與延伸閱讀

- [劍橋 AI 科學與政策計畫：完整工作論文（2026 年 9 月）](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)：作者的論點、證據綜述、模型假設、局限和政策建議。本文標注為工作論文；其公開資料無法證明經過外部同行評審。
- [CASP 執行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf)：對作者所設定的條件性情景及建議應對措施的簡短說明，由部分作者撰寫。
- [Anthropic：衡量前沿實驗室內 AI 主導研發的進展](https://www.anthropic.com/institute/measuring-pace-of-ai-development)：26% 的 AI“主導”數據、其中包含的監督程度，以及方法上的局限的一手來源。
- [OpenAI：OpenAI 內部的研究加速情況](https://openai.com/index/research-acceleration-view-inside-openai/)：公司報告的智能體使用、實驗數量、人工指導情況，以及衡量研究進展時應注意的限制。
- [METR：Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/)：關於獨立任務時長評測，以及基準測試時長估算方式存在不確定性的研究。
- [Whitfill 與 Wu：算力瓶頸會阻止智慧爆炸嗎？](https://arxiv.org/abs/2507.23181)，以及[Ord：智慧爆炸的動態](https://arxiv.org/abs/2608.14426)：兩項獨立分析，探討可能減緩或改變遞歸研究循環的條件。

## Sources

- [CASP：自動化 AI 研發會引發智慧爆炸嗎？](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf) — 《前沿 AI 工作論文系列》第 2 期（2026 年），共 14 頁。一手來源。建議通讀。討論機制、證據不一致之處、假設和政策建議。
- [CASP 執行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf) — 由部分作者撰寫的兩頁摘要。已與完整論文核對。
- [Anthropic：衡量前沿實驗室內 AI 主導研發的進展](https://www.anthropic.com/institute/measuring-pace-of-ai-development) — 公司關於 AI 主導 26%、完全自主工作為零及方法局限的一手測量。
- [OpenAI：研究加速：OpenAI 內部視角](https://openai.com/index/research-acceleration-view-inside-openai/) — 公司關於智能體使用和研究活動的一手指標；區分相關性與模型整體進步。
- [METR：Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/) — 獨立的任務時長評測，說明其中的不確定性和任務組成方面的局限。
- [METR：衡量 2025 年初 AI 對資深開源開發者生產力的影響](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf) — 針對不同軟件工作場景開展的隨機研究；是提醒人們不要把工具采用直接等同於生產力提升的有限反例。
- [Whitfill 與 Wu：算力瓶頸能否阻止智能爆炸？](https://arxiv.org/abs/2507.23181) — 基於模型的分析，對算力與勞動是否可以相互替代得出了不同估計，並明確說明了數據局限。
- [Toby Ord：智能爆炸的動態機制](https://arxiv.org/abs/2608.14426) — 關於反饋循環每代所需時間的理論分析，並非經驗預測。
