Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# 劍橋報告探討 AI 主導研究能否加速 AI 發展
> 劍橋工作論文探討 AI 主導研發能否加速 AI 發展。Anthropic 提出的 26% 指標來自有人監督的工作;所設想的回饋循環仍有條件限制。
By BIG CHANGE Editorial
Published: 2026-09-28T23:34:31.964Z
Updated: 2026-09-28T23:34:31.964Z
Canonical: https://bigchange.ai/blog/casp-report-ai-automating-ai-research

AI-generated conceptual illustration by BIG CHANGE.
Anthropic 表示,Claude 目前主導公司所衡量 AI 研發工作的 26%。這表示在有人監督的情況下,系統可依較高層次的提示完成大部分任務。Anthropic 也表示,沒有任何受測研發工作是由 Claude 完全自主完成。這項區別很重要;劍橋 AI 科學與政策計畫的一篇新[工作論文](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)探討 AI 若承擔更多自身研發工作,是否終將使 AI 發展大幅加速。
這篇標示日期為 2026 年 9 月的論文匯集 22 位來自大學、AI 公司和公民社會的作者。論文指出,一種快速回饋循環是可能的:有能力的系統協助打造更好的系統,後者再執行更多研究。核心結論是提醒一條合理可能的發展路徑,並指出有必要測量其進展。論文沒有聲稱這種加速已經開始。
## 主要變化
- **發生了什麼變化:**一篇跨機構工作論文整理 AI 主導研發的證據、可能加快 AI 進展的條件,以及作者建議政府向前沿實驗室取得的特定測量資料。
- **為何重要:**開發 AI 系統的公司正把更多研究任務交由 AI 執行,但公開的委派程度指標仍不完整,因此難以判斷整體研究流程究竟加快多少。
- **接下來關注什麼:**值得關注的是經獨立核查的指標:AI 完成多少工作、其貢獻是否改進後續模型,以及算力、實驗和人工審查是否會減慢回饋循環。
## 證據確實存在,但各項指標回答的問題不同
[Anthropic 9 月發布的測量報告](https://www.anthropic.com/institute/measuring-pace-of-ai-development)表示,到 2026 年 8 月,其研發工作中由 AI「主導」的比例已達 26%,高於 2 月的不到 1%。不過,其評等類別仍包括人工監督。Anthropic 表示,這項指標仍是原型、自家模型也協助評等工作,而且各公司間沒有共通的比較方法。該公司也稱,沒有任何受測工作完全自主完成;這點應與 26% 數字一併看待。
[OpenAI 9 月發布的說明](https://openai.com/index/research-acceleration-view-inside-openai/)描述研究人員使用更多程式設計代理、更快貢獻程式碼並進行更多實驗。OpenAI 表示,實驗數量與代理使用量增加相關,而可用算力也同步成長。公司稱研究優先順序仍由人選擇,並由人決定後續追查哪些結果。更多程式碼和實驗可能有助研究,但不能證明更高能力模型的產出速度也等幅增加。
獨立評測有助於衡量其中一個環節。[METR 的 Time Horizon 1.1 更新](https://metr.org/blog/2026-1-29-time-horizon-1-1/)發現,在其測試套件中,模型能完成比早期系統更長的研究與軟體任務。METR 也指出,長時間任務的結果存在很大不確定性,其中許多人類完成時間是估算值。任務基準測試衡量模型在特定任務上的能力,並不衡量 AI 實驗室整體研究生產力。另一項隨機研究則由 16 位資深開源開發者完成 246 項任務,[METR 發現,使用 2025 年初的 AI 工具後,任務完成時間增加 19%](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf)。那個較早期的軟件場景不能代表 2026 年 9 月的前沿實驗室,但它說明,僅憑工具使用情況和任務基準測試,無法得出生產力是否提高的結論。
## 可能的回饋循環受到多重因素制約
CASP 論文聚焦於軟體驅動的循環:AI 系統透過平行工作擴大有效研究人力;成功改進使下一代系統成為更好的研究者,進而帶來更多改進。作者表示,初步證據與此機制一致,並認為未來幾年研發自動化大幅增加的可能性不低。更強烈的「智慧爆炸」情境——把數年進展壓縮到幾個月甚至更短——則取決於循環是否快過其限制。這是有條件的情境,不是對未來結果的實測預測。
論文列出四項重要限制:額外研究投入的邊際效益遞減、算力與資料有限、仍難以自動化的任務,以及無法任意加速的流程,例如長時間訓練。論文指出,部分限制的證據相互矛盾或屬間接資料,對耗時瓶頸影響程度也缺乏直接證據。論文舉例,在研發完全自動化後,若研究投入的估計效益持續且沒有新瓶頸出現,模型計算顯示進展速度可能在約 1.5 年內加快十倍。這不是已觀察到的加速,也不是無條件的時間預測。
其他研究進一步凸顯這些不確定性。在一項[2025 年對四家 AI 實驗室的研究](https://arxiv.org/abs/2507.23181)中,Parker Whitfill 和 Cheryl Wu 發現,研究算力的建模方式不同,結論也不同。在一種設定下,認知勞動和算力似乎可以互相替代;納入前沿實驗資源需求上升的模型,則顯示兩者可能互補。作者提醒,資料和模型均有限。[Toby Ord 於 2026 年 8 月發表的分析](https://arxiv.org/abs/2608.14426)將每輪改進所需時間列為另一項關鍵參數。這些分析並未排除快速加速,但顯示不能只看代理數量或其撰寫的程式碼量,就直接推斷回饋循環的速度。
## 作者希望測量什麼
劍橋論文作者提出三項政策優先事項:掌握 AI 研發自動化的情況、制定引導和限制可能加速的方式,並為潛在影響預作準備。其中最即時且可檢驗的是測量。作者建議公布 AI 產出的研究貢獻比例、演算法改進速度、實驗室在人力與算力間的支出分配、AI 系統影響的研究決策,以及內部代理事件。作者也建議進行獨立稽核,並對具備前沿 AI 研發能力的系統提出更嚴格要求。
部分後續建議,包括進一步部署前的要求、暫停特定研發工作負載的方式及國際查證,都需要大量設計並涉及取捨。論文也警告,設計不良的權力可能偏袒單一公司並延後有益工作。論文對潛在效益和重大危害的討論,建立在前述有條件的加速情境上。政策制定者可以先檢視近期的資訊揭露方案,不必先假設最極端情境已經發生。
讀完這份報告後,更值得追問的不是 AI 是否會突然變得超級智慧,而是各實驗室能否以可比較的方式說明:目前哪些研究環節由 AI 主導、哪些改進通過人工評估後仍然成立,以及這些改進多快能回饋到下一代系統。現有公開證據尚不足以跨公司回答這些問題。
## 來源與延伸閱讀
- [劍橋 AI 科學與政策計畫:完整工作論文(2026 年 9 月)](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf):作者的論點、證據綜述、模型假設、局限和政策建議。本文標注為工作論文;其公開資料無法證明經過外部同行評審。
- [CASP 執行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf):對作者所設定的條件性情景及建議應對措施的簡短說明,由部分作者撰寫。
- [Anthropic:衡量前沿實驗室內 AI 主導研發的進展](https://www.anthropic.com/institute/measuring-pace-of-ai-development):26% 的 AI“主導”數據、其中包含的監督程度,以及方法上的局限的一手來源。
- [OpenAI:OpenAI 內部的研究加速情況](https://openai.com/index/research-acceleration-view-inside-openai/):公司報告的智能體使用、實驗數量、人工指導情況,以及衡量研究進展時應注意的限制。
- [METR:Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/):關於獨立任務時長評測,以及基準測試時長估算方式存在不確定性的研究。
- [Whitfill 與 Wu:算力瓶頸會阻止智慧爆炸嗎?](https://arxiv.org/abs/2507.23181),以及[Ord:智慧爆炸的動態](https://arxiv.org/abs/2608.14426):兩項獨立分析,探討可能減緩或改變遞歸研究循環的條件。
## Sources
- [CASP:自動化 AI 研發會引發智慧爆炸嗎?](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf) — 《前沿 AI 工作論文系列》第 2 期(2026 年),共 14 頁。一手來源。建議通讀。討論機制、證據不一致之處、假設和政策建議。
- [CASP 執行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf) — 由部分作者撰寫的兩頁摘要。已與完整論文核對。
- [Anthropic:衡量前沿實驗室內 AI 主導研發的進展](https://www.anthropic.com/institute/measuring-pace-of-ai-development) — 公司關於 AI 主導 26%、完全自主工作為零及方法局限的一手測量。
- [OpenAI:研究加速:OpenAI 內部視角](https://openai.com/index/research-acceleration-view-inside-openai/) — 公司關於智能體使用和研究活動的一手指標;區分相關性與模型整體進步。
- [METR:Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/) — 獨立的任務時長評測,說明其中的不確定性和任務組成方面的局限。
- [METR:衡量 2025 年初 AI 對資深開源開發者生產力的影響](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf) — 針對不同軟件工作場景開展的隨機研究;是提醒人們不要把工具采用直接等同於生產力提升的有限反例。
- [Whitfill 與 Wu:算力瓶頸能否阻止智能爆炸?](https://arxiv.org/abs/2507.23181) — 基於模型的分析,對算力與勞動是否可以相互替代得出了不同估計,並明確說明了數據局限。
- [Toby Ord:智能爆炸的動態機制](https://arxiv.org/abs/2608.14426) — 關於反饋循環每代所需時間的理論分析,並非經驗預測。
BIG CHANGE 電子報
掌握全貌,按照自己的步調。
關於人工智慧和機器人技術的近期報導、值得關注的轉變,以及可運用的實用想法。選擇每日快訊、每週摘要或每月觀點。
於貝爾格勒時間 09:00 寄送:每日、每週一或每月第一天。確認後,您的第一期將於下一個排定的寄送時間送達。