Anthropic 表示,Claude 目前主導公司所衡量 AI 研發工作的 26%。這表示在有人監督的情況下,系統可依較高層次的提示完成大部分任務。Anthropic 也表示,沒有任何受測研發工作是由 Claude 完全自主完成。這項區別很重要;劍橋 AI 科學與政策計畫的一篇新工作論文探討 AI 若承擔更多自身研發工作,是否終將使 AI 發展大幅加速。
這篇標示日期為 2026 年 9 月的論文匯集 22 位來自大學、AI 公司和公民社會的作者。論文指出,一種快速回饋循環是可能的:有能力的系統協助打造更好的系統,後者再執行更多研究。核心結論是提醒一條合理可能的發展路徑,並指出有必要測量其進展。論文沒有聲稱這種加速已經開始。
主要變化
- 發生了什麼變化:一篇跨機構工作論文整理 AI 主導研發的證據、可能加快 AI 進展的條件,以及作者建議政府向前沿實驗室取得的特定測量資料。
- 為何重要:開發 AI 系統的公司正把更多研究任務交由 AI 執行,但公開的委派程度指標仍不完整,因此難以判斷整體研究流程究竟加快多少。
- 接下來關注什麼:值得關注的是經獨立核查的指標:AI 完成多少工作、其貢獻是否改進後續模型,以及算力、實驗和人工審查是否會減慢回饋循環。
證據確實存在,但各項指標回答的問題不同
Anthropic 9 月發布的測量報告表示,到 2026 年 8 月,其研發工作中由 AI「主導」的比例已達 26%,高於 2 月的不到 1%。不過,其評等類別仍包括人工監督。Anthropic 表示,這項指標仍是原型、自家模型也協助評等工作,而且各公司間沒有共通的比較方法。該公司也稱,沒有任何受測工作完全自主完成;這點應與 26% 數字一併看待。
OpenAI 9 月發布的說明描述研究人員使用更多程式設計代理、更快貢獻程式碼並進行更多實驗。OpenAI 表示,實驗數量與代理使用量增加相關,而可用算力也同步成長。公司稱研究優先順序仍由人選擇,並由人決定後續追查哪些結果。更多程式碼和實驗可能有助研究,但不能證明更高能力模型的產出速度也等幅增加。
獨立評測有助於衡量其中一個環節。METR 的 Time Horizon 1.1 更新發現,在其測試套件中,模型能完成比早期系統更長的研究與軟體任務。METR 也指出,長時間任務的結果存在很大不確定性,其中許多人類完成時間是估算值。任務基準測試衡量模型在特定任務上的能力,並不衡量 AI 實驗室整體研究生產力。另一項隨機研究則由 16 位資深開源開發者完成 246 項任務,METR 發現,使用 2025 年初的 AI 工具後,任務完成時間增加 19%。那個較早期的軟件場景不能代表 2026 年 9 月的前沿實驗室,但它說明,僅憑工具使用情況和任務基準測試,無法得出生產力是否提高的結論。
可能的回饋循環受到多重因素制約
CASP 論文聚焦於軟體驅動的循環:AI 系統透過平行工作擴大有效研究人力;成功改進使下一代系統成為更好的研究者,進而帶來更多改進。作者表示,初步證據與此機制一致,並認為未來幾年研發自動化大幅增加的可能性不低。更強烈的「智慧爆炸」情境——把數年進展壓縮到幾個月甚至更短——則取決於循環是否快過其限制。這是有條件的情境,不是對未來結果的實測預測。
論文列出四項重要限制:額外研究投入的邊際效益遞減、算力與資料有限、仍難以自動化的任務,以及無法任意加速的流程,例如長時間訓練。論文指出,部分限制的證據相互矛盾或屬間接資料,對耗時瓶頸影響程度也缺乏直接證據。論文舉例,在研發完全自動化後,若研究投入的估計效益持續且沒有新瓶頸出現,模型計算顯示進展速度可能在約 1.5 年內加快十倍。這不是已觀察到的加速,也不是無條件的時間預測。
其他研究進一步凸顯這些不確定性。在一項2025 年對四家 AI 實驗室的研究中,Parker Whitfill 和 Cheryl Wu 發現,研究算力的建模方式不同,結論也不同。在一種設定下,認知勞動和算力似乎可以互相替代;納入前沿實驗資源需求上升的模型,則顯示兩者可能互補。作者提醒,資料和模型均有限。Toby Ord 於 2026 年 8 月發表的分析將每輪改進所需時間列為另一項關鍵參數。這些分析並未排除快速加速,但顯示不能只看代理數量或其撰寫的程式碼量,就直接推斷回饋循環的速度。
作者希望測量什麼
劍橋論文作者提出三項政策優先事項:掌握 AI 研發自動化的情況、制定引導和限制可能加速的方式,並為潛在影響預作準備。其中最即時且可檢驗的是測量。作者建議公布 AI 產出的研究貢獻比例、演算法改進速度、實驗室在人力與算力間的支出分配、AI 系統影響的研究決策,以及內部代理事件。作者也建議進行獨立稽核,並對具備前沿 AI 研發能力的系統提出更嚴格要求。
部分後續建議,包括進一步部署前的要求、暫停特定研發工作負載的方式及國際查證,都需要大量設計並涉及取捨。論文也警告,設計不良的權力可能偏袒單一公司並延後有益工作。論文對潛在效益和重大危害的討論,建立在前述有條件的加速情境上。政策制定者可以先檢視近期的資訊揭露方案,不必先假設最極端情境已經發生。
讀完這份報告後,更值得追問的不是 AI 是否會突然變得超級智慧,而是各實驗室能否以可比較的方式說明:目前哪些研究環節由 AI 主導、哪些改進通過人工評估後仍然成立,以及這些改進多快能回饋到下一代系統。現有公開證據尚不足以跨公司回答這些問題。
來源與延伸閱讀
- 劍橋 AI 科學與政策計畫:完整工作論文(2026 年 9 月):作者的論點、證據綜述、模型假設、局限和政策建議。本文標注為工作論文;其公開資料無法證明經過外部同行評審。
- CASP 執行摘要:對作者所設定的條件性情景及建議應對措施的簡短說明,由部分作者撰寫。
- Anthropic:衡量前沿實驗室內 AI 主導研發的進展:26% 的 AI“主導”數據、其中包含的監督程度,以及方法上的局限的一手來源。
- OpenAI:OpenAI 內部的研究加速情況:公司報告的智能體使用、實驗數量、人工指導情況,以及衡量研究進展時應注意的限制。
- METR:Time Horizon 1.1:關於獨立任務時長評測,以及基準測試時長估算方式存在不確定性的研究。
- Whitfill 與 Wu:算力瓶頸會阻止智慧爆炸嗎?,以及Ord:智慧爆炸的動態:兩項獨立分析,探討可能減緩或改變遞歸研究循環的條件。



