世界从未停止变化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# 剑桥报告探讨 AI 主导研究能否加速 AI 进步

> 剑桥一篇工作论文探讨 AI 主导的研究能否加快 AI 进步。Anthropic 提出的 26% 数据显示的是有人监督的工作,而所设想的反馈循环仍有条件限制。

By BIG CHANGE Editorial

Published: 2026-09-28T23:34:31.964Z
Updated: 2026-09-28T23:34:31.964Z
Canonical: https://bigchange.ai/blog/casp-report-ai-automating-ai-research

![Conceptual charcoal illustration, seen from above, of one researcher comparing two sheets at a workbench while a desktop monitor faces away.](https://bigchange.ai/api/media/file/casp-research-review-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

Anthropic 表示,Claude 目前主导了该公司所衡量的 AI 研发工作中的 26%。这意味着,在有人监督的情况下,系统可以根据高层级提示完成一项任务的大部分工作。Anthropic 还称,没有任何被测研发工作完全由 Claude 自主完成。这一区别很重要;剑桥 AI 科学与政策项目的一篇新[工作论文](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf)提出的问题是:AI 是否会逐步承担更多自身研发工作,并最终使 AI 进步大幅加速。

这篇标注为 2026 年 9 月的论文,汇集了来自大学、AI 公司和公民社会组织的 22 位作者。论文认为,一种快速反馈循环是可能的:能力强的系统帮助研发更好的系统,后者再开展更多研究。论文的核心结论是,对一种合理的发展路径发出警示,并指出有必要对其进行测量。论文并未报告这种加速已经开始。

## 主要变化

- **发生了什么变化:**一篇跨机构工作论文梳理了 AI 主导研发的证据、这种方式可能加速 AI 进步的条件,以及作者建议政府向前沿实验室索取的具体测量数据。
- **为何重要:**开发这些系统的公司正在把更多研究任务交给 AI 系统。公开的委派程度指标仍不完整,因此很难判断整个研究流程的速度究竟提高了多少。
- **接下来关注什么:**经独立核查的指标,包括 AI 完成了多少工作、其贡献是否改进了后续模型,以及算力、实验和人工审查是否会减缓反馈循环。

## 证据确实存在,但这些指标回答的问题各不相同

[Anthropic 9 月发布的测量报告](https://www.anthropic.com/institute/measuring-pace-of-ai-development)称,到 2026 年 8 月,其研发工作中由 AI“主导”的比例已升至 26%,高于 2 月的不到 1%。但在其评级体系中,这一类别仍包含人工监督。Anthropic 称,这一指数仍是原型,其自有模型也参与了工作评级,而且各公司之间没有通用方法可供比较。该公司表示,没有被测工作完全自主完成;这一点应与 26% 的数据一并看待。

[OpenAI 9 月发布的说明](https://openai.com/index/research-acceleration-view-inside-openai/)介绍了研究人员使用更多编程智能体、更快贡献代码并开展更多实验的情况。OpenAI 称,实验数量与智能体使用增加相关,同时可用算力也有所增长。公司还称,研究优先事项由人来选择,哪些结果值得继续探索也由人决定。更多代码和实验可能有助于研究,但这不能证明更强大模型的产出速度也以同等幅度提高。

独立评测有助于衡量这一流程中的一个部分。[METR 的 Time Horizon 1.1 更新](https://metr.org/blog/2026-1-29-time-horizon-1-1/)发现,在其测试套件中,模型能够完成比早期系统耗时更长的研究和软件任务。METR 也报告称,对于耗时较长的任务,结果存在很大的不确定性;其中许多任务的人类完成时间是估算出来的。任务基准测试衡量模型在所选任务上的能力,并不衡量 AI 实验室整体的研究生产力。在另一项随机对照研究中,16 名经验丰富的开源开发者完成了 246 项任务,[METR 发现,使用 2025 年初期 AI 工具后,任务完成时间增加了 19%](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf)。那个较早期的软件场景不能代表 2026 年 9 月的前沿实验室,但它说明,仅凭工具使用情况和任务基准测试,无法得出生产力是否提高的结论。

## 快速反馈循环可能受到多重制约

CASP 论文重点讨论一条由软件驱动的循环路径:AI 系统通过并行工作扩大有效研究队伍;成功的改进让下一代系统成为更好的研究者,从而带来更多改进。作者称,初步证据与这一机制相符,并判断未来几年研发自动化程度大幅提高的可能性很高。作者提出的更强烈情形——“智能爆炸”,即把多年的进展压缩到几个月甚至更短时间——则取决于反馈循环是否会快于各种限制。这是一种有条件的情景,并非对未来结果的实测预测。

论文指出了四项重要限制:增加研究投入带来的回报递减、算力和数据有限、仍难以自动化的任务,以及无法随意加速的流程,例如长时间训练。论文称,关于其中一些限制的证据并不一致或属于间接证据,而耗时瓶颈究竟有多强,目前缺少直接证据。论文举例称,在研发完全自动化后,若研究投入的估计回报持续存在且没有出现新的瓶颈,那么模型计算显示,进步速度可能在约 1.5 年内加快十倍。这并非观察到的加速,也不是无条件的时间预测。

其他研究进一步揭示了不确定性。在一项[2025 年对四家 AI 实验室的研究](https://arxiv.org/abs/2507.23181)中,Parker Whitfill 和 Cheryl Wu 发现,根据如何建模研究算力,结论会有所不同。在一种设定中,认知劳动和算力似乎可以相互替代;而在另一种纳入前沿实验不断提高资源需求的模型中,两者似乎相辅相成。作者提醒,数据和模型都有限。[Toby Ord 于 2026 年 8 月发表的分析](https://arxiv.org/abs/2608.14426)将每轮改进所需时间视为另一个关键参数。这些分析并未排除快速加速的可能性,但说明无法单凭智能体数量或其编写代码的数量,直接推断反馈循环的速度。

## 作者希望测量什么

剑桥论文作者提出了三项政策重点:了解 AI 研发自动化的情况,制定引导和约束潜在加速的方法,并为其可能造成的影响做好准备。其中最紧迫且可检验的是测量。作者建议报告 AI 产出的研究贡献比例、算法改进速度、实验室在人力和算力方面的支出分配、AI 系统影响了哪些研究决策,以及内部智能体相关事件。作者还提议开展独立审计,并对具备前沿 AI 研发能力的系统提出更严格要求。

一些后续建议,包括进一步部署前的要求、暂停指定研发工作负载的方法,以及国际核查机制,都需要大量设计工作并涉及取舍。论文自身也警告,设计不当的权力可能偏袒某家公司,并拖延有益工作。论文对潜在收益和严重危害的讨论,建立在前述有条件的加速情景之上。政策制定者可以先审视短期报告要求,而无需假定最极端的情景已经发生。

读完这份报告后,更有用的问题比“AI 是否会突然变得超级智能”更具体:各实验室能否用可比较的方式说明,目前哪些研究环节由 AI 主导、哪些改进经人工评估后仍然成立,以及这些改进多快能反馈到下一代系统中。现有公开证据还不足以跨公司回答这些问题。

## 来源与延伸阅读

- [剑桥 AI 科学与政策项目:完整工作论文(2026 年 9 月)](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf):作者的论点、证据综述、模型假设、局限和政策建议。本文标注为工作论文;其公开资料无法证明经过外部同行评审。
- [CASP 执行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf):对作者所设定的条件性情景及建议应对措施的简短说明,由部分作者撰写。
- [Anthropic:衡量前沿实验室内 AI 主导研发的进展](https://www.anthropic.com/institute/measuring-pace-of-ai-development):26% 的 AI“主导”数据、其中包含的监督程度,以及方法上的局限的一手来源。
- [OpenAI:OpenAI 内部的研究加速情况](https://openai.com/index/research-acceleration-view-inside-openai/):公司报告的智能体使用、实验数量、人工指导情况,以及衡量研究进展时应注意的限制。
- [METR:Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/):关于独立任务时长评测,以及基准测试时长估算方式存在不确定性的研究。
- [Whitfill 与 Wu:算力瓶颈能否阻止智能爆炸?](https://arxiv.org/abs/2507.23181),以及[Ord:智能爆炸的动态机制](https://arxiv.org/abs/2608.14426):两项独立分析,探讨可能减缓或改变递归研究循环的条件。

## Sources

- [CASP:自动化 AI 研发会引发智能爆炸吗?](https://casp.ac/__l5e/assets-v1/5efd4b41-deb5-4513-a0a3-b4f82d2b79ea/intelligence-explosion.pdf) — 《前沿 AI 工作论文系列》第 2 期(2026 年),共 14 页。一手来源。建议通读。讨论机制、证据不一致之处、假设和政策建议。
- [CASP 执行摘要](https://casp.ac/__l5e/assets-v1/026ee81c-773c-4811-9c97-f7cf367ee7b0/intelligence-explosion-summary.pdf) — 由部分作者撰写的两页摘要。已与完整论文核对。
- [Anthropic:衡量前沿实验室内 AI 主导研发的进展](https://www.anthropic.com/institute/measuring-pace-of-ai-development) — 公司关于 AI 主导 26%、完全自主工作为零及方法局限的一手测量。
- [OpenAI:研究加速:OpenAI 内部视角](https://openai.com/index/research-acceleration-view-inside-openai/) — 公司关于智能体使用和研究活动的一手指标;区分相关性与模型整体进步。
- [METR:Time Horizon 1.1](https://metr.org/blog/2026-1-29-time-horizon-1-1/) — 独立的任务时长评测,说明其中的不确定性和任务组成方面的局限。
- [METR:衡量 2025 年初 AI 对资深开源开发者生产力的影响](https://metr.org/Early_2025_AI_Experienced_OS_Devs_Study-paper.pdf) — 针对不同软件工作场景开展的随机研究;是提醒人们不要把工具采用直接等同于生产力提升的有限反例。
- [Whitfill 与 Wu:算力瓶颈能否阻止智能爆炸?](https://arxiv.org/abs/2507.23181) — 基于模型的分析,对算力与劳动是否可以相互替代得出了不同估计,并明确说明了数据局限。
- [Toby Ord:智能爆炸的动态机制](https://arxiv.org/abs/2608.14426) — 关于反馈循环每代所需时间的理论分析,并非经验预测。
BIG CHANGE 新闻通讯

纵览全局,按自己的节奏。

关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。