一项于 9 月 10 日发布在 arXiv、并于 9 月 22 日修订的调查论文提出了 AI 参与改进 AI 系统的五个层级。论文标题《人类构建的最后一个 AI》描述的是一种愿景,而非作者报告的已发生事件。论文证据仅涉及系统修改自身开发流程中的部分环节这类有限案例,并未证明某个系统能够一代又一代可靠地产生更优的后继系统。

解读自动化 AI 研究的相关主张时,这一区别很重要。智能体可以运行实验、保存经验并提高基准分数,同时仍由人来设定目标、控制测试,并决定保留哪些改动。更强的主张还需要证明:系统改进了方法,也就是生成下一版本所采用的流程,而且修订后的流程在公平比较中表现更好。

重大变化

  • 变化内容:研究人员现在有了更精确的方式来描述系统控制 AI 改进闭环的程度,从执行指定更新,到修订用于后续更新的流程。新调查对现有研究进行了归纳,并未宣布一种已经完成的自主后继系统构建器。
  • 为何重要:AI 实验室可以自动运行更多实验,但这并不能证明每个新智能体都更擅长构建下一个智能体。这一区别会影响研究人员如何解读性能主张,以及在哪些环节保留人工审核和独立测试。
  • 关注事项:决定性证据应是一系列后继系统:它们沿用经修订的改进方法,在受保护任务上接受测试,并与旧方法在可比资源条件下进行对照。调查涵盖的研究尚未据此证明统计上可靠的累积进步。

五个层级描述对改进闭环的控制

论文首先区分单任务修订(称为 B0)与持续改进。模型反复修改一个答案,直到通过检查,只能算是改进了该答案。除非这项变化能延续到之后相互独立的任务中,否则系统自身并未获得持久更新。

在第 1 级,人们选择目标和成功测试,AI 执行更新,例如应用由人定义的数据质量规则。在第 2 级,AI 还会为指定目标选择策略,例如诊断编程智能体的失败原因,并提出工具改动。目标和验收测试仍由系统之外的人设定。

在第 3 级,系统会协助选择下一步所需的经验,例如针对自己发现的弱点设计练习任务。第 4 级则加入持续使用所带来的反馈:系统遇到新情况后,将经批准的改动保留在记忆、规则或组件中。论文指出,这两个层级都取决于反馈质量,以及决定哪些改动能够保留的规则。

第 5 级体现了这项调查的核心概念。AI 会修订指导后续改进的流程,例如自身的搜索策略、评估器,或负责提出后继系统的智能体。修订后的流程必须被保留,并用于下一轮改进。即便到了这一层,论文仍指出,人可以继续控制总体目标、受保护的验收测试和资源。层级描述的是委托了多少职责,并不保证取得进展,也不代表不受限制的自主性。

现有系统展示了能力边界

这项Darwin Gödel Machine 研究报告称,其编程智能体在该研究所用的 SWE-bench 子集上的成绩从 20% 提升至 50%;过程中,多个变体修改了智能体代码,成功的变体会进入档案库。作者也指出,档案库维护方式和选择哪个变体作为父版本的规则是固定的。调查用这一研究说明:后继版本变得更好,并不能证明挑选后继版本的流程已能自我改进。

A-Evolve-Training提供了一个范围更窄的第 5 级示例。研究人员对一个拥有 300 亿参数的模型进行了四轮后训练。元智能体汇总结果,并在内部开发分数不再反映外部排行榜表现后,修改了指导后续工作者的研究策略。研究报告的最终分数为 0.86,当时排名最高的人类提交成绩为 0.87。继承下来的策略改变了后续实验的选择方式;工作者所用的底层系统和竞赛目标仍保持不变。这表明,在一个明确界定的项目内,修订后的研究流程可以投入使用,但不代表模型开发的所有环节都已实现自主控制。

这项HyperAgents 研究测试改进后的智能体构建流程能否迁移至新领域。在数学评分任务上迭代 200 次后,从已迁移的改进方案开始的一轮测试集得分为 0.640,而从初始智能体开始的一轮得分为 0.610。作者报告称,这一差异没有达到统计显著性。结果支持继续研究迁移能力,但无法证明不同运行之间会可靠地累积进步。

活动更多不等于改进效果更好

调查将修订后的流程被重复使用称为结构递归,并将其与有效递归区分开来:后者要求修订后的流程能在可比资源和独立评估下生成更强的后继系统。戏剧性的论文标题容易让读者以为第二种情况已经发生,但这正是仍需检验的关键问题。

系统可能通过多种方式制造进步假象:它可能投入更多算力进行搜索;可能对反复查询过的基准测试集过拟合;也可能保留有助于某一任务、却会损害另一任务的改动。如果系统还修改了自身的评估器,分数提高也可能只是换了一把尺子。因此,论文建议记录具体修改内容,证明修订后的组件确实指导了下一轮,对照新旧组件在匹配资源条件下的表现,并在独立任务上测试改动能否保留和迁移。

作者明确指出,当前结果支持在有限范围内改进改进器、评估器和研究策略;但“在可比资源条件下,实现跨代的统计可靠累积进步仍是开放问题”。“人类构建的最后一个 AI”描述了这一框架所追求的目标。调查提供了评估朝该目标推进程度的标准。

来源与延伸阅读

  • Duan 等人,《人类构建的最后一个 AI》,第 3 版(2026 年 9 月 22 日)。这篇主要调查论文定义了 B0 和第 1 至第 5 级,区分结构递归与有效递归,并说明现有证据的局限。分类体系和解读属于作者提出的框架,并非新系统演示。
  • Zhang 等人,Darwin Gödel Machine(第 3 版,2026 年 3 月 12 日)。原始研究报告了编程基准测试的提升,并说明档案库维护和父版本选择规则仍然固定。
  • Shi 等人,A-Evolve-Training(第 3 版,2026 年 9 月 8 日)。原始预印本介绍了四轮后训练、研究策略修订和所报告的排行榜成绩。其目标和底层工作者系统仍由外部设定。
  • Zhang 等人,HyperAgents(2026 年)。原始研究检验智能体构建流程的迁移能力,并报告称,本文引用的 200 次迭代比较不具统计显著性。
  • Manuel Muñoz Plá 的深入解读(2026 年 9 月 18 日)审视了调查中的高阶层级案例和证据局限。该文分析的是论文较早版本;上文依据第 3 版和所引用的原始研究陈述事实。
  • 《南华早报》的报道(2026 年 9 月 14 日)介绍了调查提出的五阶段路线图和 AI 研究背景。这是二手报道,并非研究结果的证据。
  • The Rundown AI 的解读(2026 年 9 月 16 日)概述了各层级,并将论文置于自动化 AI 研究的讨论背景中。这是二手报道;上文的事实主张以论文和原始研究为依据。