5 月,一个关于平面上点的问题意外地有了新答案。到 9 月,AI 实验室开始发表有关流体奇点的论证,并提供旨在让计算机检查证明的文件。在这些公告之间,还出现了新的反例、更强的界以及费马大定理的形式化工作。

评价 AI 数学的变化,不能只看有多少猜想被推翻。这些结果回答不同问题,所依据的证据不同,留下的后续工作也不同。一个反例可以推翻原有判断,却不一定找到最优答案;界得到改进可能很重要,但旁边那个著名猜想仍可能悬而未决;计算机检查过的证明可以确立某个命题,却未必说明其中的思想在其他地方有何用途。

本文梳理从 OpenAI 5 月 20 日公布的单位距离结果到 9 月纳维–斯托克斯主张之间的重要进展,资料截至 2026 年 9 月 22 日。文中也包括期间发布的公告和由此开展的研究。本文呈现的是这一系列进展的脉络,并非所有 AI 辅助数学论文的完整清单。我们读过所引用的公告、相关定理表述、研究简介和验证文档,但没有独立审查这些证明,也没有重新构建其形式化文件。

我们的核心判断是,最有力的进展证据有两方面:机器正在产出值得认真审查的数学论证;人们也已经从其中一些论证中发展出更多数学成果。能否形成持续进步,取决于投入多少资源来核查、解释并延伸这些工作。

5 月:一个反例为几何问题开辟新路径

单位距离问题很容易想象:在一个平面上放置若干点,计算彼此距离恰好为一个单位的点对。随着点数增加,这样的点对最多能有多少?

OpenAI 在 5 月 20 日的公告中称,一个内部通用推理模型在一组 Erdős 问题上的评估中给出了新的构造。公司还另外发布了一篇由外部数学家撰写的配套论文,介绍他们对论证的研究。第二份文档的存在很重要:读者可以查阅数学家理解和重建了什么,而不只看到实验室对模型的介绍。OpenAI 的公告。

原始论文构造了无穷多个点集,使单位距离点对至少达到 n^(1+δ),其中 δ 是固定的正数。简单来说,随着点集变大,指数上的提升仍然存在。这推翻了人们猜测的近线性增长。它并未确定每种点数下单位距离的精确最大值;寻找最优界限的更广泛研究仍在继续。单位距离论文。

令人意外的是这个构造的来源。配套论文将几何结果与高深的代数数论联系起来,并指出先前数学成果所提供的要素。论文作者给出了更简化、并在一定程度上更一般化的重建。这是 AI 发现之后人类工作的一个有益例子:找出机制、揭示其依赖关系,并将论证整理成其他研究者能够处理的形式。数学家的配套论文。

因此,想了解 5 月结果的意义,后续论文和最初公告同样值得关注。一种新方法在研究者用它提出并回答更多问题时,会获得另一种可信度。

5 月至 7 月:这些思想开始传播

5 月 27 日,Thomas Bloom、Will Sawin、Carl Schildkraut 和 Dmitrii Zhelezov 发布了一个实数域上和积猜想的反例。粗略地说,这个问题关注一个集合的元素相加或相乘后,集合会扩大多少。他们的构造使两个结果集都能小于猜想所预期的近二次规模。作者明确表示,单位距离反例促使他们重新考虑高次数数域;他们还说明,最终构造所需的数论工具少于早期结果。和积论文。

这是 AI 起源的结果激发人类原创数学研究的一个具体实例。这并不意味着后续论文是由 AI 撰写的;我们也不应把作者的工作并入某个实验室的成果数量,从而抹去他们的贡献。

Cosmin Pohoata 的预印本于 6 月 11 日首次提交,并于 6 月 28 日修订,将这一系列研究延伸到 Elekes–Ró nyai 问题。论文给出一个多项式例子,在适当的集合上,其取值扩张小于预期,并使用近期单位距离与和积构造中的方法。论文明确说明了这些问题之间的联系。Pohoata 的论文。

7 月 6 日,Sungchul Lee、Pohoata 和 Daniel Zhu 发布了关于 Minkowski 网格的后续结果。他们的构造在子集中保留重复距离性质,并对重复距离和等腰三角形问题产生影响。与只展示一个特别丰富的构形、却不探究其内部行为相比,这种结构性质更强。Minkowski 网格论文。

乐观的解读在这里有证据支撑:5 月的结果在几周内就为其他研究者提供了可修改、可复用的材料。我们提出的成功指标,是产生此类可用方法,以及理解它们所需的工作量。只统计解决了多少问题,会遗漏这一区别。

7 月:雅可比猜想反例说明为何范围很重要

另一个引人注目的事件围绕雅可比猜想展开。Terence Tao 于 7 月 21 日发表的讲解,分析了使用 Fable AI 产生的一个反例:一个三复变量多项式映射,在小邻域内表现为可逆,但总体上会把不同点映射到同一输出。该猜想的一般性主张在三维及以上失效;二维情形仍未解决。Tao 给出了明确公式,并解释其构造的几何性质。Tao 的数学讲解。

明确的反例可以使其关键矛盾较易通过计算理解。但要发现为什么应当存在这样的例子,以及如何构造相关反例,则需要进一步数学工作。雅可比事件让读者能在已发表材料中看到这两种不同工作。

这一区别在 9 月仍然重要。Arno van den Essen 于 9 月 15 日发布的预印本,提出了一个初等方法,构造出经线性坐标变换后与 Levent Alpöge 所发现例子等价的反例。这是对构造的新解释,并非第二次独立推翻原猜想。van den Essen 的论文。

对研究管理者而言,这提示我们应调整奖励重点。资助让复杂发现变得易于理解的人,可能和资助另一轮追逐头条成果的搜索一样,能释放后续研究潜力。这是我们对这一系列事件的判断,并不表示大学已经改变了激励机制。

8 月:范围更广的一系列数学主张

OpenAI 于 8 月 1 日发布了涵盖数学和理论计算机科学的十组结果。公司称,这些论证由内部版本的 Astra 生成;人类协同模型准备论文,模型则生成 Lean 证明证书。这与 5 月只公布一项结果的生产过程不同,也明确说明了论文准备方面的贡献。8 月公告。

配套成果集于 8 月 6 日更新,报告了以下内容。以下是论文主张的简介,并非 BIG CHANGE 分别对十项成果作出的认证:

  • 球体堆积:高维情形下更尖锐的渐近上界。
  • 二元码与球面码:针对特定间距的码大小,给出更强的限制。
  • 群论:构造一个非 sofic 群。
  • 算子代数:给出 Connes 刚性猜想的反例。
  • 算术复杂性:对矩阵永久式(permanent)给出更强的电路与公式下界。
  • 量子博弈:一个指数级的平行重复定理。
  • 格问题:针对最近向量问题,给出更强的近似困难性结果。
  • 凸几何:证明 Ehrhart 体积猜想。
  • Ramsey 理论:给出多色三角形 Ramsey 数的超指数下界。
  • 极值图论:构造紧致性和退化性猜想的反例。

十项成果研究汇编。

成果的广度很重要,但也因此不能简单加总成一个数字。找到反例、改进界限和证明一般性定理,带来的影响各不相同。数学问题难解,并不自动意味着已证明对实际部署的密码系统发动了攻击。应用需要各自独立的推理和证据链。

8 月 10 日,Anthropic 发布了一项与黎曼猜想相关、范围更明确的进展。公司称,一个未发布的 Claude 模型改进了临界线上 ζ 函数零点比例的下界。Anthropic 的数学家审查了工作,外部专家审阅了论文,并完成了形式化。公司明确表示 Claude 并未解决黎曼猜想,也不认为这些技术能够解决该猜想。Anthropic 的说明。

所链接的论文给出的界略高于三分之二,约为 67.25%,并指出所使用的先前解析结果。这是一项渐近数学陈述,并不是声称检查了大量有限零点样本就证明了猜想。区别至关重要:比例下界并不意味着每个相关零点都位于临界线上。ζ 函数零点论文。

其他雄心勃勃的论文也在流传。Alpöge 网站托管的一份文档提出了六维球面上的复结构。其构造可供审查,但我们访问到的版本无法确立可靠的公告日期,也未完整说明 AI 的贡献。因此,我们把它作为一项供读者进一步研究的提案纳入,而不将其列为本时间线中独立确立的里程碑。六维球面论文。

9 月初:质数间隙暴露验证边界

一系列公告还涉及质数之间的间隙。Axiom 合作项目于 9 月 3 日发布的初步论文称,有无穷多对相邻质数的间距不超过 212。论文将成果归功于 Julia Stadlmann 的解析工作和此前的 Polymath 项目。Lean 证明证书还把解析估计和一份另行核查的变分证书作为假设。这推进了有界间隙问题;孪生素数猜想要求存在无穷多对间距恰好为 2 的质数。Axiom 团队的论文。

OpenAI 公开的 PrimeGaps186 代码库给出了更小的界限,但有一项关键限定。其 Lean 开发依赖三个输入公理,分别涵盖文献中的两项估计和数值积分界。代码库指出,数值证书并未证明这些公理。读者应区分拟议的数学论证,与在指定输入下经过形式化检查的部分。若将这一材料描述为从基础公理出发、无条件且完全形式化的证明,就不准确。PrimeGaps186 代码库。

OpenAI 的另一篇论文研究长间隙:相邻质数之间的区间最多可以有多大。论文报告,随着阈值增长,低于该阈值的最大间隙下界得到了改进。这与寻找无穷多对相距较近的质数,是两个不同的极值问题;不能将一个问题上的进展算作解决了另一个问题。长质数间隙论文。

这些细节使质数间隙事件尤其值得参考。新闻标题中的两个数字看起来可能像一场简单竞赛。一旦证明所依赖的前提变得清晰,更好的问题是:哪些步骤由哪些方法确立?即便形式化尚未完成,明确列出假设仍然很有价值。

9 月 4 日:形式化成为发现故事的一部分

Anthropic 于 9 月 4 日发布的公告涉及一项数学证明早已为人所知的定理:费马大定理。公司所称的成就是,Claude 在 11 天内主要自主地完成了完整的 Lean 形式化。公司介绍了人类指导,以及帮助智能体追踪依赖关系的协作平台,并肯定了这项工作所依据的数学证明传统。形式化公告。

公开代码库提供了比标题更具体的证据。它列出了定理、记录依赖关系,并记载了针对 Lean 标准公理和 Mathlib 定理表述的检查。代码库也说明该发布内容属于未维护的研究成果。我们检查了这些文档,但没有重新运行构建。费马大定理代码库。

如果用于生成更多候选论证的工具也能帮助将其形式化,核验能力同样可能扩大。这是一个令人充分乐观的理由。后续研究者获得了可供检查的具体材料,但仍需了解中间结果是否易于复用、依赖关系能否继续构建,以及由谁维护这些成果。生成代码的数量本身无法回答这些问题。

这里还存在一个有意义的机构选择:实验室可以将证明作为模型能力的最终演示发布,也可以支持它成为供他人继续使用的基础设施。这两种方式在发布之后会产生不同义务。维护工作、解释性示例和稳定引用,都应列入研究预算。

9 月 8 日:纳维–斯托克斯结果究竟声称了什么

流体问题让这些疑问更加突出。OpenAI 于 9 月 8 日发布、并于 9 月 10 日更新的公告,介绍了一项针对纳维–斯托克斯方程存在性与光滑性问题的拟议解答。公司称,工作由一个内部模型通过协同智能体完成,并发布了书面论证和 Lean 形式化。OpenAI 表示无意申请千禧年大奖。公告。

该论文研究的是具有正黏性、受到精心构造的外力作用下的三维不可压流体运动。从静止状态出发,拟议解会在有限时间内发展出无界速度,同时总能量保持有界。外力是光滑的,并被限制在特定的空间和时间范围内。其数学构造使用了塌缩涡旋及一系列修正,使剩余外力保持光滑。这些是关于方程解的主张,并非物理实验观察或新工程仿真器的结果。纳维–斯托克斯论文。

外力是理解其适用范围的关键。Charles Fefferman 的 Clay 官方问题说明允许在 C 和 D 两种破裂情形中加入光滑外力;A 和 B 两种全局光滑性情形讨论的是无外力方程。因此,一项属于拟议类型的有效结果,可以回应 Clay 明确允许的一种情形,同时仍未解决无外力的全局正则性问题。称外力无关紧要会夸大定理的结果;称它超出题目范围,则会误述规则。官方问题说明。

OpenAI 还发布了一篇单独的 Euler 方程论证,研究的是没有黏性的理想化流体。论文提出,从光滑初始数据出发,在没有外力的情况下会发生有限时间破裂。Euler 方程与纳维–斯托克斯方程彼此相关,但两篇论文中的假设和结论必须分开讨论。Euler 论文。

相关研究史同样重要。欧洲数学会于 9 月 10 日发布的声明肯定了 Córdoba、Martínez-Zoroa、Zheng,以及 Alpöge、Buckmaster 和更早的数学贡献。声明也提出了访问权限、作者身份和贡献归属等问题。若报道从模型名称直接跳到定理,就会遗漏促成这项成果的思想积累。欧洲数学会声明。

9 月 11 日,Clay 对表面上取得的解决进展表示审慎的乐观,并称评估工作和贡献归属将按有意从容的程序进行。这是有意义的机构回应,但并非颁发大奖,也不是宣布该工作各方面的审核都已完成。Clay 公告。

对读者而言,准确结论本身已经足够重要,无需再加油添醋:一家 AI 实验室发布了一项针对公认千禧年问题的拟议证明,并提供可检查的数学材料和形式化材料;主要机构也在认真关注。更广泛的接受、贡献归属和理解工作仍未完成。

Manuscript pages lead to a magnifying glass over a statement and dependency pages, then to an explanatory book and reusable pages.
AI-generated conceptual illustration by BIG CHANGE. Proposing a result, checking its exact statement and assumptions, and building understanding and reuse are distinct activities. Checking and explanation can iterate; this is not a guaranteed linear workflow. A formal check alone does not establish novelty, attribution or usefulness.

证明检查回答一个精确问题

形式化验证改变了审核者能够获得的证据,也应使相关报道更加精确。

Lean 自己的文档区分了证明有效性与所证明命题的含义。基础检查成功,意味着某个形式化命题能够从其定义和假设推导出来。额外检查可以发现未完成的依赖、审查公理,并将证明与独立指定的命题进行比较。文档介绍了使用外部检查器进行更强验证的方法,同时也指出仍有哪些假设尚未排除。Lean 验证指南。

设想一位研究者需要一个适用于算法所有输入的界。助手给出一个形式上正确的定理,但它对“可接受输入”的定义排除了一个困难类别。因此,证明本身可以正确,研究者希望将其用于实际问题的做法却仍缺乏依据。这是一个假设示例,说明研究问题与形式化命题之间的转换需要仔细审查。

新颖性需要另一种检查。证明系统无法确定相同论证是否曾以不同术语发表在旧论文中、贡献归属是否完整,或所称的改进是否会对应用产生重要影响。这些判断需要文献研究和专业知识。

因此,我们建议发布重大成果的实验室提供一套可长期使用的材料:用普通数学语言精确陈述主张,提供相应形式化表述(如果有)、证明及其依赖关系,清楚说明人类和模型各自的贡献,并记录审核和修订情况。这是我们提出的报告标准,能让其他研究者明确责任归属,并复现相关检查。

咨询组回应日益严重的协调问题

9 月 21 日成立的数学与人工智能咨询组,是在这一背景下发布的。该组称自己保持独立、不领取报酬,并愿意为任何相关 AI 公司提供建议。其眼前任务是就 OpenAI 发布公司称其已取得的更多结果提供建议。该组承诺公开发布建议,并明确表示自己无权在公司内部作决策。Terence Tao 博客上的公告是该组发布的一篇客座文章。该组声明。

OpenAI 表示,该组的职责范围包括审核、沟通、评估重要性和成果传播。OpenAI 还称,该组不负责建议公司内部数学研究进展的速度。因此,这一咨询角色应理解为监督和协调渠道,最终决定仍由公司作出。OpenAI 关于咨询组的公告。

这种安排值得欢迎。更好的协调可以减少重复审核、找出合适的专家,并确保成果描述与证据能够支持的内容一致。其局限同样明确:建议需要得到回应,而独立性本身并不带来执行机制。读者应关注公开发布的建议,以及公司如何处理这些建议。

质疑者还关注研究的目的。9 月 11 日发表的《数学与 AI》宣言认为,竞相解决列出的难题,可能会忽视理解能力的发展和未来数学家的培养。签署者指出,思想要变得可教学、可应用,所需的过程面临风险。这是该学科参与者提出的严肃立场,并非一项量化研究,也不能据此说所有 AI 使用已经造成伤害。宣言。

Henry Cohn 在 Tao 博客 9 月 15 日发表的客座文章中提出了相关论点:解释不充分的成果可能给需要吸收它们的研究社群带来大量工作。他也关注承担解释工作的人员会受到怎样的激励。这里同样需要正确标注作者:即便由 Tao 博客托管,文章仍是 Cohn 撰写的。Cohn 的文章。

下一个进展应当更容易供他人使用

5 月至 9 月的一系列事件,通过具体案例支撑了一种乐观解读。一个几何反例激发了更多构造;研究者找到了更清晰的方法来解释一个令人意外的多项式映射;形式化则产生了更多可供检查复杂推理的材料。模型输出与数学实践形成富有成效的关系,所需条件已经显现。

悲观情形同样现实:实验室提出结果的速度可能快于其他人理解它们的速度,之后又把公告数量当作已完成的科学贡献。审核可能成为少数专家承担的负担,而资源和声望却流向制造积压的系统。若模型访问受限,发现的生产者与被期待评估发现的人之间的不平衡可能加剧。

我们认为,实验室、资助机构和期刊应衡量研究流程的两面。可以追踪候选发现,也应追踪独立审查、有用的简化、修正后的论证、可复用的形式化库及后续研究。应将成果变得清晰易懂的人列入贡献者。发布更正的持久度,也应与发布公告一样。

如果读者想跟进下一项突破,最能说明问题的提问应当具体:现在,其他研究者能够做哪些过去做不到的事?答案可能是构造一个反例、确立更强保证、核查复杂论证,或教授一种新方法。AI 数学的进展正是在这里转化为数学本身的进展。