10月6日,OpenAI发布了一大批AI生成的数学研究成果,包括论文、所声称成果的概述,以及部分成果的形式化证明文件。 OpenAI的公告 称相关成果由其内部模型生成,并表示公司计划举办研讨会,帮助数学家理解这些成果。此次发布也给数学家带来一项重要评估任务:判断哪些成果可信且可用。

AI可能比当前科学界吸收成果的速度更快地提出候选研究结果。这次发布说明了这种风险,但并非对整个研究体系的测量结果。我认为,机构应把核验、解释和独立跟进视为重要研究工作,并为此安排人员和经费。候选结果的清单再长,也无法替我们完成这些工作。

重大变化

  • 变化在哪里: 一家公司可以一次向研究共同体提交数百篇AI生成的数学论文。文档可供查阅,但其中的主张仍需逐项评估。
  • 为何重要: 想要基于某项主张开展工作的研究者,必须花时间核对其假设、证明以及与既有研究的关系。如果候选成果增长快于核验能力,重要的更正或有用的想法可能会埋没在同一队列中。
  • 值得关注: 现在的决策不仅关乎发布,也关乎如何支持独立核验和解释。OpenAI承诺举办研讨会;一个独立咨询小组建议由研究共同体主导资助,并明确说明成果来源。这些选择将影响谁能评估并拓展这项工作。

论文数量对评审者提出了什么要求

这份 10月6日的存储库概览 包含一项关于四维Kakeya集的主张:每个方向都含有一条单位线段的集合,其Hausdorff维数均为四。一篇 该集合中的论文 给出了论证。这是公司发布、仍待审查的数学主张。仅凭阅读概览或统计论文数量,我无法判定其正确性。

在一次 对10月6日固定存档快照的单独检查中,BIG CHANGE统计到722篇论文,分属372个结果系列。一个系列可能包含多篇相关论文。这个数字描述的是该集合某一版本中的文件,并不意味着722项发现都已得到独立证实。此前的文章介绍了读者如何从论文追溯到形式化陈述及其核验配置。这里的问题是,随着主张不断增多,一个领域如何提供足够多的合格读者来完成这项工作。

形式化可能有所帮助。计算机可以核验一项拟议证明是否在指定定义、依赖项和公理下确立了精确编码的陈述。仍需有人判断该陈述是否对应读者认为论文提出的主张、假设是否恰当,以及结果与既有研究有何关联。该集合中的一些论文没有形式化;针对某一陈述的Lean文件并不能评审整篇论文。 存档检查 解释了这些限制,但并未声称实际运行过检查器。

9月关于 纳维–斯托克斯问题的公告 说明了这一差别为何不仅关乎存档清单。OpenAI称,其内部系统找到了一个强迫的有限能量爆破解构,对应于 Clay的官方表述中的C和D两种情形,并发布了论文和Lean形式化证明。9月11日, Clay表示 该问题“表面上”已得到解决,评估和归属认定将从容进行。Clay当时并未颁发奖项。BIG CHANGE 此前对数学进展的梳理 提供了技术背景。这里的重点是结果公布与审慎判断之间的时间间隔。

为核验工作提供专门资源和认可

独立的 数学与人工智能咨询小组 认为,发表开启了人类理解工作的阶段。其 9月29日建议 要求实验室核查文献与贡献归属,提供易读的证明、模型使用和失败尝试的信息,并在可能时进行形式化。建议还呼吁支持(包括资金)由共同体主导的成果理解与应用工作。该小组在 10月6日的回应中表示,其咨询角色不应被视为认可OpenAI的流程,也不代表对结果影响作出判断。

我会把这种支持纳入研究资助和评估的常规部分。主张应附有版本、AI所作贡献、假设、支持材料以及提交更正的途径。独立专家可以根据主张的潜在重要性和错误后果确定优先事项。其他证明所依赖的结果,需要不同于狭窄计算的审查投入。解释、复现、未通过的核验和谨慎更正都应被视为贡献,即便它们没有率先公布结果。

这要求机构承担更多工作,但并不预设学者普遍敌对或行动迟缓。数学审查有助于维护贡献归属并发现错误;当某项结果将成为后续工作的前提时,负责任的谨慎很有价值。能力问题源于产生候选结果与对其建立合理信心需要不同类型的劳动。即便严谨机构尽职履责,大规模发布仍可能给它们带来负担。

实际应用可以在其范围内检验价值

以研究成果为基础开发产品的公司可以提供早期实用性测试。实现方案可以显示某个想法是否有助于具体任务;实现失败也可能揭示错误假设。应连同方法和限制一起发布这些观察结果,以便他人检查。商业成功本身不能证明数学定理或一般性科学主张。

这一差别因学科而异。在数学中,可运行的产品不能解决证明问题;合格审查以及适用时的形式核验针对的是确切定理。在计算科学中,他人需要足够的代码、数据和设置来复现结果并测试敏感性。生物学和医学需要分阶段的独立证据,视情况从实验室研究到动物和人体研究。物理学中的理论或模拟需要观测或实验来检验其预测。公司可以参与任何阶段,但一个阶段的证据不能悄然升级为下一阶段的证据。

BIG CHANGE此前关于 私人AI发现与公共科学的评论文章 讨论了谁控制成果和工具的访问权。即使公开发布,仍有另一个制度性问题:研究人员是否有足够的时间、独立性和激励,把候选成果转化为可靠知识?答案应体现在有资助的复现、公开解释和得到认可的更正中,而不仅仅是下一次论文计数。

来源与延伸阅读