人类数学协会(AHM)在 OpenAI 于 10 月 6 日发布大量 AI 生成的数学成果后,呼吁数学家停止与该公司合作。在其10 月 7 日声明中,该组织的核心异议是:使用私有模型处理高阶开放问题,并一次性发布由此产生的数百篇论文。它质疑 OpenAI 关于这种发布模式能推动数学发展的说法,尽管公开文件让人们可以逐项审查相关主张。

这是 AHM 传播工作组的立场。它既不是数学界的投票结果,也不是认定每篇手稿都有误。Terence Tao以 AHM 嘉宾声明的形式转载了这段文字,并标明作者身份,而不是将其作为自己的声明。

重大变化

  • 发生了什么变化: 围绕 OpenAI 资料库的争论已超出单项结果是否有效。AHM 质疑该公司在选择研究问题以及决定数学家以何种条件获得成果方面所扮演的角色。
  • 为何重要: 这场争论涉及谁能检查生成工具,以及谁要承担核查和解释大规模发布内容的工作。即使某项证明得到修正或形式化,这些问题仍然存在。
  • 接下来关注: OpenAI 表示将增加形式化成果。对修订后主张进行独立评估,以及后续带版本号的更正,将有助于厘清数学家能够核验并理解哪些具体结果。

AHM 反对什么

AHM 表示数学家并未要求开展这些工作。它称发布 700 多份文件是展示力量,而非学术研究,并请读者质疑这些成果对该领域的价值。声明还援引独立的数学与人工智能咨询组(AGMAI),称 OpenAI 无视了该组最初提出的要求:停止使用内部模型测试高阶数学问题。

这一说法有明确依据:AGMAI 9 月 29 日发布的指导意见建议前沿实验室停止使用专有模型测试高阶问题。同一文件随后对实验室已产出的结果提出了有条件的发布建议:数学写作应清晰、使用合适的资料库、披露工作的生成方式、尽可能进行形式化,并支持人类理解。文件称,这些建议依据 600 多份问卷答复,并获得答复者中相对多数的支持。这些事实并不能把 AHM 随后呼吁停止与 OpenAI 合作的主张变成 AGMAI 指令,也不能说明整个领域作出了决定。

在其10 月 6 日对发布事件的回应,AGMAI 明确表示,其咨询角色既不代表认可 OpenAI 的流程,也不代表判断成果的影响。该组织称,发布只是人类评估的开始,同时表示只有数学界才能判断其建议是否得到充分落实。此前,OpenAI 曾将该组织描述为独立机构,并表示该组织将就审查和沟通提供建议,但不会控制公司内部研究的节奏。这里的关键是建议与权力的区别:AHM 批评的是 OpenAI 的选择,并不能证明外部委员会批准或否决了这些选择。

记录在变化,仍需核查

OpenAI 的资料库称,资料集中的工作处于不同的核验阶段。其当前目录列有719 篇手稿,分属 372 个系列。一个系列可能包含多篇论文。资料库称,部分手稿没有 Lean 形式化证明,一些未形式化的结果可能存在问题;它报告称,约 42% 的顶层结果已形式化。形式化是针对特定陈述、可由机器检查的明确论证,并不代表对周边论文中所有主张的全面确认;资料库所列状态也不能代替独立的数学审查。我们此前的文件与证明配置导览解释了如何追踪其范围。

三篇手稿撤回后,数量发生了变化。OpenAI 的10 月 7 日历史记录将撤回归因于一项证明中的符号错误,该错误也影响了两篇依赖该证明的论文。记录还包括其他 14 篇手稿的修订、另外 13 篇论文的参考文献更新,以及新增的六项形式化成果。我们关于三份撤稿通知的报道说明了更有限的结论:被指出的论证已不能证明那些论文的主张;通知并未推翻数学陈述本身。被撤回的证明、修订后的手稿和已形式化的结果是不同的状态。

这些修订显示,面对规模庞大且形式化程度不一的成果集,审查工作可能有多繁重。这是我们对资料库记录的分析,并非 AHM 声明中的说法。AHM 反对通过专有模型生成并发布这一成果集的决定。与此同时,OpenAI 提供了带版本记录的材料,研究人员可以检查、修正并讨论。我们此前关于审查能力的分析讨论了将大量拟议结果转化为真正理解的数学知识所需的工作。本次争论又提出一个更尖锐的问题:以这种方式产出如此大量的成果,是否有利于那些需要评估它们的人?

来源及延伸阅读