Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# 当 AI 实验室私下取得发现时,谁能质疑这些答案?
> AI 的非公开发现引出了公共权力问题:谁能检查证据、选择下一个研究问题,并从答案中受益?本文审视成果发布的动机、科学理解和人的自主性。
By BIG CHANGE Editorial
Published: 2026-09-22T14:25:09.513Z
Updated: 2026-09-22T14:25:09.513Z
Canonical: https://bigchange.ai/blog/private-ai-discoveries-public-science

AI-generated conceptual illustration by BIG CHANGE. Shared evidence can give outsiders room to examine and develop an idea even when the discovery system remains private. The geometric sculpture is a conceptual form, not a depiction of a theorem or an unreleased result.
一家公司可以宣布 AI 已经解决了一个难题,但很长时间里,外界仍无法判断这项成果究竟带来了什么。缺少的可能是证明、解释、系统访问权限,或者仅仅是审查工作的时间。每一种缺失,都会赋予公司不同形式的权力。
这正是近期关于 AI 隐藏突破的讨论背后值得追问的问题。在 9 月 15 日发表的一篇文章中,计算机科学家 Scott Aaronson 称,Navier–Stokes 方程公告发布后的反响使他听到了传闻:AI 公司正在扣下若干理论计算机科学重大难题的解答。他没有公开那些解答。他的叙述只能证明他听到了这种说法,不能证明那些未具名的结果或传闻所称的动机已经得到核实。[Aaronson 的文章](https://scottaaronson.blog/?p=10062)
另有一项更具体的进展。数学与人工智能独立咨询组表示,目前的任务是就 OpenAI 如何发布其声称在内部取得的重大数学成果提供建议。这证实了公司报告的成果正通过一个发布协调流程处理,但并不能认证所有等待发布的结果。[咨询组的声明](https://agmai.org/)
对读者而言,这一区别可以避免把一种令人兴奋的可能性,误写成一份虚构的已解难题清单。对科学而言,它还引出了更大的问题:如果发现越来越集中在私有系统内部,其他所有人还能保有多少独立性?
## 重大变化
- **变化内容:**已发表的 AI 生成证明材料,与等待协调发布的公司报告成果并存。关于还有其他未公开突破的说法,仍未得到核实。
- **为何重要:**实验室可以影响哪些发现会公开、专家何时能够审查,以及谁有机会在这些方法基础上继续研究。
- **关注事项:**发布安排是否能为外部研究者提供可用证据和质疑结果的自由,同时支持人类专家选择研究问题、理解结果并分享成果所需的专业能力。
## 突破成果可以公开,相关能力却仍掌握在私人机构手中
OpenAI 于 9 月 8 日发布的 Navier–Stokes 公告展示了一种有选择的开放方式。公司发布了书面论证和形式化证明文件,同时称,发现该结果的系统是一种内部模型,其能力强于 GPT-6 Astra。公开产出,与开放对产出系统的访问权限,是两个不同的决定。[OpenAI 的公告](https://openai.com/index/navier-stokes-solution/)
理解数学问题的范围也需要谨慎。公告中的构造使用了光滑的外部强迫项。Clay 官方问题说明明确允许在其 C 和 D 两种破裂情形中使用强迫项;不含强迫项的全局光滑性情形讨论的是另一个问题。一个有效的带强迫构造可以回应公告所述的奖金问题,同时让无强迫情形仍未解决。[官方问题表述](https://www.claymath.org/wp-content/uploads/2022/06/navierstokes.pdf)
9 月 11 日,Clay 对表面上取得的解决进展表示欢迎,同时保留了从容评估和确定贡献归属的程序。那是机构针对一项公告作出的回应,并非宣布颁发了奖金。[Clay 的回应](https://www.claymath.org/news/navier-stokes-announcement/)
我们在[从单位距离到 Navier–Stokes 方程的指南](https://bigchange.ai/blog/ai-mathematics-unit-distance-navier-stokes)中讨论过更广泛的数学脉络。这里的重要区别在于,成果发布后谁能做什么。外部数学家或许可以研究证明,却未必拥有以同样方式研究相邻问题所需的资源或模型访问权限。发现可以共享;产生下一个发现的手段仍可能集中在少数机构手中。
这种安排仍可能很有价值。如果要求每位研究者都重做原始搜索,许多成果反而更难使用。核验某个证明时,关键是能够获取相关证据,而不一定要拥有发现该证明时使用的全部工具。但能够核验已发表的答案,并不意味着外部研究者能同等影响接下来要回答哪些问题。
## 公众需要有提出异议的途径
OpenAI 的公开代码库分别列出 Navier–Stokes 和 Euler 两项主张,并提供构建说明以及使用 Comparator 进行额外证明检查的方法。这些是可供检查的材料,而非一段演示视频。我们读过相关文档,但没有重新构建或独立认证这些证明。[证明代码库](https://github.com/openai/NavierStokesAndEuler)
Lean 的验证指南解释了为什么成功检查也有明确的适用范围。审核者必须检查定理的含义和假设,包括其依赖项。更强的检查可以将提交的证明与另行指定的命题进行比较,并使用独立的检查软件。这能减少对成果提供方的依赖,但仍需要对工具和规格说明作出明示假设。[Lean 验证指南](https://lean-lang.org/doc/reference/latest/ValidatingProofs/)
一种值得期待的可能性是:私人系统可以进行成本高昂的搜索,随后公开供他人核验的证据,而无需任何人重做全部搜索。即使只有少数机构有能力以这种规模生成 AI 发现,这些发现仍可能成为共享资源。
较弱的一种做法,是实验室只向选定专家进行非公开演示,然后要求其他人相信专家的背书。这或许可以作为合理的初步步骤,但会大幅削弱公众发现有争议假设、检查更正内容或探索意外应用的能力。了解结论与了解产生异议的依据,并不是一回事。
设想一个原创的假设情形:一所大学的研究团队正在研究一类优化问题。一家公司私下发现了一种能改善某个重要案例的方法。它可以公开该方法和精确的保证,也可以提供在线服务来返回答案,同时将方法本身保密。
这两种选择都可能对用户有帮助,但只有第一种必然会让大学获得一种方法,使其能够检查、教学和改进该方法,而无需持续依赖该服务。如果公司改变服务条款、撤回模型或停止支持这一研究领域,这些差别就会产生实际影响。服务可能很有用,科学研究却仍可能依赖它。
这就是为什么公共利益不能只按发现数量衡量。一次发布可能扩大人们的知识、能力,也可能扩大人们必须获得许可才能行使的权利。这些结果有时会同时出现,却并非必然如此。
## 暂停发布可能改善科学研究,也可能让一家机构获得更长的领先时间
协调重大成果发布有合理的理由。专家可能需要时间检查主张、确认早期研究并准备解释。发布前先更正问题,可以避免很多人基于错误结果继续研究。贡献归属之争也需要证据,而不是比谁先发布公告。
但同样的延迟也可能对外部研究者产生另一种影响。设想某个研究团队在不知道一家公司声称已解决核心猜想的情况下,选择了下一个项目;团队可能因此花数月追寻一个旧问题。另一种情况是,只让选定的合作者提前获取成果,从而使他们在发展后续结果时占据优势。这些是信息不平等可能造成的后果,并非对某个未发布定理的指控。
真正相关的问题是,延迟实现了什么目的,以及谁要为此负责。明确标出主张、指定独立审阅者并规划如何沟通结果的审核期,有别于伴随非凡能力暗示、却无限期保密的做法。机构需要有时间检查工作;公众也需要理由,判断这种检查与宣传有何不同。
新咨询组提供了一种沟通渠道。该组称,成员不领取报酬,建议将公开发布,而公司保留决策权。其独立性有价值,但这并不会把建议变成必须发布成果的义务,也不会自动给予研究者访问权限。[独立性与问责](https://agmai.org/)
我们认为,富有成效的安排应公开对建议的回应。公司可以说明采纳了哪些建议、哪些内容仍在审查,以及审阅者如何提出尚未解决的问题。这样,外部人士就能评估流程,而不必过早宣布某项定理已经最终解决。
## 最有力的批评承认 AI 确实可能成功
9 月 11 日发表的宣言*《数学领域 AI 的严重失调》*明确承认数学能力已显著提升。它所反对的是相关激励机制:把著名难题用作基准,可能会忽视思想的发展、贡献归属,以及人们学习提出新问题所需的训练过程。宣言也承认 AI 有望改善数学研究。[宣言全文](https://www.mathandai.org/)
这比声称机器不可能有任何发现更有力。它追问的是:成功的系统是否在优化与接收其产出的社群相同的目标。实验室可能合理地希望清楚展示系统能力;研究者可能更关心一种能够开启多个新方向的方法,包括那些冷僻到不会吸引发布会关注的方向。
这些利益没有自动趋于一致的理由,但也未必互相冲突。实验室可以资助探索和解释工作,让成果真正发挥作用。大学可以重视把强大新方法应用于实验室没有优先考虑的领域。出版平台也可以在刊载首次发现的同时,为澄清和综合研究留出空间。
批评同样应以证据为准。正确且影响重大的结果,理应改变我们对系统能力的评估。我们对结果来源的不安不能使结果失效。同样,令人印象深刻的成果,也不会仅仅因为表现突出,就自动回答访问权限或贡献归属的问题。将这些判断分开,才能既肯定数学成果,又质疑它进入世界时所依据的条件。
Aaronson 的文章捕捉到了这种张力:他认为近期进展具有变革性,同时也赞同努力维护人类的理解能力。他将当前描述为奇点开始,这是一种对事件的解读,并非已经证明的科学临界点。[他所表达的立场](https://scottaaronson.blog/?p=10062)
## 加快发现与有意义的人类工作,都是切实的利益
更广泛的讨论早于 9 月的公告。AI 研究者 Julian Togelius 在 2025 年 12 月的一篇文章中,区分了辅助科学家的工具与使科学家参与变得多余的自动化。他捍卫人的自主性和参与机会,即使在一种假设情形中,完全自动化会加速医学进展。这是对一种可能未来的道德立场,而非科学工作已经变得多余的证据。[Togelius 的文章](https://togelius.blogspot.com/2025/12/please-dont-automate-science.html)
仅仅因为现有从业者喜欢某项活动,就为保护该活动辩护,会付出沉重代价。如果一种更好的方法能够减轻痛苦,受益者的利益就应与职业可能发生变化的人群利益一同纳入考量。对有意义工作的重视,不应自动成为否决有益发现的理由。
但不必在保护所有现有任务与让人们退出科学研究之间二选一。谁来选择问题、识别被忽视的需求、判断证据是否适用,并决定如何运用证据?即使机器最终在许多技术环节上做得更好,这些决定仍会影响公众。保留对这些决定的影响力,既是治理问题,也是职业身份问题。
Dario Amodei 在 2024 年 10 月发表的文章中,描绘了一个乐观而宏大的愿景:AI 加速生物学研究、改善人们的生活。文章也指出了实验、数据和物理世界带来的限制。这是基于强大未来系统等假设作出的预测,并非数学突破所确定的时间表。[《爱与恩典的机器》](https://darioamodei.com/essay/machines-of-loving-grace)
关于方程的证明本身,并不能证明某种治疗方法有效,也不能证明能源系统会变得更便宜。每项应用都需要进一步证据。即便如此,重视加速进展仍然合理:即使研究尚未实现自主化,能够帮助研究者排除无效方向或设计更有信息价值的实验,也可能产生重要影响。
分配问题再次浮现。一项进展在科学上可能完全可靠,受益者却可能仅限于负担得起的群体。研究可以变快,同时更加集中于成果所有者认为最有价值的问题。加速是否惠及广大公众,部分取决于资助、访问权限和部署方面的选择。发现的数量无法替我们作出这些选择。
## 证明正确,并不保证判断得当
对齐问题又增加了一个疑问:一个系统可能非常擅长发现论证,却不一定能在漫长研究项目中始终可靠地遵循操作者的意图。经过核验的数学输出可以证明有关该输出的某些事情,但它本身无法证明系统始终尊重权限、坦诚报告失败,或追求正确目标。
这种区别关系到实验室如何使用能力日益强大的工具。委托系统执行范围有限的搜索并检查结果,与赋予系统对实验、支出或发表的广泛决定权,并不是一回事。科学成就可以成为尝试更大胆研究的理由,但相关权限仍需单独论证。
维护人类理解能力对此有所帮助,但它并不是解决对齐问题的万能办法。理解某项发现背后的数学,并不会揭示模型行为的所有方面。反过来,行使有效监督,也不要求一个人重建每一步中间计算。实际目标是保留足够的独立专业能力和证据,以便发现系统的工作何时已不再服务于预定目的。
意义问题也不该只靠承诺“休闲会补偿每一种失去的角色”来搪塞。Amodei 认为,即使 AI 的表现超过人类,人际关系和各类活动仍可保有意义;但他也承认,未来的经济安排尚未确定。这是一种可能的展望,并非保证转型不会带来痛苦。[工作与意义](https://darioamodei.com/essay/machines-of-loving-grace)
即使不是第一个发现成果,学生仍可以重视对成果的理解。即使不要求社群成员胜过每台机器,人们仍可以重视教学、讨论和探究。然而,维系这些活动所需的机构仍需要资源和选择。个人的满足感本身无法支付实验室经费、保证模型访问权限,或独自维持一个学术系所。
## 根据它带来的独立性评判发布安排
人们能否在不完全依赖公司说法的情况下质疑这项主张?其他团队能否使用成果,而无需重做负担不起的搜索?研究者能否选择成果提供方不太感兴趣的后续问题?是否有具备能力的人员和机构解释、纠正并持续保存这项工作,即使公众关注点已转移?
这些问题将乐观与悲观的未来联系起来。在一种未来中,强大的私人工具为更大的共享知识体系作出贡献,更多人得以研究以前无法触及的问题。在另一种未来中,外部人士得到令人印象深刻的答案,却越来越依赖少数组织来决定哪些问题值得提出。
我们目前还不知道传闻中那些未公开的结果具体包含什么,但可以评判围绕已经浮现的成果所建立的安排。一项重大的 AI 突破,应当让科学界其他成员更有能力独立采取行动。
## Sources
- [Scott Aaronson:《奇迹与恐怖的时代》](https://scottaaronson.blog/?p=10062) — 报告了相关传闻,并呈现作者对 AI 进展的解读。文章没有披露或核实未具名的解答,也没有核实传闻中关于扣下成果的动机。
- [数学与人工智能咨询组](https://agmai.org/) — 说明了该组公布的职责范围和独立性。待发布结果由 OpenAI 报告;该组的声明并非面向公众的结果认证。
- [OpenAI:关于 Navier–Stokes 千禧年大奖问题](https://openai.com/index/navier-stokes-solution/) — 公司记录链接到已发布的证明材料,并介绍一种内部模型。有关同期工作的部分更新于 9 月 10 日;本文不裁定成果的来源归属。
- [Clay:Navier–Stokes 问题官方表述](https://www.claymath.org/wp-content/uploads/2022/06/navierstokes.pdf) — 定义了带强迫项的破裂情形和无强迫项的光滑性情形。该来源界定问题范围,但不认证任何拟议解答。
- [Clay:Navier–Stokes 公告](https://www.claymath.org/news/navier-stokes-announcement/) — 机构以审慎措辞回应,保留评估成果及确定贡献归属的程序,并未宣布颁奖。
- [OpenAI:Navier–Stokes 与 Euler 证明代码库](https://github.com/openai/NavierStokesAndEuler) — 公开代码库区分了两项结果,并提供构建和检查说明。我们阅读了文档,但没有重建或认证其中的证明。
- [Lean:验证 Lean 证明](https://lean-lang.org/doc/reference/latest/ValidatingProofs/) — 解释了证明检查的保证、假设审查以及更强的独立检查。正确解释预期定理仍是另一个问题。
- [数学与 AI 宣言](https://www.mathandai.org/) — 这份一手声明表达了对激励机制、贡献归属和人类理解能力的担忧。它承认 AI 的进展与潜在好处,并非对危害的量化测量。
- [Julian Togelius:《请不要自动化科学!》](https://togelius.blogspot.com/2025/12/please-dont-automate-science.html) — 原文区分了辅助科学研究与让科学家变得多余的自动化。其论点涉及假设未来中的自主性和意义,并非经过核实的预测。
- [Dario Amodei:《爱与恩典的机器》](https://darioamodei.com/essay/machines-of-loving-grace) — 这是一篇明确带有推测性质的乐观文章,讨论了实际限制和未解决的经济问题。文中的情景并未确定时间表或医学成果。
BIG CHANGE 新闻通讯
纵览全局,按自己的节奏。
关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.