五月,一道關於平面上點的問題得到出乎意料的答案。到了九月,AI 研究實驗室開始發表有關流體奇點的論證,並附上可供電腦檢查證明的檔案。在這段期間,也出現了新的反例、更強的界,以及費馬最後定理的形式化證明。

AI 數學研究的轉變,值得用更完整的方式檢視,而非只記錄哪些猜想被推翻。這些結果探討不同問題、依據不同證據,也留下不同的未竟工作。反例可以推翻既有信念,卻未必找到最佳答案;改善界限可能很重要,但旁邊那個著名猜想仍可能懸而未決;電腦驗證的證明可以確立某個命題,卻未必說明其中的想法對其他問題有何用途。

本文回顧 OpenAI 於 5 月 20 日發布的單位距離結果,以及 9 月的 Navier–Stokes 主張之間的重要發展,資料更新至 2026 年 9 月 22 日。內容也納入期間的重要公告及延伸研究。這是這段發展脈絡的整理,並非所有 AI 輔助數學論文的完整清單。我們閱讀了文中引用的公告、相關定理陳述、研究介紹與驗證文件,但未對這些證明進行獨立同儕審查,也未重建其形式化驗證。

我們的核心判斷是,進展最有力的證據包含兩部分:機器正在產生值得認真檢視的數學論證,而人們也已從部分論證中發展出更多數學成果。這些成果能否累積成持續進展,取決於投入多少資源來檢查、說明並延伸相關工作。

五月:一個反例為幾何學開闢新路徑

單位距離問題很容易想像:在平面上放置一組點,再計算兩兩相距恰好一個單位的點對數量。點愈多,這個數量最多可以增加到多大?

OpenAI 於 5 月 20 日發布公告,將一項新構造歸功於內部通用推理模型;該模型曾以一組 Erdős 問題進行評估。OpenAI 也另行發表一篇由外部數學家撰寫的配套論文,說明他們如何檢視這項論證。第二份文件很重要:讀者可以查看這些數學家理解並重建出的內容,而不只依賴實驗室對模型的描述。OpenAI 公告。

原始論文構造出無窮多組點集,讓單位距離點對數至少達到 n^(1+δ),其中 δ 是固定的正數。換句話說,例子規模愈大,指數上的改善仍會持續。這推翻了該數量幾乎呈線性成長的猜想,但沒有決定每一個點數所對應的單位距離精確最大值;尋找最佳界限的廣泛研究仍在繼續。單位距離論文。

這項構造令人意外之處,在於它的來源。配套論文將幾何結果連結到高深的代數數論,並指出先前的數學工具。作者也提出較簡化且略為一般化的重建方式。這是 AI 發現之後由人類接續工作的有益案例:找出其機制、讓所依賴的成果清楚可見,並將論證整理成其他研究者能繼續使用的形式。數學家的配套論文。

因此,想了解五月成果的意義,應像追蹤最初公告一樣仔細閱讀後續論文。當研究者運用一項新技巧提出並回答更多問題時,這項技巧便獲得另一種可信度。

五月至七月:想法開始傳播

5 月 27 日,Thomas Bloom、Will Sawin、Carl Schildkraut 與 Dmitrii Zhelezov 發表一項實數域上 sum-product 猜想的反例。粗略來說,這個問題探討一個集合的元素相加或相乘時,集合會擴張多少。他們的構造讓相加與相乘後的集合規模都小於猜想所預期的近二次成長幅度。作者明確指出,單位距離反例促使他們重新思考高次數域。他們也說明,最終構造所需的數論工具比先前結果少。Sum-product 論文。

這是 AI 起源的結果激發人類撰寫後續數學工作的具體案例。這並不能證明 AI 撰寫了後續論文;我們也不應將那些作者的成果併入實驗室的成功數量,抹去他們的貢獻。

Cosmin Pohoata 的預印本於 6 月 11 日首次投稿,並於 6 月 28 日修訂,將這段研究延伸至 Elekes–Rónyai 問題。論文提出一個多項式例子,指出其在合適集合上的函數值擴張幅度低於預期,並運用了近期單位距離與 sum-product 構造中的工具。論文明確說明了這些問題之間的連結。Pohoata 的論文。

7 月 6 日,Sungchul Lee、Pohoata 與 Daniel Zhu 發表一項關於 Minkowski 格點的新成果。他們的構造在子集中保留重複距離特性,並能應用於重複距離及等腰三角形相關問題。相較於只展示一個異常豐富的構形,卻不探究其內部行為,這呈現了更深一層的結構。Minkowski 格點論文。

樂觀看待這段進展並非毫無依據。五月的成果在幾週內就提供材料,讓其他研究者得以修改並沿用。我們建議以這類可實際運用的方法及理解它們所需的投入,作為衡量成功的指標。若只計算解決了多少問題,便會忽略這項差異。

七月:Jacobian 反例說明範圍界定的重要性

另一個引人注目的發展涉及 Jacobian 猜想。Terence Tao 於 7 月 21 日發表的解說,檢視一項使用 Fable AI 產生的反例:一個三個複數變數的多項式映射,在小範圍內呈現可逆性,但整體而言會將不同點映射到同一輸出。該猜想的一般主張在三維以上不成立;二維情況仍未解決。Tao 列出明確公式,並說明此構造的幾何意義。Tao 的數學解說。

明確反例的核心矛盾,往往相對容易透過計算看出。要發現這種例子為何存在,以及如何構造相關例子,則需要進一步的數學工作。Jacobian 事件讓讀者可以從已發表的內容中,看見這些工作的差異。

到了九月,這項區分仍然重要。Arno van den Essen 於 9 月 15 日發表的預印本,提出一種初等方法,構造出經線性座標變換後與 Levent Alpöge 發現的反例等價的例子。這是對該構造的新解釋,並非又一次獨立推翻原始猜想。van den Essen 的論文。

對研究管理者而言,這提示了獎勵機制可以如何調整。資助能讓複雜發現更容易理解的人,可能與資助另一輪尋找頭條級成果同樣能促進後續研究。這是我們對整段研究脈絡的評估,並非聲稱大學已經改變獎勵制度。

八月:數學主張涵蓋更廣的範圍

OpenAI 於 8 月 1 日發布十組涵蓋數學與理論電腦科學的成果。該公司表示,論證由內部版本的 Astra 生成;研究人員與模型合作準備論文,模型則產生 Lean 證明憑證。這與五月單一成果的公告描述了不同的產出流程,也明確指出準備論文所需的人力貢獻。八月公告。

配套成果集於 8 月 6 日更新,列出以下結果。這些是對論文主張的描述,並非 BIG CHANGE 分別認證了十項成果:

  • 球體填充:在高維空間中取得更精確的漸近上界。
  • 二元碼與球面碼:針對指定間距,提出更強的碼長限制。
  • 群論:構造一個非 sofic 群。
  • 算子代數:提出 Connes 剛性猜想的反例。
  • 算術複雜度:提出更強的 permanent 電路與公式下界。
  • 量子博弈:證明指數級平行重複定理。
  • 格點問題:提出更強的最近向量問題近似困難性結果。
  • 凸幾何:證明 Ehrhart 體積猜想。
  • Ramsey 理論:對多色三角形 Ramsey 數提出超指數下界。
  • 極值圖論:提出緊緻性與退化性猜想的反例。

十項成果的研究彙編。

成果範圍廣泛固然重要,但把它們合併成單一總數也會造成誤導。找到反例、改善界限與證明一般定理,帶來的意義並不相同。數學問題本身難度提高,也不會自動證明有人能攻擊實際部署的密碼系統。應用層面的主張需要各自完整的推論鏈與證據。

Anthropic 於 8 月 10 日發布一項範圍較明確、與黎曼假設相關的進展。該公司表示,一個尚未公開的 Claude 模型改善了「黎曼ζ函數零點位於臨界線上的比例」之下界。Anthropic 的數學家檢視了這項工作,外部專家也審閱論文,並完成形式化驗證。該公司明確指出,Claude 並未解決黎曼假設,也不預期這些技巧能做到這點。Anthropic 對成果的說明。

連結論文指出,下界略高於三分之二,約為 67.25%,並列出所使用的先前解析結果。這是關於漸近比例的數學陳述,並非宣稱檢查大量有限個零點就能證明該假設。這項區別至關重要:比例的下界並不代表所有相關零點都位於臨界線上。ζ 零點論文。

其他雄心勃勃的論文也正在流傳。Alpöge 網站上的一份文件提出六維球面上的複結構。其構造內容可供檢視,但我們所讀到的版本無法確認可靠的公告日期,也未完整說明 AI 的貢獻。因此,我們將它列為讀者可進一步研究的提案,而不把它提升為這段時間線上已獨立確立的里程碑。六維球面論文。

九月初:質數間隙顯示驗證的界線

這波公告也延伸到質數之間的間隙。Axiom 合作團隊於 9 月 3 日發布一篇初步論文,指出相鄰質數對之間有無窮多個間隙不超過 212。論文肯定 Julia Stadlmann 的解析工作及較早的 Polymath 計畫。Lean 證明憑證也將解析估計與另一份已單獨查核的變分憑證列為假設。這項成果推進了有界間隙問題;孿生質數猜想要求存在無窮多個差距恰為 2 的質數對。Axiom 團隊論文。

OpenAI 公開的 PrimeGaps186 程式碼儲存庫提出更小的間隙上界,但有一項重要限制。其 Lean 開發以三個輸入公設為前提,涵蓋文獻中的兩項估計與數值積分界。儲存庫指出,數值證明憑證並未解除這些公設。讀者應區分所提出的數學論證,與在指定輸入條件下經形式化檢查的部分。若將這項成果描述為只從基礎公理出發、無條件且完全形式化的證明,並不準確。PrimeGaps186 儲存庫。

OpenAI 的另一篇論文探討長間隙,也就是相鄰質數之間的區間可以變得多大。論文提出在逐漸擴大的門檻以下,最大間隙下界有所改善。這與找出無窮多組相距很近的質數對,是兩種不同的極值問題;一項問題的進展,不應算成另一項問題已獲解決。長間隙論文。

這些細節使質數間隙事件格外值得參考。標題中的兩個數字看起來像簡單競賽;但當證明所依賴的條件攤開來看,更重要的問題是哪些步驟透過哪些方法確立。即使形式化仍未完成,明確列出假設本身就有價值。

9 月 4 日:形式化驗證也成為發現故事的一部分

Anthropic 於 9 月 4 日發布的公告,談的是數學證明早已為人所知的定理:費馬最後定理。這次主張的成果,是由 Claude 在十一天內大致自主完成的完整 Lean 形式化。該公司描述了人類如何引導工作,以及協作平台如何協助代理追蹤相依關係;同時也肯定這項工作所建立的數學證明傳統。形式化公告。

公開儲存庫提供了比標題更具體的證據。文件陳述定理、記錄相依關係,並說明如何依據 Lean 標準公理及 Mathlib 中的定理版本進行檢查。文件也表示,這是未維護的研究產物。我們檢視了相關文件,但沒有重新執行建置程序。費馬最後定理儲存庫。

如果能產生更多候選論證的工具,也能協助將其形式化,驗證能力或許同樣能擴大。這是值得樂觀的重要理由,因為後續研究者將有具體材料可供檢視。但他們仍須了解中間結果是否容易重用、相依項目是否仍可建置,以及由誰維護這些成果。單看生成程式碼的數量,無法回答這些問題。

這裡也涉及一項值得制度思考的選擇。實驗室可以將證明當作模型已完成的展示發布,也可以將它維護成其他人能持續使用的基礎設施。這兩種方式在發布後會產生不同責任。維護工作、說明範例與穩定的參照資料,都應納入研究預算。

9 月 8 日:Navier–Stokes 成果究竟主張了什麼

流體力學成果讓前述問題更加明確。OpenAI 於 9 月 8 日發布、並在 9 月 10 日更新的公告,提出 Navier–Stokes 方程存在性與光滑性問題的一種解法。OpenAI 將成果歸功於透過協調代理運作的內部模型,並公開文字論證與 Lean 形式化版本。該公司表示,無意申請千禧年大獎。OpenAI 公告。

論文探討的是具正黏滯性、不可壓縮的三維流體運動,並使用精心構造的外力。從靜止狀態出發,所提出的解會在有限時間內產生無界速度,但總能量仍保持有界。外力在時空中皆為光滑函數。其數學構造使用一個塌縮渦旋,並安排修正項,使剩餘外力保持光滑。這些是關於方程解的數學主張,不是物理實驗觀察或新工程模擬器的結果。Navier–Stokes 論文。

外力是理解這項成果適用範圍的關鍵。Charles Fefferman 撰寫的 Clay 問題官方說明,允許在失效情況 C 與 D 中加入光滑外力;但全球光滑解情況 A 與 B 探討的是無外力方程。因此,若成果符合所提出的形式,它可以回答 Clay 問題明確允許的一種情況,同時讓無外力的全域正則性問題仍未解決。稱外力無關緊要會誇大定理內容;若說該成果超出題目既定範圍,也會錯誤描述其規則。官方問題說明。

OpenAI 也發布了一份獨立的 Euler 方程論證,探討沒有黏滯性的理想化流體。該論文提出一種解法,主張光滑初始資料在沒有外力時仍會於有限時間內失效。Euler 方程與 Navier–Stokes 方程彼此相關,但兩篇論文的假設與結論必須分開看待。Euler 方程論文。

相關研究史同樣重要。歐洲數學會於 9 月 10 日發布聲明,肯定 Córdoba、Martínez-Zoroa、Zheng,以及 Alpöge、Buckmaster 和更早期的數學貢獻。聲明也提出取得研究資源、作者身分與貢獻歸屬等問題。若敘事直接從模型名稱跳到定理,就會忽略讓這些工作得以形成的累積性構想。歐洲數學會聲明。

9 月 11 日,Clay 對這項看似解決問題的成果表示審慎樂觀,並指出評估工作與貢獻認定將依照刻意放慢的流程進行。這是一項重要的制度性回應,但不代表已頒發獎項,也不代表作品的所有面向都已完成審查。Clay 公告。

對讀者而言,不必再加上更強的結論,也足以說明其重要性:一家 AI 實驗室公開了一份針對公認千禧年問題的擬議證明,附有可供檢視的數學與形式化資料,而主要機構正嚴肅看待這項工作。至於更廣泛的接受程度、貢獻歸屬與理解,仍有待持續處理。

Manuscript pages lead to a magnifying glass over a statement and dependency pages, then to an explanatory book and reusable pages.
AI-generated conceptual illustration by BIG CHANGE. Proposing a result, checking its exact statement and assumptions, and building understanding and reuse are distinct activities. Checking and explanation can iterate; this is not a guaranteed linear workflow. A formal check alone does not establish novelty, attribution or usefulness.

證明檢查回答的是精確問題

形式化驗證改變了審查者可運用的證據,也應促使報導更加精確。

Lean 官方文件區分了證明有效,與被證明命題的意義。基本的成功檢查表示,形式化陳述可由其定義與假設推導出來。進一步檢查則可揭露尚未完成的相依項目、稽核公理,並將證明與獨立指定的命題進行比對。文件也說明了使用外部檢查器進行更嚴格驗證的方法,同時指出仍有哪些假設尚未排除。Lean 驗證指南。

假設一位研究者需要一個適用於演算法所有輸入的界限。助理提供了一項形式上正確的定理,但它對可接受輸入的定義排除了某類棘手情況。即使證明本身正確,研究者的實際應用仍缺乏支持。這個假設例子說明,從研究問題轉化到形式化陳述的過程,為何值得仔細檢查。

新穎性也需要另一種查核。證明系統無法判定同一論證是否曾以不同術語出現在較早的論文、貢獻是否完整標示,或所宣稱的改善對應用是否重要。這些判斷需要文獻調查與專業知識。

因此,我們建議實驗室發布重大成果時,應提供可長期使用的一套資料:以一般數學語言陳述精確主張;在可行時提供對應形式化版本;附上證明與相依項目;清楚說明人類與模型各自的貢獻;並記錄哪些內容已經過審查和修訂。這是我們提出的報導標準,可讓其他研究者知道責任歸屬,並重現相關檢查。

顧問小組因應日益擴大的協調問題

9 月 21 日公布的數學與人工智慧顧問小組,正是在這樣的背景下成立。小組表示自己獨立運作、不支薪,也願意為任何相關 AI 公司提供建議。目前的任務是就 OpenAI 公布其已取得的後續成果提供意見,並承諾發布公開建議,同時明確說明小組對公司內部沒有決策權。該聲明刊登在 Terence Tao 的部落格上,屬於小組的客座文章。顧問小組聲明。

OpenAI 將小組職責描述為協助審查、溝通、判斷重要性及成果傳播。該公司也表示,小組不負責建議內部數學研究的進度。因此,這項顧問角色應理解為提供審查與協調意見的管道,決策仍由公司作出。OpenAI 顧問小組公告。

有理由肯定這項安排。更好的協調能減少重複審查、找出適當專家,並確保成果描述與證據實際支持的內容相符。但其限制也很明確:提出建議後仍需有人回應,僅宣稱獨立運作並沒有任何強制力。讀者應留意公開建議,以及各公司如何採納。

持懷疑態度的一方也關注研究的目的。9 月 11 日發布的「數學與 AI 宣言」主張,競相解決列出的問題可能忽略理解的培養,以及未來數學家的訓練。簽署者指出,這可能危及讓構想成為可教、可用知識的研究過程。這是學科參與者提出的重要立場,並非證明所有 AI 使用已經傷害數學研究的量化結果。宣言。

Henry Cohn 在 9 月 15 日刊於 Tao 部落格的客座文章中,提出一項相關論點:說明不清楚的成果,可能讓需要吸收它的研究社群承擔大量額外工作。他也關切願意投入解說工作者所面對的誘因。此處同樣應正確標示作者:文章由 Cohn 撰寫,Tao 提供刊登平台。Cohn 的文章。

下一步進展應讓其他人更容易沿用

五月至九月這段發展,透過具體案例支持一種樂觀的看法:幾何反例啟發了更多構造;研究者找到更清楚的方式解釋一個出人意料的多項式映射;形式化驗證則產生了額外材料,讓複雜推理可以接受檢視。模型產出與數學實務之間形成有效合作關係的條件,已逐漸浮現。

悲觀情境同樣具體:實驗室產生擬議結果的速度可能快過其他人理解的速度,接著卻把公告數量當成已完成的科學貢獻。審查工作可能落在少數專家身上,資源與聲望則流向製造積壓成果的系統。模型使用權限有限,也可能加深發現者與負責評估者之間的不平衡。

我們認為,實驗室、資助者與期刊應同時衡量流程的兩端。追蹤候選發現,也追蹤獨立檢視、實用的簡化、修補後的論證、可重用的形式化函式庫與後續研究。應肯定讓成果變得易於理解的人,並以與公告同樣持續的方式發布更正。

讀者若想掌握下一項突破,最值得追問的是一個具體問題:其他研究者現在能做什麼,是過去做不到的?答案可能是構造反例、建立更強的保證、查核困難論證,或教授新方法。AI 數學研究要成為數學本身的進展,關鍵就在這裡。