10月6日,OpenAI發布大量AI產生的數學研究資料,內容包括論文、所宣稱成果的概述,以及部分成果的形式化證明檔案。 OpenAI的公告 表示成果由內部模型產生,公司計畫舉辦工作坊協助數學家理解成果。這次發布也讓數學家面臨一項重大評估工作:判斷哪些成果可信且可用。
AI可能比現有科學界吸收成果的速度更快地提出研究候選結果。這次發布說明了這種風險,但不是對整個研究體系的量化發現。我認為,機構應把核實、解釋與獨立追蹤視為重要研究工作,並安排人員和經費。候選結果的清單再長,也無法替我們完成這些工作。
重大變化
- 改變了什麼: 一家公司可以一次向研究社群提出數百篇AI產生的數學論文。文件可供查閱,但每項主張仍須逐一評估。
- 為何重要: 想以某項主張為基礎開展研究的人,必須花時間核對其假設、證明與既有研究的關聯。如果候選成果的增加速度超過這種能力,重要更正或有用想法可能埋沒在同一個佇列中。
- 值得關注: 如今的決策不只涉及發布,也包括如何支持獨立核實與解釋。OpenAI承諾舉辦工作坊;一個獨立諮詢小組建議由社群主導資助,並清楚交代來源。這些選擇將影響誰能評估並延伸這項工作。
論文數量對審查者提出了什麼要求
這份 10月6日的儲存庫概覽 包含一項關於四維 Kakeya 集的主張:每個方向都含有一條單位線段的集合,其 Hausdorff 維度皆為四。一篇 該資料集中的論文 提出了論證。這是公司發布、仍待檢視的數學主張。我無法只靠閱讀概覽或計算論文數量來確認其正確性。
在一項 對 10 月 6 日固定儲存庫快照的獨立檢視中,BIG CHANGE 計算出 722 篇論文,分屬 372 個成果系列。一個系列可能包含數篇相關論文。這個數字描述的是該集合某個版本中的檔案;不代表 722 項發現都已獲得獨立證實。先前那篇文章說明讀者如何追溯一篇論文、其形式化陳述及核查設定。此處的問題是,當主張持續增加時,一個領域如何提供足夠合格的讀者來完成這項工作。
形式化可以有所幫助。電腦可以檢查,在指定定義、依賴項與公理下,某個提議的證明是否能推出精確編碼的陳述。仍有人必須檢視該陳述是否符合人們認為論文所提出的主張、假設是否恰當,以及成果與先前研究有何關聯。集合中的部分論文尚未形式化;一項陳述的 Lean 檔案不能替整篇論文做審查。這份 儲存庫檢視 說明了這些限制,且沒有聲稱曾執行檢查器。
9 月的 Navier–Stokes 公告 說明這個區別為何不只影響儲存庫清單。OpenAI 表示,其內部系統找到一項受迫、有限能量的破壞構造,涉及 Clay 的官方表述中 C 與 D 兩種情況,並發布論文及 Lean 形式化證明。9 月 11 日, Clay 表示 該問題「顯然」已獲解決,評估與歸功將從容進行。Clay 在該回覆中並未頒發獎項。BIG CHANGE 的 數學發展前篇 提供技術背景。這裡的重點是,從宣布成果到形成審慎判斷之間需要時間。
讓核查獲得專屬資源與肯定
獨立的 數學與人工智慧諮詢小組 主張,成果發布是人類理解工作的起點。該小組的 9 月 29 日建議 要求實驗室提供文獻與歸屬核查、可讀的證明、模型使用及失敗嘗試資訊,並在可行情況下進行形式化。建議也呼籲支持(包括資助)由社群主導、旨在理解和應用成果的工作。在 10 月 6 日回應中,該小組表示,其諮詢角色不應被視為對 OpenAI 流程的認可,也不代表對成果影響力的判斷。
我會把這種支持納入一般研究資助與評估。每項主張都應附上版本、AI 的貢獻、假設、佐證材料,以及回報更正的方法。接著,獨立專家可依主張的潛在重要性及錯誤後果安排優先順序。其他證明所依賴的成果,需要不同於狹窄計算的審查投入。解釋、重現、核查失敗及審慎更正都應被視為貢獻,即使它們沒有率先宣布成果。
這項要求並未預設學者一概抱持敵意或行事緩慢,卻確實要求機構投入更多。數學審查能保障歸屬並發現錯誤;當某項成果將成為後續研究的前提時,負責任地保持審慎很有價值。能力問題在於,產生候選成果與取得有充分根據的信心,需要不同類型的勞動。即使審慎的機構盡責,大規模發布仍可能加重其負擔。
實際應用可在其範圍內檢驗價值
以研究為基礎開發產品的公司,或許能提供早期的實用測試。實作可顯示某個想法是否有助於特定任務;實作失敗也可能揭露錯誤假設。這些觀察應連同方法與限制一併發布,供他人檢視。商業成功本身無法證明數學定理或一般科學主張。
這項區別會因學科而異。在數學中,能運作的產品不能裁定證明是否成立;合格的審查,以及適當時的形式化檢查,才是針對精確定理的檢驗。在計算科學中,他人需要足夠的程式碼、資料與設定,才能重現結果並測試其敏感度。生物學與醫學需要各自分明的證據階段,視情況從實驗室研究延伸到動物與人體研究。在物理學中,理論或模擬需要能檢驗其預測的觀察或實驗。公司可以參與任何階段,但不能悄然把某一階段的證據提升為下一階段的證據。
BIG CHANGE 先前關於 私人 AI 發現與公共科學 的評論,探討誰能控制研究成果與工具的存取權。即使成果公開,機構仍面臨另一個問題:研究者是否有時間、獨立性與誘因,將候選成果轉化為可靠知識。答案應體現在有資助的重現、公開解釋及獲得肯定的更正中,而不只是下一次論文數量。
來源與延伸閱讀
- OpenAI 10 月 6 日的數學公告 說明發布日期、內部模型來源、發布方式、部分 Lean 形式化證明及工作坊計畫。這是製作者的描述,並非獨立驗證。
- OpenAI 儲存庫概覽 及 四維 Kakeya 論文 提出具體主張及其論證。連結隨主分支更新;本身不代表學界接受成果。
main;兩者都不能單獨證明學界已接受該成果。 - 諮詢小組的建議 提出來源、闡釋、形式化及社群主導支持的建議。其 10 月 6 日聲明 表示發布開啟而非完成評估,且諮詢角色不代表認可 OpenAI 流程或評判成果影響力。這是小組立場,不是特定論文的證明。
- OpenAI 9 月 8 日的 Navier–Stokes 公告 描述所稱的受迫破壞及形式化證明。 Clay 的官方問題陳述 定義相關選項,而 Clay 9 月 11 日的回覆 說明審慎評估及審查流程;都不是頒獎公告。
- BIG CHANGE 的 儲存庫檢視 記錄固定快照的 722 篇論文、372 個系列與靜態證明材料檢查限制;未執行檢查器。我們的 數學發展脈絡 說明先前成果,而 私人發現評論 探討存取與控制。本文討論評估及運用發布成果的能力。



