人間数学協会(AHM)は、OpenAIが10月6日にAI生成の数学研究を大量公開したことを受け、数学者に同社との協業をやめるよう呼びかけた。10月7日の声明で同協会が主に問題視したのは、非公開モデルで高度な未解決問題に取り組み、その成果として数百本の論文を一度に公開することだ。この公開方式が数学を前進させるというOpenAIの主張に異議を唱える一方、公開ファイルによって個々の主張を検討できることも認めている。

これはAHMのコミュニケーション作業部会の見解だ。数学界の投票結果でも、すべての原稿が誤りだという認定でもない。Terence Taoはこの文書をAHMの寄稿声明として再掲載した。自身の声明として採用したのではなく、著者を明記している。

大きな変化

  • 何が変わったか: OpenAIのリポジトリをめぐる議論は、個々の成果の妥当性を超えている。AHMは、研究課題を選び、数学者が成果を受け取る条件を定めるうえで同社が果たす役割に異議を唱えている。
  • なぜ重要か: 生成ツールを誰が調べられるのか、また大量公開された成果を検証し説明する作業を誰が担うのかが争点だ。個別の証明が修正または形式化された後も、これらの問いは残る。
  • 今後の注目点: OpenAIは形式化を追加すると述べている。修正後の主張に対する独立評価や、今後の版管理された訂正によって、数学者が検証し理解できる具体的な結果が明確になる。

AHMが異議を唱えていること

AHMは、数学者がこの研究を依頼したわけではないと述べている。700本を超えるファイルの公開を学術研究ではなく力の誇示と呼び、分野にとっての価値を疑うよう読者に求めた。声明は独立機関の数学・人工知能諮問グループ(AGMAI)にも言及し、OpenAIが同グループの当初の要請、すなわち社内モデルで高度な数学を試すのをやめるよう求める要請を無視したと述べている。

この言及には明確な根拠がある。AGMAIの9月29日付ガイドラインは、先端研究所に対し、独自モデルで高度な問題を試すのをやめるよう求めている。同じ文書は、すでに成果を出している場合の公開について条件付きの提言も示す。数学的に明瞭な文章、適切なリポジトリ、生成方法の開示、可能な場合の形式化、人間の理解への支援だ。提言は600件を超える調査回答に基づき、回答者の相対多数から支持を得たと説明している。こうした事実があっても、AHMによるその後のOpenAIとの協業停止要求がAGMAIの指令や数学界全体の決定になるわけではない。

その10月6日の公開への回答。AGMAIは、助言機関としての役割はOpenAIの手順を承認することでも、成果の影響を評価することでもないと明言した。公開は人間による評価の始まりだと説明し、提言がどの程度守られたかを判断できるのは数学界だけだとした。OpenAIは以前、同グループを独立した組織と説明し、審査と情報発信について助言を受ける一方、社内研究の進度は同グループが管理しないと述べていた。ここでは助言と権限の違いが重要だ。AHMの批判はOpenAIの選択への異議であり、外部委員会がそれを承認または拒否した証拠ではない。

記録が変化しても、確認は必要だ

OpenAIのリポジトリによると、コレクション内の研究は検証の段階がそれぞれ異なる。現在の目録には372のファミリーに属する719本の原稿がある。1つのファミリーに複数の論文が含まれる場合もある。リポジトリは、一部の原稿にはLeanによる形式化がなく、形式化されていない結果には問題がある可能性もあるとし、主要な結果の約42%が形式化されていると報告する。形式化とは、特定の命題に対する明示的で機械検証可能な論証であり、周辺の論文にあるすべての主張を一括して確証するものではない。また、リポジトリの状態は独立した数学的審査の代わりにはならない。以前公開したファイルと証明構成の解説では、対象範囲のたどり方を説明した。

3本の原稿が撤回され、件数が変わった。OpenAIの10月7日の履歴記録は、1つの証明にあった符号の誤りが、依存する2本の論文にも影響したことを撤回の理由としている。記録には、ほかの14本の原稿の改訂、13本の参考文献更新、6件の形式化追加もある。私たちの3件の撤回通知に関する記事が示す結論はより限定的だ。特定された論証では、それらの論文の主張はもはや立証されないが、通知は数学的命題自体を否定していない。撤回された証明、修正された原稿、形式化済みの結果は、それぞれ異なる状態だ。

改訂は、規模が大きく形式化の程度にもばらつきがあるコレクションを審査するにはどのような作業が必要かを示している。これはリポジトリの記録に対する私たちの分析であり、AHMの声明にある主張ではない。AHMは、独自モデルを通じてコレクションを生成し公開する判断に反対している。一方、OpenAIは研究者が調べ、訂正し、議論できる版管理付きの資料を提供した。以前の審査能力に関する分析では、提案された大量の結果を理解された数学へと変えるために必要な労力を取り上げた。今回の論争は、さらに鋭い問いを加える。この方法で大量の成果を生み出すことは、それを評価する人々の役に立つのか。

出典・参考資料