Numa entrevista do World Science Festival de 2 de outubro, o matemático Tristan Buckmaster descreveu um resultado produzido com IA que considera correto, mas difícil de ler para outros matemáticos. O seu relato torna mais concreta a questão levantada pelo recente anúncio sobre Navier–Stokes: como pode uma comunidade de investigação examinar um argumento formal quando é necessário mais trabalho para o explicar de forma legível?

Buckmaster falava do seu trabalho com Levent Alpöge sobre as equações de Euler tridimensionais com uma força suave. O resultado é distinto da alegação da OpenAI de 8 de setembro sobre as equações de Navier–Stokes com uma força suave. Navier–Stokes inclui viscosidade; Euler não. A OpenAI publicou um artigo e uma formalização em Lean para o resultado que afirma demonstrar a perda de regularidade em tempo finito. A instituição responsável pelo Millennium Prize não anunciou a atribuição de qualquer prémio.

A grande mudança

  • O que mudou: Buckmaster apresentou um relato pessoal da utilização de argumentos gerados por IA e de Lean para estabelecer o resultado distinto de Euler forçado, bem como do trabalho ainda necessário para explicar provas deste tipo aos matemáticos.
  • Porque é importante:Uma verificação formal pode estabelecer que um argumento codificado decorre de definições e dependências especificadas. Os matemáticos também precisam de compreender o que o teorema afirma, como funcionam as suas ideias e de que trabalho anterior se serve.
  • O que acompanhar:A avaliação da alegação da OpenAI sobre Navier–Stokes pela Clay, explicações legíveis da prova e o debate público sobre autoria e acesso mostrarão como este resultado é avaliado. A confiança de Buckmaster no resultado é uma opinião especializada, não uma decisão sobre um prémio.

Um argumento verificado continua a precisar de explicação

Na entrevista, diz Buckmaster, a primeira demonstração do seu resultado sobre Euler produzida por IA misturava ideias úteis com cálculos irrelevantes e prosa difícil de ler. A equipa começou por usar outros agentes para analisar cada passo e, depois, converteu o argumento para Lean para uma verificação formal. Diz que a demonstração final estava correta, apesar da má apresentação. Esse relato diz respeito a o seu trabalho sobre Euler; não deve ser interpretado como uma verificação independente de todas as partes do outro artigo da OpenAI sobre Navier–Stokes.

A distinção é prática. Lean verifica uma afirmação formalizada com precisão num ambiente de prova especificado. Isso não torna, por si só, um argumento longo legível para quem pretende reutilizar o seu método. Buckmaster disse a Brian Greene que outros sistemas de IA conseguiram interpretar passagens que ele mal conseguia ler e que pedir à IA que as convertesse em linguagem matemática corrente passou a fazer parte do trabalho. Disse também que continuava a compreender as ideias do argumento sobre Navier–Stokes, embora o PDF publicado fosse difícil de ler. São avaliações suas, não uma auditoria de provas da BIG CHANGE; não executámos os ficheiros Lean nem analisámos como árbitros qualquer dos teoremas.

O relato da NYU Courant de 14 de setembro identifica a realização de Buckmaster e Alpöge como perda de regularidade em tempo finito para Euler forçado em 3D, com uma força suave e dados iniciais de energia finita. Refere que três artigos da colaboração foram formalizados em Lean e enquadra o resultado numa linha de trabalho iniciada por Diego Córdoba e Luis Martínez-Zoroa. Estes pormenores são importantes para atribuir o mérito: uma prova gerada por um modelo pode alargar um percurso matemático existente sem apagar as pessoas que o estabeleceram.

Dois resultados numa sequência que avança rapidamente

A OpenAI afirma que o seu sistema interno de agentes produziu primeiro um resultado de Euler sem força externa e depois usou essa linha de trabalho na sua construção separada de Navier–Stokes. O seu anúncio reconhece a prioridade de Buckmaster e Alpöge no resultado de Euler forçado, mas diz que a respetiva prova foi desenvolvida de forma independente. Na entrevista, Buckmaster descreve os mecanismos matemáticos como relacionados e afirma que a OpenAI acrescentou uma ideia envolvendo um vórtice em colapso para lidar com a viscosidade. Os relatos concordam que estão em causa equações e etapas de prova diferentes; não resolvem todas as questões de cronologia ou autoria intelectual.

A European Mathematical Society saudou o anúncio, salientando o trabalho anterior e pedindo atenção à autoria, ao crédito e ao acesso ao modelo interno. A resposta da Clay de 11 de setembro afirmou que o problema de Navier–Stokes tinha sido aparentemente resolvido e que a avaliação da realização e a atribuição de mérito seriam deliberadamente feitas sem pressa. Buckmaster disse a Greene que acredita que a OpenAI tem uma solução. As duas afirmações podem coexistir: a avaliação positiva de um especialista e a análise continuada de uma instituição.

A recente retirada de outros três manuscritos matemáticos da OpenAI é um acontecimento distinto. O erro de sinal relatado é motivo para analisar as afirmações individualmente; não demonstra que o mesmo erro esteja na prova de Navier–Stokes. O guia da BIG CHANGE para inspeção de repositórios explica como localizar versões de manuscritos e artefactos de prova; a nossa opinião sobre a capacidade de revisão defende apoio dedicado à explicação e à verificação. O artigo anterior sobre Navier–Stokes regista o início desta sequência. A entrevista acrescenta o relato de um matemático em atividade sobre o que acontece depois de um sistema de IA produzir um argumento.

Perante uma afirmação com estas consequências, as próximas publicações úteis serão relatos precisos e legíveis, artefactos formais que possam ser inspecionados e respostas matemáticas independentes. Cada um cumpre uma função diferente. A rapidez com que se gera uma hipótese de prova torna essas tarefas mais urgentes, enquanto o processo anunciado pela Clay permite realizá-las com cuidado.

Fontes e leituras adicionais