Em 6 de outubro, a OpenAI publicou uma ampla coleção de trabalhos matemáticos produzidos por IA. Ela inclui manuscritos, uma visão geral dos resultados alegados e arquivos de provas formais para alguns deles. o anúncio da OpenAI afirma que um modelo interno produziu os resultados e que a empresa planeja oficinas para ajudar matemáticos a entendê-los. A publicação também apresenta à comunidade matemática uma grande tarefa de avaliação: decidir quais resultados podem ser considerados confiáveis e usados.

A IA pode produzir resultados de pesquisa candidatos mais rápido do que as comunidades científicas atuais conseguem absorvê-los. Esta publicação ilustra esse risco, mas não é uma medição de todo o sistema de pesquisa. Na minha opinião, as instituições deveriam tratar verificação, explicação e acompanhamento independente como trabalho de pesquisa relevante, destinando pessoas e recursos a essas tarefas. Uma lista mais longa de resultados candidatos não pode fazer esse trabalho por nós.

A grande mudança

  • O que mudou: Uma empresa pode apresentar centenas de manuscritos matemáticos produzidos por IA a uma comunidade de pesquisa de uma só vez. Os documentos estão disponíveis para consulta, mas cada alegação ainda precisa ser avaliada individualmente.
  • Por que isso importa: Pesquisadores que queiram se apoiar em uma alegação precisam dedicar tempo a verificar suas premissas, provas e relação com trabalhos anteriores. Se os resultados candidatos crescerem mais rápido do que essa capacidade, correções importantes ou ideias úteis poderão ficar enterradas na mesma fila.
  • O que acompanhar: As decisões agora envolvem apoio à verificação independente e à explicação, além da publicação. A OpenAI prometeu oficinas; um grupo consultivo independente recomenda financiamento liderado pela comunidade e procedência clara. Essas escolhas vão moldar quem poderá avaliar e desenvolver o trabalho.

O que a quantidade de manuscritos exige dos revisores

A visão geral do repositório de 6 de outubro inclui uma alegação sobre conjuntos de Kakeya em quatro dimensões: todo conjunto que contenha um segmento unitário em cada direção tem dimensão de Hausdorff quatro. Um manuscrito da coleção apresenta o argumento. Trata-se de uma alegação matemática publicada por uma empresa e ainda em análise. Não é possível confirmar sua correção apenas lendo a visão geral ou contando os artigos.

Em uma análise separada de uma cópia fixada do repositório em 6 de outubroa BIG CHANGE contou 722 manuscritos distribuídos por 372 famílias de resultados. Uma família pode reunir vários artigos relacionados. O número descreve arquivos em uma versão da coleção; não significa que 722 descobertas tenham sido estabelecidas de forma independente. O artigo anterior mostra como leitores podem rastrear um manuscrito até uma afirmação formal e sua configuração de verificação. A questão aqui é como uma área oferece leitores qualificados em número suficiente para fazer esse trabalho diante de um fluxo crescente de alegações.

A formalização pode ajudar. Um computador pode verificar se uma prova proposta estabelece uma afirmação codificada com precisão, sob definições, dependências e axiomas especificados. Ainda é necessário examinar se essa afirmação corresponde ao que se entende que o artigo declara, se as suposições são adequadas e como o resultado se relaciona com trabalhos anteriores. Alguns artigos da coleção não foram formalizados; um arquivo Lean para uma afirmação não revisa um manuscrito inteiro. A análise do repositório explica esses limites sem afirmar que executou o verificador.

O anúncio de setembro sobre Navier–Stokes mostra por que essa distinção tem consequências que vão além de um inventário do repositório. A OpenAI disse que seu sistema interno encontrou uma construção forçada de ruptura com energia finita, relacionada às alternativas C e D na formulação oficial de Claye publicou um artigo e uma formalização Lean. Em 11 de setembro, Clay disse que o problema havia sido “aparentemente” resolvido e que a avaliação e a atribuição de crédito seriam feitas sem pressa. Clay não concedeu prêmio naquela resposta. A análise anterior da sequência matemática feita pela BIG CHANGE oferece o contexto técnico. Aqui, o ponto é o intervalo entre anunciar um resultado e chegar a uma avaliação ponderada.

Dê recursos e reconhecimento próprios à verificação

O independente Grupo Consultivo sobre Matemática e Inteligência Artificial argumenta que a publicação dá início ao trabalho de compreensão humana. Suas recomendações de 29 de setembro pedem que laboratórios forneçam verificações bibliográficas e de atribuição, provas legíveis, informações sobre o uso do modelo e tentativas malsucedidas, além de formalização quando possível. Também pedem apoio, inclusive financiamento, para iniciativas lideradas pela comunidade que busquem compreender e aplicar os resultados. Em sua resposta de 6 de outubroo grupo disse que seu papel consultivo não deve ser interpretado como endosso ao processo da OpenAI nem como avaliação do impacto dos resultados.

Eu tornaria esse apoio parte normal do financiamento e da avaliação da pesquisa. Uma alegação deve vir acompanhada de sua versão, contribuição da IA, suposições, materiais de apoio e uma forma de comunicar correções. Especialistas independentes poderiam então priorizar o trabalho conforme o possível significado da alegação e as consequências de um erro. Um resultado do qual outras provas dependem exige um esforço de revisão diferente de um cálculo restrito. Explicações, replicações, verificações malsucedidas e correções cuidadosas devem contar como contribuições, mesmo quando não anunciam o primeiro resultado.

Isso exige mais das instituições sem presumir que os acadêmicos sejam uniformemente hostis ou lentos. A revisão matemática protege o crédito e detecta erros; a cautela responsável é valiosa quando um resultado se tornará premissa para trabalhos futuros. O problema de capacidade surge porque produzir um resultado candidato e conquistar confiança justificada nele exigem tipos diferentes de trabalho. Uma publicação ampla pode sobrecarregar instituições cuidadosas mesmo quando elas estão fazendo bem seu trabalho.

O uso prático pode testar o valor dentro de seu escopo

Empresas que desenvolvem produtos com base em pesquisas podem oferecer testes práticos iniciais. Uma implementação pode mostrar que uma ideia ajuda em uma tarefa específica, e uma implementação malsucedida pode revelar uma suposição equivocada. Essas observações devem ser publicadas com métodos e limites para que outras pessoas possam examiná-las. O sucesso comercial, por si só, não prova um teorema matemático nem uma alegação científica geral.

A distinção varia conforme a disciplina. Em matemática, um produto funcional não resolve uma prova; o escrutínio qualificado e, quando apropriado, a verificação formal tratam do teorema exato. Em ciência computacional, outras pessoas precisam de código, dados e configurações suficientes para reproduzir um resultado e testar sua sensibilidade. Biologia e medicina exigem etapas distintas de evidência, do trabalho de laboratório a estudos com animais e seres humanos, quando aplicável. Em física, uma teoria ou simulação requer observações ou experimentos que confrontem suas previsões. Uma empresa pode contribuir em qualquer dessas etapas, mas a evidência de uma delas não pode ser promovida silenciosamente à seguinte.

A opinião anterior da BIG CHANGE sobre descobertas privadas de IA e ciência pública examinou quem controla o acesso aos resultados e às ferramentas. Mesmo uma publicação pública deixa outra questão institucional: pesquisadores têm tempo, independência e incentivos para transformar resultados candidatos em conhecimento confiável? A resposta deve aparecer em replicações financiadas, explicações públicas e correções reconhecidas, não apenas na próxima contagem de manuscritos.

Fontes e outras leituras