L’Association for Human Mathematics (AHM) a exhorté les mathématiciens à cesser de travailler avec OpenAI après que l’entreprise a publié, le 6 octobre, un vaste ensemble de travaux mathématiques générés par l’IA. Dans sa déclaration du 7 octobre, l’objection centrale du groupe porte sur l’utilisation d’un modèle privé pour traiter des problèmes ouverts avancés, puis sur la publication simultanée de centaines d’articles qui en résultent. Il conteste l’affirmation d’OpenAI selon laquelle ce mode de publication fait progresser les mathématiques, même si les fichiers publics permettent d’examiner les affirmations une par une.

Il s’agit de la position du groupe de travail sur les communications de l’AHM. Ce n’est ni un vote de la communauté mathématique ni une conclusion selon laquelle chaque manuscrit serait erroné. Terence Tao a republié le texte comme déclaration invitée de l’AHM, en précisant qui en était l’auteur plutôt qu’en l’adoptant comme sa propre déclaration.

Le grand changement

  • Ce qui a changé : Le débat sur le dépôt d’OpenAI dépasse désormais la validité de résultats individuels. L’AHM conteste le rôle de l’entreprise dans le choix des problèmes de recherche et dans la définition des conditions auxquelles les mathématiciens reçoivent les résultats.
  • Pourquoi c’est important : Le différend porte sur les personnes autorisées à examiner l’outil générateur et sur celles qui doivent vérifier et expliquer une publication massive. Ces questions subsistent même lorsqu’une preuve particulière est corrigée ou formalisée.
  • À suivre : OpenAI affirme qu’elle ajoutera des formalisations. L’évaluation indépendante des affirmations révisées et d’éventuelles corrections ultérieures accompagnées de versions permettront de préciser quels résultats particuliers les mathématiciens peuvent vérifier et comprendre.

Ce que conteste l’AHM

L’AHM affirme que les mathématiciens n’ont pas demandé ces travaux. Elle qualifie la publication de plus de 700 fichiers de démonstration de puissance plutôt que de contribution scientifique, et invite les lecteurs à douter de sa valeur pour la discipline. La déclaration cite également le groupe consultatif indépendant sur les mathématiques et l’intelligence artificielle (AGMAI), affirmant qu’OpenAI a ignoré la demande initiale de ce groupe d’arrêter les essais de mathématiques avancées sur des modèles internes.

Cette référence repose sur un texte précis. Les lignes directrices de l’AGMAI du 29 septembre recommandent aux laboratoires de pointe de cesser de tester des problèmes avancés sur des modèles propriétaires. Le même document formule ensuite des recommandations conditionnelles pour publier des résultats si les laboratoires les ont déjà produits : rédaction mathématique claire, dépôts appropriés, transparence sur la manière dont les travaux ont été générés, formalisation lorsque c’est possible et soutien à la compréhension humaine. Il indique que ses recommandations s’appuyaient sur plus de 600 réponses à une enquête et bénéficiaient du soutien d’une pluralité des répondants. Ces faits ne transforment pas l’appel ultérieur de l’AHM à cesser de travailler avec OpenAI en directive de l’AGMAI ni en décision de toute la discipline.

Dans sa réponse du 6 octobre à la publication, l’AGMAI a explicitement précisé que son rôle consultatif n’impliquait ni approbation du processus d’OpenAI ni jugement sur l’impact des résultats. Le groupe a décrit la publication comme le début de l’évaluation humaine, tout en indiquant que seule la communauté mathématique peut déterminer dans quelle mesure ses recommandations ont été suivies. Auparavant, OpenAI avait décrit le groupe comme indépendant et indiqué qu’il conseillerait l’entreprise sur l’examen et la communication, sans contrôler le rythme de ses recherches internes. La distinction entre conseil et autorité importe ici : la critique de l’AHM remet en cause les choix d’OpenAI, mais ne prouve pas qu’un conseil extérieur les ait approuvés ou rejetés.

Un dossier qui évolue reste un dossier à vérifier

Le dépôt indique que les travaux de la collection se trouvent à différents stades de vérification. Son catalogue actuel compte 719 manuscrits répartis en 372 familles. Une famille peut réunir plusieurs articles. Le dépôt indique que certains manuscrits ne disposent pas de formalisation Lean et que certains résultats non formalisés peuvent comporter des problèmes ; il affirme qu’environ 42 % des résultats principaux sont formalisés. Une formalisation est un argument spécifié et vérifiable par machine pour un énoncé précis, et non une confirmation globale de toutes les affirmations d’un article ; le statut dans un dépôt ne remplace pas un examen mathématique indépendant. Notre précédent parcours des fichiers et des configurations de preuve explique comment en suivre la portée.

Le nombre a changé après le retrait de trois manuscrits. Dans son historique du 7 octobre , OpenAI attribue ces retraits à une erreur de signe dans une preuve qui touchait également deux articles dépendants. L’entrée consigne les révisions de 14 autres manuscrits, des mises à jour de références dans 13 autres et six formalisation supplémentaires. Notre article sur les trois avis de retrait présente la conclusion plus limitée : les arguments signalés n’établissent plus les affirmations de ces articles ; les avis ne réfutent pas les énoncés mathématiques. Une preuve retirée, un manuscrit corrigé et un résultat formalisé sont des statuts différents.

Les révisions illustrent le travail d’examen qu’une collection vaste et inégalement formalisée peut nécessiter. Il s’agit de notre analyse du dossier du dépôt, et non d’une affirmation de la déclaration de l’AHM. L’AHM s’oppose à la décision de générer et de publier la collection au moyen d’un modèle propriétaire. OpenAI, de son côté, a fourni des éléments versionnés que les chercheurs peuvent examiner, corriger et débattre. Notre analyse antérieure de la capacité d’examen traitait du travail nécessaire pour transformer un vaste ensemble de résultats proposés en connaissances mathématiques comprises. Le différend actuel pose une question plus précise : produire un tel volume de travaux de cette manière sert-il les personnes chargées de les évaluer ?

Sources et lectures complémentaires