Oxford a présenté sa collaboration avec OpenAI comme un moyen de numériser des documents de bibliothèque du domaine public et d’en faciliter la recherche par les chercheurs. The Guardian a publié un article le 26 septembre indiquant que des documents internes de l’université décrivent les documents numérisés comme contribuant à alimenter un jeu de données d’entraînement d’OpenAI. Un porte-parole d’Oxford a déclaré au journal que le personnel avait été transparent sur la contribution du projet aux données d’entraînement. La description publique du projet explique en détail les travaux de numérisation et de transcription, mais ne précise pas ce second usage.
Le grand changement : la numérisation contribue aussi à l’entraînement de l’IA
- Ce qui a changé : Après l’article du Guardian sur des documents internes, Oxford a reconnu que son projet pilote public de numérisation avait aussi une finalité de contribution aux données d’entraînement. Les documents publics ne précisent toujours pas quel modèle aurait été entraîné à partir de documents du Bodleian.
- Pourquoi c’est important : Les bibliothèques peuvent rendre leurs collections numériques consultables, tandis qu’un partenaire technologique obtient des documents pour développer l’IA. Les chercheurs et le public doivent savoir quelles collections servent à chaque usage afin d’évaluer les contreparties.
- À suivre : Oxford affirme conserver les droits sur les numérisations et prévoit de publier les documents numérisés en accès libre. Un inventaire par collection des documents transmis à OpenAI et des usages d’entraînement autorisés faciliterait l’évaluation de l’accord.
Le projet public porte sur la numérisation et la transcription
L’annonce d’Oxford de mars 2025 décrivait un projet pilote visant à numériser des documents du domaine public du Bodleian qui n’étaient pas accessibles en ligne. Elle citait 3 500 thèses internationales datées de 1498 à 1884 parmi les collections visées et indiquait que le résultat serait consultable et accessible aux étudiants et aux chercheurs du monde entier. Elle ne faisait pas état d’un transfert de documents vers un jeu de données d’entraînement d’OpenAI.
La page du projet du Bodleian indique que le projet pilote a commencé en février 2025 grâce à un financement d’OpenAI. Ses volets de recherche testent le matériel et les méthodes de numérisation, étudient l’extraction de texte à partir d’images avec la reconnaissance optique de caractères et la reconnaissance d’écriture manuscrite, et explorent l’usage de l’IA pour les métadonnées et la recherche dans les collections. Ces travaux peuvent produire des images numériques, des transcriptions et des notices de catalogue. Le fait de tester si un système peut lire une page numérisée n’établit pas, à lui seul, que cette page ou sa transcription a intégré un jeu de données d’entraînement.
Le Bodleian indique avoir capturé environ 125 000 images de sa collection Global Dissertations et créé 429 000 fichiers supplémentaires à partir de fiches de catalogue manuscrites. Sa page décrit l’échantillon de thèses comme composé de thèses de doctorat européennes et américaines des XIXe et XXe siècles ; l’annonce de 2025 identifiait 3 500 thèses datées de 1498 à 1884. Les pages publiques n’expliquent pas comment ces descriptions correspondent aux documents numérisés ou transférés. Ces chiffres décrivent les résultats de la numérisation, et non un inventaire publié des données d’entraînement d’OpenAI.
Ce qu’apporte la nouvelle enquête
Selon The Guardian, des documents internes utilisent l’expression « alimenter le jeu de données d’entraînement d’OpenAI » pour désigner des documents du Bodleian numérisés par OpenAI. Le journal rapporte également que 125 000 images de thèses historiques avaient été communiquées à OpenAI en juin 2025 et indique que d’autres textes numérisés comprenaient 10 000 ballades en feuilles volantes du XVIe siècle. L’article n’établit pas que toutes les ballades numérisées sont devenues des données d’entraînement. Le journal indique que des procès-verbaux de réunions universitaires obtenus grâce à une demande d’accès à l’information consignent les préoccupations du personnel concernant les risques pour la réputation et l’environnement liés au partenariat. Les documents internes n’étaient pas disponibles parmi les sources que nous avons pu consulter ; leur formulation précise, leurs dates et leur portée au-delà du récit du Guardian restent donc ici non vérifiées.
Un porte-parole de l’université a déclaré au Guardian que les documents numérisés étaient d’ampleur modeste, libres de droits et accessibles à OpenAI à titre non exclusif. Il a indiqué que le Bodleian conservait les droits sur les numérisations et prévoyait de les publier en accès libre en ligne dans les mois à venir. Le porte-parole a également rejeté l’idée que le volet d’apprentissage automatique ait été caché, déclarant au journal que le personnel avait été transparent sur le fait que le projet contribuerait aux données d’entraînement. OpenAI a dit au Guardian être fier de contribuer à la représentation des connaissances historiques dans les modèles d’IA ; son annonce de NextGenAI décrit le travail du Bodleian comme un projet de numérisation de textes rares et d’utilisation de son API pour les transcrire.
Pris ensemble, l’article du Guardian et la réponse d’Oxford permettent d’affirmer qu’une contribution aux données d’entraînement fait partie de cet accord. Ils n’établissent pas quels documents de chaque collection ont été versés à quels jeux de données, si les images ou le texte transcrit ont été utilisés, si un modèle déjà publié a été entraîné à partir de ces éléments ou selon quelles conditions OpenAI peut les réutiliser. Un jeu de données d’entraînement peut être constitué avant l’entraînement d’un modèle particulier. La description publique de la numérisation par Oxford et l’annonce d’OpenAI de 2025 ne comblent pas ces lacunes.
Les documents qui restent nécessaires pour préciser l’usage des données
La page du projet d’Oxford indique que l’équipe prévoyait de publier des rapports en accès libre sur chacun de ses cinq volets de recherche. Un rapport ou un inventaire des collections précisant quels documents ont été fournis à OpenAI et quels usages d’entraînement sont autorisés permettrait aux chercheurs de comparer les bénéfices de l’accès public aux données fournies à l’entreprise. D’ici là, le récit le plus précis sur ce second usage reste l’enquête du Guardian fondée sur des documents, ainsi que les réponses d’Oxford et d’OpenAI.
Sources et lectures complémentaires
L’enquête du Guardian du 26 septembre 2026 est la source des affirmations concernant les documents internes, la communication rapportée d’images de thèses, les préoccupations consignées dans des procès-verbaux ainsi que les réponses d’Oxford et d’OpenAI. Nous n’avons pas pu consulter les documents internes sous-jacents de manière indépendante.
L’annonce de collaboration publiée par Oxford le 4 mars 2025 décrit le projet pilote de numérisation de documents du domaine public et l’accès prévu pour les chercheurs. Elle ne précise pas d’usage pour l’entraînement d’un modèle d’OpenAI.
La page du projet Bodleian Digitisation Research détaille les volets du projet pilote et le nombre d’images. Ses chiffres décrivent les résultats de la numérisation ; la page n’identifie ni jeu de données d’entraînement ni modèle entraîné à partir de ces documents.
L’annonce de NextGenAI publiée par OpenAI le 4 mars 2025 décrit la numérisation au Bodleian et la transcription à l’aide de son API. Elle n’identifie ni le contenu d’un jeu de données d’entraînement ni un modèle entraîné à partir des documents numérisés.



