Oxford stellte seine Zusammenarbeit mit OpenAI als Möglichkeit vor, gemeinfreie Bibliotheksmaterialien zu scannen und für Forschende leichter auffindbar zu machen. The Guardian berichtete am 26. September, interne Universitätsdokumente beschrieben das digitalisierte Material jedoch als Beitrag zum Aufbau eines Trainingsdatensatzes von OpenAI. Ein Sprecher Oxfords sagte der Zeitung, die Mitarbeitenden hätten offen kommuniziert, dass das Projekt Trainingsdaten beisteuere. Die öffentliche Projektbeschreibung erläutert Scannen und Transkription ausführlich, lässt diesen zweiten Verwendungszweck jedoch offen.
Die große Veränderung: Digitalisierung dient auch dem KI-Training
- Was sich geändert hat: Nach dem Bericht des Guardian über interne Dokumente hat Oxford eingeräumt, dass neben dem öffentlichen Digitalisierungsprojekt auch die Bereitstellung von Trainingsdaten vorgesehen ist. Aus den öffentlichen Unterlagen geht weiterhin nicht hervor, welches Modell mit Material aus der Bodleian Library trainiert wurde.
- Warum das wichtig ist: Bibliotheken können durchsuchbare digitale Sammlungen erhalten, während ein Technologiepartner Material für die KI-Entwicklung bekommt. Forschende und Öffentlichkeit müssen wissen, welche Bestände welchem Zweck dienen, um den Austausch beurteilen zu können.
- Worauf es ankommt: Oxford zufolge behält die Universität die Rechte an den Scans und plant, die digitalisierten Materialien frei zugänglich zu veröffentlichen. Eine Übersicht nach Sammlungen darüber, was OpenAI erhielt und für welche Trainingszwecke es verwendet werden darf, würde die Vereinbarung leichter bewertbar machen.
Im öffentlichen Projekt geht es um Scannen und Transkription
In seiner Ankündigung vom März 2025 beschrieb Oxford ein Pilotprojekt zur Digitalisierung gemeinfreier Bestände der Bodleian Library, die online noch nicht verfügbar waren. Als vorgesehene Sammlung nannte die Universität 3.500 Dissertationen aus aller Welt aus den Jahren 1498 bis 1884. Das Ergebnis sollte für Studierende und Forschende weltweit durchsuchbar und zugänglich sein. Eine Übertragung in einen Trainingsdatensatz von OpenAI wurde nicht erwähnt.
Die Projektseite der Bodleian Library zufolge begann der Pilot im Februar 2025 mit einer Finanzierung durch OpenAI. Die Arbeitspakete prüfen Scan-Geräte und -Verfahren, untersuchen, wie Texterkennung (OCR) und Handschrifterkennung (HTR) Text aus Scans auslesen, und erproben KI-gestützte Metadaten und die Suche in Sammlungen. Dabei können digitale Bilder, Transkriptionen und Katalogeinträge entstehen. Dass ein System darauf getestet wird, eine gescannte Seite zu lesen, belegt für sich genommen nicht, dass die Seite oder ihre Transkription in einen Datensatz zum Modelltraining gelangte.
Die Bodleian Library gibt an, rund 125.000 Bilder aus ihrer Sammlung „Global Dissertations“ erfasst und weitere 429.000 Dateien aus handschriftlichen Katalogkarten erstellt zu haben. Auf der Projektseite wird die Auswahl an Dissertationen als europäische und amerikanische Promotionen aus dem 19. und 20. Jahrhundert beschrieben; in der Ankündigung von 2025 waren 3.500 Dissertationen aus den Jahren 1498 bis 1884 genannt. Die öffentlichen Seiten erklären nicht, wie diese Angaben den gescannten oder übertragenen Materialien entsprechen. Die Zahlen beschreiben das Digitalisierungsergebnis, keine veröffentlichte Bestandsliste der Trainingsdaten von OpenAI.
Was die neue Berichterstattung belegt
Laut The Guardian bezeichnen interne Dokumente von OpenAI digitalisierte Materialien der Bodleian Library als Beitrag zum „Befüllen des OpenAI-Trainingsdatensatzes“. Die Zeitung berichtet außerdem, bis Juni 2025 seien 125.000 Bilder historischer Dissertationen an OpenAI weitergegeben worden; zu den gescannten Texten hätten auch 10.000 Balladen auf Einblattdrucken aus dem 16. Jahrhundert gehört. Aus dem Bericht geht nicht hervor, dass jeder gescannte Einblattdruck in Trainingsdaten einging. Der Guardian berichtet, dass in über eine Auskunftsanfrage erhaltenen Sitzungsprotokollen Mitarbeitende Bedenken zu den Reputations- und Umweltrisiken der Partnerschaft geäußert hätten. Diese internen Dokumente waren in den von uns einsehbaren Quellen nicht verfügbar; ihr genauer Wortlaut, ihre Datierung und ihr Umfang über die Darstellung des Guardian hinaus bleiben daher ungeprüft.
Ein Sprecher der Universität sagte dem Guardian, das digitalisierte Material sei vom Umfang her begrenzt, gemeinfrei und OpenAI nicht exklusiv zur Verfügung gestellt worden. Die Bodleian Library behalte die Rechte an den Scans und plane, sie innerhalb weniger Monate online frei zugänglich zu machen. Der Sprecher wies auch den Vorwurf zurück, die Komponente des maschinellen Lernens sei verschwiegen worden; Mitarbeitende hätten offen kommuniziert, dass das Projekt Trainingsdaten beisteuern werde. OpenAI sagte dem Guardian, das Unternehmen sei stolz darauf, historisches Wissen in KI-Modellen widerzuspiegeln. In der veröffentlichten Ankündigung zu NextGenAI wird die Arbeit an der Bodleian Library als Digitalisierung seltener Texte und deren Transkription über die OpenAI-API beschrieben.
Zusammengenommen stützen der Bericht und Oxfords Stellungnahme die Aussage, dass ein Beitrag zu Trainingsdaten Teil dieser Vereinbarung ist. Sie belegen aber nicht, welche Sammlungsstücke in welche Datensätze gelangten, ob Bilder oder transkribierte Texte verwendet wurden, ob ein bestimmtes veröffentlichtes Modell damit trainiert wurde oder unter welchen Bedingungen OpenAI das Material wiederverwenden darf. Ein Trainingsdatensatz kann zusammengestellt werden, bevor ein konkretes Modell damit trainiert wird. Oxfords öffentliche Beschreibung der Digitalisierung und OpenAIs Ankündigung von 2025 schließen diese Informationslücken nicht.
Es braucht weiterhin Unterlagen, die den Einsatz für das Training nachvollziehbar machen
Laut der Projektseite Oxfords plante das Team frei zugängliche Berichte zu jedem seiner fünf Arbeitspakete. Ein Bericht oder Bestandsverzeichnis, das die an OpenAI übermittelten Materialien nennt und die zulässigen Trainingszwecke beschreibt, würde es Forschenden ermöglichen, den Nutzen für den öffentlichen Zugang mit den an das Unternehmen gelieferten Daten zu vergleichen. Bis dahin ist die klarste Darstellung dieses zweiten Verwendungszwecks die dokumentengestützte Berichterstattung des Guardian sowie die Stellungnahmen, die Oxford und OpenAI der Zeitung gaben.
Quellen und weiterführende Informationen
Die Untersuchung des Guardian vom 26. September 2026 ist die Quelle für den Hinweis auf interne Dokumente, die berichtete Weitergabe von Bildern der Dissertationen, die Bedenken aus Sitzungsprotokollen sowie die Antworten von Oxford und OpenAI. Die zugrunde liegenden internen Dokumente standen uns nicht zur unabhängigen Prüfung zur Verfügung.
Ankündigung der Zusammenarbeit von Oxford vom 4. März 2025 beschreibt das Pilotprojekt mit gemeinfreien Materialien und den geplanten Zugang für Forschende. Eine Nutzung zum Training eines OpenAI-Modells wird darin nicht genannt.
Die Projektseite zur Digitalisierungsforschung der Bodleian Library erläutert die Arbeitspakete und die Zahl der erstellten Bilder. Die Angaben beschreiben das Ergebnis der Digitalisierung; die Seite nennt weder einen Trainingsdatensatz noch ein damit trainiertes Modell.
Ankündigung von OpenAI zu NextGenAI vom 4. März 2025 beschreibt die Digitalisierung und Transkription mit der API der Bodleian Library. Sie nennt weder Inhalte eines Trainingsdatensatzes noch ein mit den Scans trainiertes Modell.



