Оксфорд представлял сотрудничество с OpenAI как способ сканировать материалы библиотеки, не защищённые авторским правом, и упростить их поиск для исследователей. Как сообщила The Guardian 26 сентября, во внутренних документах университета оцифрованные материалы описаны как один из источников для наполнения обучающего набора OpenAI. Представитель Оксфорда сказал изданию, что сотрудники открыто говорили о вкладе проекта в данные для обучения. В публичном описании подробно изложены исследования по сканированию и транскрибированию, но второй способ использования материалов не раскрыт.
Главное изменение: оцифровка используется и для обучения ИИ
- Что изменилось: После публикации The Guardian о внутренних документах Оксфорд подтвердил, что наряду с публичным пилотным проектом по оцифровке у сотрудничества есть цель предоставить данные для обучения. В открытых источниках по-прежнему не названа модель, обученная на материалах Бодлианской библиотеки.
- Почему это важно:Библиотеки могут получить коллекции в цифровом и доступном для поиска виде, а технологический партнёр — материалы для разработки ИИ. Чтобы оценить этот обмен, исследователям и общественности важно знать, какие коллекции используются для каждой из этих целей.
- За чем следить: Оксфорд заявляет, что сохраняет права на сканы и планирует открыть оцифрованные материалы. Перечень коллекций, переданных OpenAI, и описание разрешённых способов использования для обучения помогли бы яснее оценить договорённость.
Публичное описание проекта посвящено сканированию и транскрибированию
В объявлении Оксфорда от марта 2025 года описан пилотный проект по оцифровке материалов Бодлианской библиотеки, не защищённых авторским правом и ранее недоступных онлайн. Среди планируемых коллекций названы 3 500 диссертаций со всего мира, датированных 1498–1884 годами; сообщалось, что результат можно будет искать и что он станет доступен студентам и исследователям по всему миру. Передача материалов в обучающий набор OpenAI в объявлении не упоминалась.
На странице проекта Бодлианской библиотеки сказано, что пилот начался в феврале 2025 года при финансовой поддержке OpenAI. В рамках проекта испытывают оборудование и методы сканирования, изучают извлечение текста со сканов с помощью оптического распознавания символов и рукописного текста, а также применение ИИ для создания метаданных и поиска по коллекциям. Результатом этих работ могут быть цифровые изображения, транскрипции и каталожные записи. Проверка того, может ли система прочитать отсканированную страницу, сама по себе не означает, что эта страница или её транскрипция попала в набор данных для обучения модели.
Бодлианская библиотека сообщает, что оцифровала около 125 000 изображений из коллекции Global Dissertations и создала ещё 429 000 файлов на основе рукописных каталожных карточек. На странице проекта выборка диссертаций описана как европейские и американские докторские работы XIX и XX веков; в объявлении 2025 года речь шла о 3 500 диссертациях 1498–1884 годов. В открытых материалах не объясняется, как эти описания соотносятся с отсканированными или переданными материалами. Эти цифры отражают объём оцифровки, а не опубликованный перечень обучающих данных OpenAI.
Что установило новое расследование
По данным The Guardian, во внутренних документах оцифрованные OpenAI материалы Бодлианской библиотеки описываются словами «наполнить обучающий набор OpenAI». Издание также сообщает, что к июню 2025 года OpenAI передали 125 000 изображений исторических диссертаций, и пишет, что среди других отсканированных текстов были 10 000 баллад, напечатанных на широкоформатных листах в XVI веке. Расследование не устанавливает, что каждая отсканированная баллада стала обучающим материалом. По сообщению газеты, в протоколах университетских совещаний, полученных по запросу о свободе информации, зафиксирована обеспокоенность сотрудников репутационными и экологическими рисками партнёрства. Изучить сами внутренние документы по доступным нам источникам не удалось, поэтому их точная формулировка, даты и охват за пределами пересказа The Guardian здесь не подтверждены.
Представитель университета сказал The Guardian, что оцифровываемые материалы невелики по объёму, не защищены авторским правом и доступны OpenAI на неисключительной основе. По его словам, Бодлианская библиотека сохраняет права на сканы и планирует в течение нескольких месяцев открыть их онлайн. Представитель также отверг предположение, что компонент машинного обучения скрывали: он сказал газете, что сотрудники открыто сообщали о вкладе проекта в данные для обучения. OpenAI заявила The Guardian, что гордится возможностью помочь отразить исторические знания в моделях ИИ; опубликованное объявление NextGenAI описывает работу Бодлианской библиотеки как оцифровку редких текстов и их транскрибирование с помощью API OpenAI.
В совокупности сообщение газеты и ответ Оксфорда позволяют утверждать, что предоставление данных для обучения входит в эту договорённость. Однако они не устанавливают, какие именно материалы из коллекций попали в какие наборы данных, использовались ли изображения или расшифрованные тексты, обучали ли на них какую-либо выпущенную модель и на каких условиях OpenAI может использовать их повторно. Обучающий набор может быть собран до обучения конкретной модели. Публичное описание проекта по оцифровке от Оксфорда и объявление OpenAI за 2025 год этих пробелов не заполняют.
Чтобы определить способы использования данных, нужны дополнительные сведения
На странице проекта Оксфорда сказано, что команда планировала опубликовать отчёты в открытом доступе по каждому из пяти направлений работы. Отчёт или перечень коллекций, в котором названы материалы, переданные OpenAI, и описаны разрешённые способы использования для обучения, позволил бы исследователям сопоставить пользу открытого доступа с переданными компании данными. Пока наиболее ясное описание этой второй цели — основанное на документах расследование The Guardian и ответы, которые газете дали Оксфорд и OpenAI.
Источники и дополнительная литература
Материал расследования The Guardian от 26 сентября 2026 года — источник сведений о внутренних документах, сообщениях о передаче изображений диссертаций, обеспокоенности, зафиксированной в протоколах совещаний, и ответах Оксфорда и OpenAI. Сами внутренние документы мы независимо изучить не могли.
Объявление Оксфорда о сотрудничестве от 4 марта 2025 года описывает пилот по оцифровке материалов общественного достояния и предполагаемый доступ к ним для исследователей. Использование материалов для обучения моделей OpenAI в нём не уточняется.
Страница проекта Бодлианской библиотеки «Оцифровка для исследований» подробно описывает направления пилота и количество изображений. Приведённые цифры относятся к сканированию; на странице не названы обучающий набор данных или модель, обученная на этих материалах.
Объявление OpenAI о NextGenAI от 4 марта 2025 года описывает оцифровку материалов Бодлианской библиотеки и их транскрибирование с помощью API OpenAI. Содержимое обучающего набора или обученная на сканах модель не указаны.



