AI-translated from English; not yet reviewed by a fluent editor.
# Оксфорд: оцифровка Бодлианской библиотеки также даёт данные для обучения OpenAI
> По словам Оксфорда, пилотный проект по оцифровке материалов Бодлианской библиотеки предоставляет данные для обучения OpenAI. В открытых описаниях проекта подробно рассказано о сканировании и транскрибировании, но не о переданных материалах или моделях.
By BIG CHANGE Editorial
Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

AI-generated conceptual illustration by BIG CHANGE.
Оксфорд представлял сотрудничество с OpenAI как способ сканировать материалы библиотеки, не защищённые авторским правом, и упростить их поиск для исследователей. [Как сообщила The Guardian 26 сентября](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt), во внутренних документах университета оцифрованные материалы описаны как один из источников для наполнения обучающего набора OpenAI. Представитель Оксфорда сказал изданию, что сотрудники открыто говорили о вкладе проекта в данные для обучения. В публичном описании подробно изложены исследования по сканированию и транскрибированию, но второй способ использования материалов не раскрыт.
## Главное изменение: оцифровка используется и для обучения ИИ
- **Что изменилось:** После публикации The Guardian о внутренних документах Оксфорд подтвердил, что наряду с публичным пилотным проектом по оцифровке у сотрудничества есть цель предоставить данные для обучения. В открытых источниках по-прежнему не названа модель, обученная на материалах Бодлианской библиотеки.
- **Почему это важно:**Библиотеки могут получить коллекции в цифровом и доступном для поиска виде, а технологический партнёр — материалы для разработки ИИ. Чтобы оценить этот обмен, исследователям и общественности важно знать, какие коллекции используются для каждой из этих целей.
- **За чем следить:** Оксфорд заявляет, что сохраняет права на сканы и планирует открыть оцифрованные материалы. Перечень коллекций, переданных OpenAI, и описание разрешённых способов использования для обучения помогли бы яснее оценить договорённость.
## Публичное описание проекта посвящено сканированию и транскрибированию
[В объявлении Оксфорда от марта 2025 года](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) описан пилотный проект по оцифровке материалов Бодлианской библиотеки, не защищённых авторским правом и ранее недоступных онлайн. Среди планируемых коллекций названы 3 500 диссертаций со всего мира, датированных 1498–1884 годами; сообщалось, что результат можно будет искать и что он станет доступен студентам и исследователям по всему миру. Передача материалов в обучающий набор OpenAI в объявлении не упоминалась.
На [странице проекта Бодлианской библиотеки](https://www.bodleian.ox.ac.uk/node/4611321) сказано, что пилот начался в феврале 2025 года при финансовой поддержке OpenAI. В рамках проекта испытывают оборудование и методы сканирования, изучают извлечение текста со сканов с помощью оптического распознавания символов и рукописного текста, а также применение ИИ для создания метаданных и поиска по коллекциям. Результатом этих работ могут быть цифровые изображения, транскрипции и каталожные записи. Проверка того, может ли система прочитать отсканированную страницу, сама по себе не означает, что эта страница или её транскрипция попала в набор данных для обучения модели.
Бодлианская библиотека сообщает, что оцифровала около 125 000 изображений из коллекции Global Dissertations и создала ещё 429 000 файлов на основе рукописных каталожных карточек. На странице проекта выборка диссертаций описана как европейские и американские докторские работы XIX и XX веков; в объявлении 2025 года речь шла о 3 500 диссертациях 1498–1884 годов. В открытых материалах не объясняется, как эти описания соотносятся с отсканированными или переданными материалами. Эти цифры отражают объём оцифровки, а не опубликованный перечень обучающих данных OpenAI.
## Что установило новое расследование
По данным The Guardian, во внутренних документах оцифрованные OpenAI материалы Бодлианской библиотеки описываются словами «наполнить обучающий набор OpenAI». Издание также сообщает, что к июню 2025 года OpenAI передали 125 000 изображений исторических диссертаций, и пишет, что среди других отсканированных текстов были 10 000 баллад, напечатанных на широкоформатных листах в XVI веке. Расследование не устанавливает, что каждая отсканированная баллада стала обучающим материалом. По сообщению газеты, в протоколах университетских совещаний, полученных по запросу о свободе информации, зафиксирована обеспокоенность сотрудников репутационными и экологическими рисками партнёрства. Изучить сами внутренние документы по доступным нам источникам не удалось, поэтому их точная формулировка, даты и охват за пределами пересказа The Guardian здесь не подтверждены.
Представитель университета сказал The Guardian, что оцифровываемые материалы невелики по объёму, не защищены авторским правом и доступны OpenAI на неисключительной основе. По его словам, Бодлианская библиотека сохраняет права на сканы и планирует в течение нескольких месяцев открыть их онлайн. Представитель также отверг предположение, что компонент машинного обучения скрывали: он сказал газете, что сотрудники открыто сообщали о вкладе проекта в данные для обучения. OpenAI заявила The Guardian, что гордится возможностью помочь отразить исторические знания в моделях ИИ; опубликованное [объявление NextGenAI](https://openai.com/index/introducing-nextgenai/) описывает работу Бодлианской библиотеки как оцифровку редких текстов и их транскрибирование с помощью API OpenAI.
В совокупности сообщение газеты и ответ Оксфорда позволяют утверждать, что предоставление данных для обучения входит в эту договорённость. Однако они не устанавливают, какие именно материалы из коллекций попали в какие наборы данных, использовались ли изображения или расшифрованные тексты, обучали ли на них какую-либо выпущенную модель и на каких условиях OpenAI может использовать их повторно. Обучающий набор может быть собран до обучения конкретной модели. Публичное описание проекта по оцифровке от Оксфорда и объявление OpenAI за 2025 год этих пробелов не заполняют.
## Чтобы определить способы использования данных, нужны дополнительные сведения
На странице проекта Оксфорда сказано, что команда планировала опубликовать отчёты в открытом доступе по каждому из пяти направлений работы. Отчёт или перечень коллекций, в котором названы материалы, переданные OpenAI, и описаны разрешённые способы использования для обучения, позволил бы исследователям сопоставить пользу открытого доступа с переданными компании данными. Пока наиболее ясное описание этой второй цели — основанное на документах расследование The Guardian и ответы, которые газете дали Оксфорд и OpenAI.
## Источники и дополнительная литература
Материал [расследования The Guardian от 26 сентября 2026 года](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — источник сведений о внутренних документах, сообщениях о передаче изображений диссертаций, обеспокоенности, зафиксированной в протоколах совещаний, и ответах Оксфорда и OpenAI. Сами внутренние документы мы независимо изучить не могли.
[Объявление Оксфорда о сотрудничестве от 4 марта 2025 года](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) описывает пилот по оцифровке материалов общественного достояния и предполагаемый доступ к ним для исследователей. Использование материалов для обучения моделей OpenAI в нём не уточняется.
Страница [проекта Бодлианской библиотеки «Оцифровка для исследований»](https://www.bodleian.ox.ac.uk/node/4611321) подробно описывает направления пилота и количество изображений. Приведённые цифры относятся к сканированию; на странице не названы обучающий набор данных или модель, обученная на этих материалах.
[Объявление OpenAI о NextGenAI от 4 марта 2025 года](https://openai.com/index/introducing-nextgenai/) описывает оцифровку материалов Бодлианской библиотеки и их транскрибирование с помощью API OpenAI. Содержимое обучающего набора или обученная на сканах модель не указаны.
## Sources
- [The Guardian: «Оксфорд разрешил OpenAI обучать модели ИИ на материалах Бодлианской библиотеки»](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — Расследование от 26 сентября 2026 года основано на внутренних документах и протоколах совещаний университета; в нём также приведены ответы Оксфорда и OpenAI. Сами внутренние документы мы не могли независимо изучить, поэтому сведения о формулировках про обучающий набор и передаче материалов приписаны The Guardian.
- [Оксфорд и OpenAI объявили о сотрудничестве для развития исследований и образования](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — В объявлении Оксфорда от 4 марта 2025 года описан пилот по оцифровке материалов общественного достояния из Бодлианской библиотеки, предполагаемый доступ исследователей и первоначальная коллекция диссертаций. Использование этих данных для обучения не уточняется.
- [Проект Бодлианской библиотеки по оцифровке для исследований](https://www.bodleian.ox.ac.uk/node/4611321) — На публичной странице проекта описаны сканирование, OCR/HTR, метаданные и инструменты поиска, а также приведено число изображений. Это результаты оцифровки, а не опубликованный перечень обучающих материалов OpenAI.
- [OpenAI: «Представляем NextGenAI»](https://openai.com/index/introducing-nextgenai/) — В объявлении OpenAI от 4 марта 2025 года описаны оцифровка материалов Бодлианской библиотеки и их транскрибирование с помощью API. Не указаны ни состав обучающего набора, ни модель, обученная на этих материалах.
Рассылка BIG CHANGE
Общая картина. В вашем темпе.
Свежие материалы об ИИ и робототехнике, важные перемены и практические идеи. Выберите ежедневную сводку, еженедельный дайджест или ежемесячный обзор.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Ваша конфиденциальность — ваш выбор.
Необходимое хранилище помогает защитить сайт и запомнить ваши настройки. Необязательная Google Analytics отключена, пока вы её не разрешите. Все статьи доступны для чтения только с необходимым хранилищем. Подробнее о конфиденциальности