СВЕТ НЕ СТОЈИ У МЕСТУ.RSS
BIG CHANGE.

Markdown издање

AI-translated from English; not yet reviewed by a fluent editor.

# Оксфорд наводи да дигитализација Бодлејске библиотеке доприноси и подацима за обучавање OpenAI модела

> Оксфорд наводи да његов пилот-пројекат дигитализације Бодлејске библиотеке доприноси подацима за обучавање OpenAI модела. Јавни записи о пројекту детаљно описују скенирање и транскрипцију, али не и грађу или моделе који су у то укључени.

By BIG CHANGE Editorial

Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

![An unidentified open bound volume rests in an archival cradle beneath a mounted document camera, with library shelves behind it.](https://bigchange.ai/api/media/file/oxford-bodleian-digitisation-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Оксфорд је представио сарадњу са OpenAI као начин да се грађа библиотеке која је у јавном домену скенира и учини лакше претраживом истраживачима. [The Guardian је 26. септембра известио](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) да интерни универзитетски документи описују дигитализовану грађу као допринос попуњавању скупа података за обучавање OpenAI модела. Портпарол Оксфорда рекао је новинама да су запослени отворено говорили о томе да пројекат доприноси подацима за обучавање. Јавни опис пројекта детаљно објашњава истраживање скенирања и транскрипције, али не разјашњава ту другу намену.

## Велика промена: дигитализација служи и за обучавање вештачке интелигенције

- **Шта се променило:** Оксфорд је потврдио да пројекат, поред јавног пилота дигитализације, има и намену прикупљања података за обучавање, након извештаја листа The Guardian о интерним документима. Јавни записи и даље не наводе ниједан модел обучаван на грађи Бодлејске библиотеке.
- **Зашто је то важно:** Библиотеке могу да добију претраживе дигиталне збирке, док технолошки партнер добија грађу за развој вештачке интелигенције. Истраживачи и јавност треба да знају које збирке служе којој намени како би могли да процене шта се овом разменом добија.
- **На шта обратити пажњу:** Оксфорд наводи да задржава права на скениране материјале и планира да дигитализовану грађу објави за слободан приступ. Попис на нивоу збирки, који би показао шта је подељено са OpenAI и за коју намену обучавања, олакшао би процену овог аранжмана.

## Јавни пројекат се бави скенирањем и транскрипцијом

[У саопштењу Оксфорда из марта 2025. године](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) описан је пилот за дигитализацију грађе Бодлејске библиотеке која је у јавном домену, а дотад није била доступна на интернету. Међу планираним збиркама наведене су 3.500 докторских дисертација из целог света, насталих од 1498. до 1884. године; најављено је да ће резултат бити претражив и доступан студентима и истраживачима широм света. У саопштењу није описан пренос грађе у скуп података за обучавање OpenAI модела.

На [страници пројекта Бодлејске библиотеке](https://www.bodleian.ox.ac.uk/node/4611321) пише да је пилот почео у фебруару 2025. уз финансирање компаније OpenAI. У оквиру пројекта тестирају се опрема и методе за скенирање, испитује како оптичко препознавање знакова и препознавање рукописног текста издвајају текст из скенираних страница и истражују могућности вештачке интелигенције за унос метаподатака и претраживање збирки. Ти задаци могу да произведу дигиталне слике, транскрипте и каталошке записе. Провера да ли систем може да прочита скенирану страницу сама по себи не доказује да су страница или њен транскрипт уврштени у скуп података за обучавање модела.

Бодлејска библиотека наводи да је из збирке светских дисертација направљено око 125.000 снимака и још 429.000 датотека од каталошких картица писаних руком. На њеној страници узорак дисертација описан је као корпус европских и америчких докторских теза из 19. и 20. века; у саопштењу из 2025. наведено је 3.500 дисертација насталих од 1498. до 1884. Јавне странице не објашњавају како се ти описи односе на скенирану или пренету грађу. Наведени бројеви описују резултате дигитализације, а не објављени попис података за обучавање OpenAI модела.

## Шта открива нови извештај

The Guardian наводи да се у интерним документима за грађу Бодлејске библиотеке коју је дигитализовао OpenAI користи формулација „попунити скуп података за обучавање OpenAI модела“. Лист такође извештава да је до јуна 2025. OpenAI-ју подељено 125.000 снимака историјских дисертација и да су међу осталим скенираним текстовима биле и баладе на широким листовима из 16. века — њих 10.000. Извештај не утврђује да је свака скенирана балада постала део података за обучавање. Према листу, записници са универзитетских састанака добијени захтевом за приступ информацијама бележе забринутост запослених због репутационих ризика и утицаја сарадње на животну средину. Интерни документи нису били доступни у изворима које смо могли да проверимо, па њихове тачне формулације, датуми и обим, осим онога што наводи The Guardian, овде остају непроверени.

Портпарол универзитета рекао је листу The Guardian да је грађа која се дигитализује скромног обима, да више није заштићена ауторским правом и да је доступна OpenAI-ју на неискључивој основи. Портпарол је навео да Бодлејска библиотека задржава права на снимке и планира да их у наредним месецима слободно објави на интернету. Одбацио је и тврдњу да је компонента машинског учења била скривена: рекао је да су запослени отворено говорили о томе да ће пројекат доприносити подацима за обучавање. OpenAI је за The Guardian рекао да је поносан што доприноси томе да се историјско знање одрази у моделима вештачке интелигенције; његово објављено саопштење о иницијативи [NextGenAI](https://openai.com/index/introducing-nextgenai/) описује рад Бодлејске библиотеке као дигитализацију ретких текстова и њихову транскрипцију помоћу API-ја компаније.

Када се посматрају заједно, извештај и одговор Оксфорда подржавају закључак да је допринос подацима за обучавање део овог аранжмана. Ипак, не утврђују који су предмети из којих збирки стављени у одређени скуп података, да ли су коришћени снимци или транскрибовани текст, да ли је неки конкретан објављени модел обучаван на њима нити под којим условима OpenAI може поново да их користи. Скуп података за обучавање може бити припремљен пре обучавања одређеног модела. Јавни опис дигитализације Оксфорда и саопштење OpenAI-ја из 2025. не разрешавају ове недоумице.

## Потребни су записи који прецизно показују намену за обучавање

На страници пројекта Оксфорда пише да је тим планирао извештаје о сваком од пет радних токова, доступне јавности. Извештај или попис збирки који именује грађу достављену OpenAI-ју и описује дозвољене намене за обучавање омогућио би научницима да упореде корист од јавног приступа са подацима уступљеним компанији. До тада је најјаснији опис те друге намене онај из документима поткрепљеног извештавања листа The Guardian и одговора које су му дали Оксфорд и OpenAI.

## Извори и додатна литература

Истрага листа [The Guardian од 26. септембра 2026.](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) главни је извор за тврдњу засновану на интерним документима, пријављено дељење снимака дисертација, забринутост забележену у записницима са састанака и одговоре Оксфорда и OpenAI-ја. Основни интерни документи нису били доступни за нашу независну проверу.

[Саопштење Оксфорда о сарадњи од 4. марта 2025.](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) описује пилот за грађу у јавном домену и планирани приступ истраживача. Не наводи да ће се модел OpenAI обучавати на тој грађи.

Страница [Страница пројекта за истраживање дигитализације Бодлејске библиотеке](https://www.bodleian.ox.ac.uk/node/4611321) детаљно описује радне токове пилота и број дигиталних снимака. Ти подаци односе се на резултате скенирања; на страници се не наводе скуп података за обучавање нити модел обучаван на њему.

[Саопштење OpenAI-ја о иницијативи NextGenAI од 4. марта 2025.](https://openai.com/index/introducing-nextgenai/) описује дигитализацију и транскрипцију помоћу API-ја у Бодлејској библиотеци. Не наводи садржај скупа података за обучавање нити модел обучаван на снимцима.

## Sources

- [The Guardian: Оксфорд дозвољава OpenAI-ју да обучава моделе вештачке интелигенције на грађи Бодлејске библиотеке](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — Изворно новинарско истраживање од 26. септембра 2026. о интерним документима и записницима са универзитетских састанака; садржи одговоре Оксфорда и OpenAI-ја. Основни интерни документи нису били доступни за нашу независну проверу, па су формулације о скупу података за обучавање и детаљи о дељењу приписани листу The Guardian.
- [Оксфорд и OpenAI покрећу сарадњу ради напретка у истраживању и образовању](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — Саопштење Оксфорда од 4. марта 2025. описује пилот за дигитализацију грађе Бодлејске библиотеке у јавном домену, планирани приступ истраживача и почетну збирку дисертација. Не наводи употребу за податке за обучавање.
- [Истраживачки пројекат дигитализације Бодлејске библиотеке](https://www.bodleian.ox.ac.uk/node/4611321) — Јавна страница Бодлејске библиотеке описује скенирање, оптичко препознавање знакова и рукописног текста, метаподатке и претраживање збирки, као и број дигиталних снимака. То су резултати дигитализације, а не објављени попис материјала за обучавање OpenAI модела.
- [OpenAI: Представљамо NextGenAI](https://openai.com/index/introducing-nextgenai/) — Саопштење OpenAI-ја од 4. марта 2025. описује дигитализацију грађе Бодлејске библиотеке и транскрипцију помоћу API-ја компаније. Не наводи скуп података за обучавање нити модел обучаван на тој грађи.