Inilarawan ng Oxford ang pakikipagtulungan nito sa OpenAI bilang paraan ng pag-scan sa mga materyal ng aklatan na nasa pampublikong domain upang mas madaling mahanap ng mga mananaliksik. Iniulat ng The Guardian noong Setyembre 26 na inilalarawan sa mga panloob na dokumento ng unibersidad na nakatutulong ang mga na-digitize na materyal sa pagdaragdag ng laman sa training set ng OpenAI. Sinabi sa pahayagan ng tagapagsalita ng Oxford na bukas na ipinabatid ng mga kawani na makadaragdag ng datos sa pagsasanay ang proyekto. Detalyadong ipinapaliwanag sa pampublikong paglalarawan ng proyekto ang pananaliksik sa pag-scan at transcription, ngunit hindi ang ikalawang paggamit na ito.
Ang malaking pagbabago: ginagamit din ang pagdi-digitize para sa pagsasanay ng AI
- Ano ang nagbago: Kinilala ng Oxford na layunin din ng pilot nitong pampublikong pagdi-digitize ang paghahanda ng datos sa pagsasanay, kasunod ng ulat ng The Guardian tungkol sa mga panloob na dokumento. Hindi pa rin tinutukoy sa pampublikong rekord ang modelong sinanay gamit ang materyal ng Bodleian.
- Bakit ito mahalaga: Maaaring magkaroon ang mga aklatan ng digital na koleksiyong nahahanap, habang nagkakaroon naman ang kasosyong kompanya ng materyal para sa pagpapaunlad ng AI. Kailangang malaman ng mga mananaliksik at publiko kung aling koleksiyon ang ginagamit sa bawat layunin upang masuri ang palitan.
- Ano ang dapat bantayan: Sinasabi ng Oxford na nananatili rito ang mga karapatan sa mga scan at plano nitong ilathala nang bukas ang mga na-digitize na materyal. Mas madali sanang suriin ang kaayusan kung may tala sa antas ng koleksiyon kung ano ang ibinahagi sa OpenAI at para sa anong paggamit sa pagsasanay.
Tungkol sa pag-scan at transcription ang pampublikong proyekto
Inilarawan sa anunsyo ng Oxford noong Marso 2025 ang isang pilot para i-digitize ang mga materyal ng Bodleian na nasa pampublikong domain at hindi pa makukuha online. Kabilang sa planong mga koleksiyon ang 3,500 disertasyon mula sa iba’t ibang panig ng mundo, na mula 1498 hanggang 1884, at sinabi nitong mahahanap online at maaabot ng mga estudyante at mananaliksik sa buong mundo ang magiging resulta. Hindi nito binanggit ang paglilipat ng mga materyal sa training set ng OpenAI.
Sinasabi sa pahina ng proyekto ng Bodleian na nagsimula ang pilot noong Pebrero 2025 sa pagpopondo ng OpenAI. Sinusubok sa mga bahagi ng gawain ang kagamitan at mga paraan sa pag-scan, sinusuri kung paano kumukuha ng teksto mula sa mga scan ang optical character recognition at handwriting text recognition, at sinasaliksik ang metadata at paghahanap sa koleksiyon na tinutulungan ng AI. Maaaring makalikha ang mga gawaing ito ng digital na larawan, transcription at tala sa katalogo. Hindi sapat ang pagsubok kung kayang basahin ng sistema ang na-scan na pahina upang patunayan na isinama ang pahina o transcription nito sa dataset para sa pagsasanay ng modelo.
Sinasabi ng Bodleian na nakakuha ito ng humigit-kumulang 125,000 larawan mula sa koleksiyon nitong Global Dissertations at lumikha ng 429,000 pang file mula sa mga kard ng katalogong sulat-kamay. Inilalarawan sa pahina nito ang sample ng disertasyon bilang mga tesis ng PhD mula sa Europa at Amerika noong ika-19 at ika-20 siglo; tinukoy naman sa anunsyo noong 2025 ang 3,500 disertasyong may petsang 1498 hanggang 1884. Hindi ipinapaliwanag sa mga pampublikong pahina kung paano tumutugma ang mga paglalarawang iyon sa na-scan o nailipat na materyal. Bilang ng output ng pagdi-digitize ang mga ito, hindi inilathalang talaan ng datos sa pagsasanay ng OpenAI.
Ano ang pinatutunayan ng bagong pag-uulat
Sinasabi ng The Guardian na ginamit sa mga panloob na dokumento ang pariralang “dagdagan ang laman ng training set ng OpenAI” para sa mga materyal ng Bodleian na na-digitize ng OpenAI. Iniulat din nito na naibahagi na sa OpenAI pagsapit ng Hunyo 2025 ang 125,000 larawan ng mga makasaysayang disertasyon at na kabilang sa iba pang na-scan na teksto ang 10,000 ballad na inilimbag sa malalapad na piraso ng papel noong ika-16 na siglo. Hindi pinatutunayan ng ulat na naging datos sa pagsasanay ang bawat na-scan na ballad. Ayon sa pahayagan, nakatala sa mga katitikan ng pulong ng unibersidad na nakuha sa kahilingan sa ilalim ng batas sa kalayaan ng impormasyon ang pangamba ng mga kawani tungkol sa panganib sa reputasyon at kapaligiran mula sa pakikipagtulungan. Hindi inilabas ang mga panloob na dokumentong iyon sa mga sangguniang nasuri namin, kaya hindi pa namin napapatunayan ang eksaktong pananalita, petsa at saklaw ng mga ito lampas sa ulat ng The Guardian.
Sinabi ng tagapagsalita ng unibersidad sa The Guardian na maliit lamang ang saklaw ng mga materyal na dinidigitize, wala na ang mga ito sa ilalim ng copyright at hindi eksklusibo ang akses ng OpenAI. Sinabi rin niyang nanatili sa Bodleian ang mga karapatan sa mga scan at plano nitong ilathala ang mga ito nang bukas online sa loob ng ilang buwan. Itinanggi rin ng tagapagsalita na itinago ang bahagi tungkol sa machine learning; sinabi niya sa pahayagan na bukas na ipinabatid ng mga kawani na makadaragdag ng datos sa pagsasanay ang proyekto. Sinabi ng OpenAI sa The Guardian na ikinararangal nitong makatulong na maipakita sa mga AI model ang kaalamang pangkasaysayan; inilalarawan sa inilathala nitong anunsyo tungkol sa NextGenAI ang gawain sa Bodleian bilang pagdi-digitize ng mga pambihirang teksto at paggamit ng API nito para i-transcribe ang mga ito.
Kapwa sinusuportahan ng ulat at tugon ng Oxford ang pagsasabing bahagi ng kaayusan ang pag-aambag ng datos sa pagsasanay. Hindi nila itinatakda kung aling mga materyal ng koleksiyon ang inilagay sa aling dataset, kung larawan o transcribed na teksto ang ginamit, kung may inilabas na partikular na modelong sinanay sa mga ito, o kung anong mga tuntunin ang sinusunod ng OpenAI sa muling paggamit. Maaaring buuin ang training set bago sanayin dito ang partikular na modelo. Hindi nililinaw ng pampublikong paglalarawan ng Oxford sa pagdi-digitize o ng anunsyo ng OpenAI noong 2025 ang mga kakulangang ito.
Kailangan pa ng mga rekord upang matukoy ang paggamit sa training
Sinasabi sa pahina ng proyekto ng Oxford na nagplano ang team na maglathala ng ulat na may bukas na akses para sa bawat isa sa limang bahagi ng gawain. Makakatulong sa mga iskolar ang ulat o talaan ng koleksiyon na tumutukoy sa materyal na ibinigay sa OpenAI at naglalarawan sa pinahihintulutang paggamit nito sa pagsasanay upang maihambing ang pakinabang sa akses ng publiko at datos na ibinigay sa kompanya. Hangga’t wala iyon, ang pinakamalinaw na paliwanag tungkol sa ikalawang paggamit ay ang pag-uulat ng The Guardian na nakabatay sa mga dokumento at ang mga tugon dito ng Oxford at OpenAI.
Mga sanggunian at karagdagang babasahin
Ang pagsisiyasat ng The Guardian noong Setyembre 26, 2026 ang pinagmumulan ng pahayag tungkol sa mga panloob na dokumento, iniulat na pagbabahagi ng mga larawan ng disertasyon, pangamba sa mga katitikan ng pulong at mga tugon ng Oxford at OpenAI. Hindi namin nagawang suriin nang nakapag-iisa ang mga pinagbabatayang panloob na dokumento.
Anunsyo ng pakikipagtulungan ng Oxford noong Marso 4, 2025 ang naglalahad ng pilot sa mga materyal na nasa pampublikong domain at planong akses para sa mga mananaliksik. Hindi tinutukoy rito ang paggamit para sanayin ang modelo ng OpenAI.
Detalyado sa pahina ng proyektong Bodleian Digitisation Research ang mga bahagi ng pilot at bilang ng mga larawan. Output sa pagdi-digitize ang mga bilang nito; hindi tinutukoy sa pahina ang dataset para sa pagsasanay o modelong sinanay dito.
Inilalarawan sa anunsyo ng OpenAI noong Marso 4, 2025 tungkol sa NextGenAI ang pagdi-digitize sa Bodleian at transcription gamit ang API nito. Hindi tinutukoy rito ang laman ng training set o modelong sinanay sa mga scan.



