AI-translated from English; not yet reviewed by a fluent editor.
# Oxfordच्या मते Bodleianचे डिजिटायझेशन OpenAIच्या प्रशिक्षण डेटालाही हातभार लावते
> Oxford सांगते की Bodleianमधील डिजिटायझेशनच्या प्रायोगिक प्रकल्पातून OpenAIला प्रशिक्षण डेटा मिळतो. सार्वजनिक प्रकल्प नोंदींमध्ये स्कॅनिंग आणि लिप्यंतरणाचे तपशील आहेत; मात्र कोणती सामग्री किंवा कोणती मॉडेल्स यात समाविष्ट आहेत हे स्पष्ट नाही.
By BIG CHANGE Editorial
Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

AI-generated conceptual illustration by BIG CHANGE.
Oxfordने OpenAIसोबतचे काम सार्वजनिक क्षेत्रातील ग्रंथालय साहित्य स्कॅन करून संशोधकांना ते शोधणे सोपे करण्याचा मार्ग म्हणून मांडले. [26 सप्टेंबरच्या The Guardian च्या वृत्तानुसार](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) विद्यापीठाच्या अंतर्गत कागदपत्रांमध्ये डिजिटाइझ केलेली सामग्री OpenAIचा प्रशिक्षण संच तयार करण्यास मदत करते, असे म्हटले आहे. Oxfordच्या प्रवक्त्याने वृत्तपत्राला सांगितले की या प्रकल्पातून प्रशिक्षण डेटा मिळणार असल्याची माहिती कर्मचारी उघडपणे देत होते. सार्वजनिक प्रकल्प-वर्णनात स्कॅनिंग आणि लिप्यंतरणाच्या संशोधनाचा तपशील आहे, पण हा दुसरा उपयोग स्पष्ट केलेला नाही.
## मोठा बदल: डिजिटायझेशनचा उपयोग आता AI प्रशिक्षणासाठीही
- **काय बदलले:** अंतर्गत कागदपत्रांबद्दल The Guardian ने दिलेल्या वृत्तानंतर, सार्वजनिक डिजिटायझेशन प्रकल्पाबरोबर प्रशिक्षण डेटाचा उद्देशही असल्याचे Oxfordने मान्य केले आहे. Bodleianच्या सामग्रीवर प्रशिक्षित केलेले कोणते मॉडेल आहे, हे सार्वजनिक नोंदींत अद्याप नमूद नाही.
- **हे का महत्त्वाचे:** ग्रंथालयांना शोधता येण्याजोगे डिजिटल संग्रह मिळू शकतात, तर तंत्रज्ञान भागीदाराला AI विकासासाठी सामग्री मिळते. या प्रत्येक उद्देशासाठी कोणते संग्रह वापरले जातात हे संशोधक आणि जनतेला कळणे आवश्यक आहे, तेव्हाच या देवाणघेवाणीचे मूल्यमापन करता येईल.
- **कशाकडे लक्ष द्यावे:** Oxford सांगते की स्कॅनवरील हक्क त्यांच्याकडे राहतील आणि डिजिटाइझ केलेली सामग्री खुली प्रकाशित करण्याची त्यांची योजना आहे. OpenAIसोबत नेमकी कोणती सामग्री सामायिक केली आणि ती कोणत्या प्रशिक्षणासाठी वापरली जाणार, याची संग्रहनिहाय यादी या व्यवस्थेचे मूल्यमापन सोपे करेल.
## सार्वजनिक प्रकल्प स्कॅनिंग आणि लिप्यंतरणाविषयी आहे
[Oxfordच्या मार्च 2025 मधील घोषणेत](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) ऑनलाइन उपलब्ध नसलेले सार्वजनिक क्षेत्रातील Bodleian साहित्य डिजिटाइझ करण्याच्या प्रायोगिक प्रकल्पाचे वर्णन होते. 1498 ते 1884 या काळातील 3,500 जागतिक प्रबंध हे उद्दिष्ट संग्रहांपैकी एक असल्याचे त्यात नमूद होते; परिणामी सामग्री जगभरातील विद्यार्थी आणि संशोधकांना शोधता व वापरता येईल, असेही सांगितले होते. OpenAIच्या प्रशिक्षण संचात सामग्री हस्तांतरित करण्याचा उल्लेख त्यात नव्हता.
या [Bodleianच्या प्रकल्प-पानानुसार](https://www.bodleian.ox.ac.uk/node/4611321) प्रायोगिक प्रकल्प फेब्रुवारी 2025 मध्ये OpenAIच्या निधीतून सुरू झाला. स्कॅनिंग उपकरणे आणि पद्धती तपासणे, स्कॅनमधून मजकूर काढण्यासाठी ऑप्टिकल कॅरेक्टर रिकग्निशन आणि हस्तलिखित मजकूर ओळखण्याच्या पद्धती तपासणे, तसेच AI-सहाय्यित मेटाडेटा आणि संग्रह-शोधाचा अभ्यास करणे, अशी त्याची कामे आहेत. या कामांतून डिजिटल प्रतिमा, लिप्यंतरे आणि सूची-नोंदी तयार होऊ शकतात. स्कॅन केलेले पान एखादी प्रणाली वाचू शकते का हे तपासणे म्हणजे ते पान किंवा त्याचे लिप्यंतर मॉडेल-प्रशिक्षण डेटासंचात गेले, असा पुरावा होत नाही.
Bodleian सांगते की त्यांच्या Global Dissertations संग्रहातील सुमारे 125,000 प्रतिमा टिपल्या आहेत आणि हस्तलिखित सूचीपत्रांमधून आणखी 429,000 फाइल्स तयार केल्या आहेत. प्रकल्प-पानात प्रबंधांच्या नमुन्याचे वर्णन एकोणिसाव्या आणि विसाव्या शतकातील युरोपीय व अमेरिकन पीएचडी प्रबंध असे आहे; 2025 च्या घोषणेत 1498 ते 1884 मधील 3,500 प्रबंध नमूद होते. स्कॅन किंवा हस्तांतरित सामग्रीशी हे वर्णन कसे जुळते, हे सार्वजनिक पानांवर स्पष्ट नाही. या संख्या डिजिटायझेशनच्या निष्पत्ती दर्शवतात; OpenAIच्या प्रशिक्षण डेटाची प्रकाशित यादी नाहीत.
## नव्या वृत्तांकनातून काय समोर आले
The Guardianच्या म्हणण्यानुसार, OpenAIने डिजिटाइझ केलेल्या Bodleian सामग्रीबद्दल अंतर्गत कागदपत्रांत “OpenAIचा प्रशिक्षण संच भरण्यास मदत” असा उल्लेख आहे. जून 2025 पर्यंत ऐतिहासिक प्रबंधांच्या 125,000 प्रतिमा OpenAIसोबत सामायिक केल्या होत्या, असेही वृत्तात म्हटले आहे; स्कॅन केलेल्या इतर मजकुरात सोळाव्या शतकातील 10,000 ब्रॉडसाइड गाथांचा समावेश असल्याचे सांगितले आहे. स्कॅन केलेल्या प्रत्येक गाथेचा प्रशिक्षण डेटात समावेश झाला, असा पुरावा वृत्तात नाही. माहिती स्वातंत्र्याच्या विनंतीतून मिळालेल्या विद्यापीठाच्या बैठकीच्या इतिवृत्तांत भागीदारीच्या प्रतिष्ठाविषयक आणि पर्यावरणीय जोखमींबद्दल कर्मचाऱ्यांच्या चिंता नोंदल्या आहेत, असे वृत्तपत्राने म्हटले आहे. आम्ही तपासू शकलेल्या स्रोतांत ती अंतर्गत कागदपत्रे उपलब्ध नव्हती; त्यामुळे Guardianच्या वृत्तापलीकडील त्यांचे नेमके शब्द, तारखा आणि व्याप्ती येथे स्वतंत्ररीत्या पडताळलेली नाही.
विद्यापीठाच्या प्रवक्त्याने The Guardianला सांगितले की डिजिटाइझ होणारी सामग्री मर्यादित प्रमाणात, कॉपीराइटमुक्त होती आणि OpenAIला अनन्य नसलेल्या अटींवर उपलब्ध होती. स्कॅनवरील हक्क Bodleianकडे राहतील आणि काही महिन्यांत ते ऑनलाइन खुले प्रकाशित करण्याची योजना आहे, असे प्रवक्त्याने सांगितले. मशीन-लर्निंगचा भाग लपवला होता, हा आरोपही त्यांनी फेटाळला; या प्रकल्पातून प्रशिक्षण डेटा मिळेल हे कर्मचारी उघडपणे सांगत होते, असे वृत्तपत्राला सांगितले. ऐतिहासिक ज्ञान AI मॉडेल्समध्ये प्रतिबिंबित होण्यास मदत करताना अभिमान वाटतो, असे OpenAIने The Guardianला सांगितले; त्याची प्रकाशित [NextGenAI घोषणा](https://openai.com/index/introducing-nextgenai/) Bodleianमधील कामाचे वर्णन दुर्मीळ ग्रंथांचे डिजिटायझेशन आणि त्यांचे लिप्यंतरण करण्यासाठी APIचा वापर असे करते.
एकत्रितपणे पाहता, या वृत्तांकनावरून आणि Oxfordच्या प्रतिसादावरून या व्यवस्थेत प्रशिक्षण डेटासाठी सामग्री देण्याचा भाग आहे, असे म्हणता येते. मात्र संग्रहातील कोणत्या वस्तू कोणत्या डेटासंचात टाकल्या, प्रतिमा वापरल्या की लिप्यंतरित मजकूर, त्यावर विशिष्ट प्रकाशित मॉडेल प्रशिक्षित झाले का, किंवा OpenAIला त्या पुन्हा वापरण्याच्या कोणत्या अटी आहेत, हे यातून सिद्ध होत नाही. विशिष्ट मॉडेलचे प्रशिक्षण सुरू होण्यापूर्वी प्रशिक्षण संच तयार केला जाऊ शकतो. Oxfordचे सार्वजनिक डिजिटायझेशन-वर्णन आणि OpenAIची 2025 ची घोषणा या उणिवा भरून काढत नाहीत.
## प्रशिक्षणातील वापराचा मागोवा घेण्यासाठी अजून नोंदी हव्यात
Oxfordच्या प्रकल्प-पानानुसार, पाचही कार्यप्रवाहांवर मुक्त प्रवेशाचे अहवाल प्रकाशित करण्याची टीमची योजना होती. OpenAIला दिलेल्या सामग्रीची नावे आणि तिच्या प्रशिक्षणासाठीच्या अनुमत वापरांचे वर्णन करणारा अहवाल किंवा संग्रह-सूची असेल, तर सार्वजनिक प्रवेशाच्या लाभाची कंपनीला दिलेल्या डेटाशी विद्वानांना तुलना करता येईल. तोपर्यंत, या दुसऱ्या वापराबद्दलचा सर्वात स्पष्ट तपशील Guardianचे कागदपत्रांवर आधारित वृत्तांकन आणि Oxford व OpenAIने दिलेली उत्तरे एवढाच आहे.
## स्रोत आणि पुढील वाचन
The [Guardianचा 26 सप्टेंबर 2026 चा तपासात्मक अहवाल](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) अंतर्गत कागदपत्रांतील दाव्यासाठी, प्रबंधांच्या प्रतिमा सामायिक केल्याच्या वृत्तासाठी, बैठकीच्या इतिवृत्तांतील चिंतांसाठी आणि Oxford व OpenAIच्या प्रतिसादांसाठीचा स्रोत आहे. त्यामागील अंतर्गत कागदपत्रे आम्हाला स्वतंत्र तपासणीसाठी उपलब्ध नव्हती.
[Oxfordची 4 मार्च 2025 ची सहकार्याविषयीची घोषणा](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) सार्वजनिक क्षेत्रातील प्रायोगिक प्रकल्प आणि संशोधकांना अपेक्षित प्रवेश यांचा तपशील देते. OpenAIच्या मॉडेल-प्रशिक्षणातील वापराचा उल्लेख करत नाही.
The [Bodleian Digitisation Research प्रकल्प-पान](https://www.bodleian.ox.ac.uk/node/4611321) प्रायोगिक प्रकल्पाच्या कार्यप्रवाहांची आणि प्रतिमांच्या संख्येची माहिती देते. ही आकडेवारी स्कॅनिंगच्या निष्पत्तीची आहे; प्रशिक्षण डेटासंच किंवा त्यावर प्रशिक्षित मॉडेलची ओळख पानावर दिलेली नाही.
[OpenAIची 4 मार्च 2025 ची NextGenAI घोषणा](https://openai.com/index/introducing-nextgenai/) Bodleianमधील डिजिटायझेशन आणि API वापरून केलेल्या लिप्यंतरणाचे वर्णन करते. स्कॅनमधील सामग्रीवर आधारित प्रशिक्षण संच किंवा मॉडेलची ओळख देत नाही.
## Sources
- [The Guardian: Bodleian Libraryमधील सामग्रीवर OpenAIला AI मॉडेल्स प्रशिक्षित करू देणारे Oxford](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — 26 सप्टेंबर 2026 चे मूळ वृत्तांकन; अंतर्गत कागदपत्रे आणि विद्यापीठाच्या बैठकीच्या इतिवृत्तांबद्दल तसेच Oxford व OpenAIच्या प्रतिसादांबद्दल. मूळ अंतर्गत कागदपत्रे स्वतंत्र तपासणीसाठी उपलब्ध नव्हती; त्यामुळे प्रशिक्षण-संचातील उल्लेख आणि सामायिकरणाचे तपशील Guardianच्या वृत्ताला जोडून दिले आहेत.
- [Oxford आणि OpenAIने संशोधन व शिक्षणाला चालना देण्यासाठी सहकार्य सुरू केले](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — Oxfordची 4 मार्च 2025 ची घोषणा सार्वजनिक क्षेत्रातील Bodleian डिजिटायझेशन प्रायोगिक प्रकल्प, संशोधकांना अपेक्षित प्रवेश आणि सुरुवातीच्या प्रबंध-संग्रहाचे वर्णन करते. प्रशिक्षण डेटाच्या वापराचा उल्लेख करत नाही.
- [Bodleian Digitisation Research प्रकल्प](https://www.bodleian.ox.ac.uk/node/4611321) — Bodleianचे सार्वजनिक प्रकल्प-पान स्कॅनिंग, OCR/HTR, मेटाडेटा आणि शोधविषयक कार्यप्रवाह तसेच प्रतिमांची संख्या सांगते. या डिजिटायझेशनच्या निष्पत्ती आहेत; OpenAIच्या प्रशिक्षण सामग्रीची प्रकाशित यादी नाही.
- [OpenAI: NextGenAIची ओळख](https://openai.com/index/introducing-nextgenai/) — OpenAIची 4 मार्च 2025 ची घोषणा Bodleianमधील डिजिटायझेशन आणि API वापरून केलेल्या लिप्यंतरणाचे वर्णन करते. प्रशिक्षण संच किंवा त्या सामग्रीवर प्रशिक्षित मॉडेलची ओळख देत नाही.
BIG CHANGE वृत्तपत्र
मोठे चित्र. तुमच्या गतीने.
AI आणि रोबोटिक्सवरील ताज्या बातम्या, पाहण्यासारखे बदल आणि वापरता येतील अशा व्यावहारिक कल्पना. दैनिक माहिती, साप्ताहिक सारांश किंवा मासिक दृष्टिकोन निवडा.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
तुमची गोपनीयता, तुमची निवड.
आवश्यक स्टोरेज साइट सुरक्षित ठेवण्यास आणि तुमच्या निवडी लक्षात ठेवण्यास मदत करते. तुमची परवानगी मिळेपर्यंत पर्यायी Google Analytics बंद राहते. फक्त आवश्यक स्टोरेज वापरून प्रत्येक लेख वाचता येतो. गोपनीयतेचा तपशील