Oxfordने OpenAIसोबतचे काम सार्वजनिक क्षेत्रातील ग्रंथालय साहित्य स्कॅन करून संशोधकांना ते शोधणे सोपे करण्याचा मार्ग म्हणून मांडले. 26 सप्टेंबरच्या The Guardian च्या वृत्तानुसार विद्यापीठाच्या अंतर्गत कागदपत्रांमध्ये डिजिटाइझ केलेली सामग्री OpenAIचा प्रशिक्षण संच तयार करण्यास मदत करते, असे म्हटले आहे. Oxfordच्या प्रवक्त्याने वृत्तपत्राला सांगितले की या प्रकल्पातून प्रशिक्षण डेटा मिळणार असल्याची माहिती कर्मचारी उघडपणे देत होते. सार्वजनिक प्रकल्प-वर्णनात स्कॅनिंग आणि लिप्यंतरणाच्या संशोधनाचा तपशील आहे, पण हा दुसरा उपयोग स्पष्ट केलेला नाही.
मोठा बदल: डिजिटायझेशनचा उपयोग आता AI प्रशिक्षणासाठीही
- काय बदलले: अंतर्गत कागदपत्रांबद्दल The Guardian ने दिलेल्या वृत्तानंतर, सार्वजनिक डिजिटायझेशन प्रकल्पाबरोबर प्रशिक्षण डेटाचा उद्देशही असल्याचे Oxfordने मान्य केले आहे. Bodleianच्या सामग्रीवर प्रशिक्षित केलेले कोणते मॉडेल आहे, हे सार्वजनिक नोंदींत अद्याप नमूद नाही.
- हे का महत्त्वाचे: ग्रंथालयांना शोधता येण्याजोगे डिजिटल संग्रह मिळू शकतात, तर तंत्रज्ञान भागीदाराला AI विकासासाठी सामग्री मिळते. या प्रत्येक उद्देशासाठी कोणते संग्रह वापरले जातात हे संशोधक आणि जनतेला कळणे आवश्यक आहे, तेव्हाच या देवाणघेवाणीचे मूल्यमापन करता येईल.
- कशाकडे लक्ष द्यावे: Oxford सांगते की स्कॅनवरील हक्क त्यांच्याकडे राहतील आणि डिजिटाइझ केलेली सामग्री खुली प्रकाशित करण्याची त्यांची योजना आहे. OpenAIसोबत नेमकी कोणती सामग्री सामायिक केली आणि ती कोणत्या प्रशिक्षणासाठी वापरली जाणार, याची संग्रहनिहाय यादी या व्यवस्थेचे मूल्यमापन सोपे करेल.
सार्वजनिक प्रकल्प स्कॅनिंग आणि लिप्यंतरणाविषयी आहे
Oxfordच्या मार्च 2025 मधील घोषणेत ऑनलाइन उपलब्ध नसलेले सार्वजनिक क्षेत्रातील Bodleian साहित्य डिजिटाइझ करण्याच्या प्रायोगिक प्रकल्पाचे वर्णन होते. 1498 ते 1884 या काळातील 3,500 जागतिक प्रबंध हे उद्दिष्ट संग्रहांपैकी एक असल्याचे त्यात नमूद होते; परिणामी सामग्री जगभरातील विद्यार्थी आणि संशोधकांना शोधता व वापरता येईल, असेही सांगितले होते. OpenAIच्या प्रशिक्षण संचात सामग्री हस्तांतरित करण्याचा उल्लेख त्यात नव्हता.
या Bodleianच्या प्रकल्प-पानानुसार प्रायोगिक प्रकल्प फेब्रुवारी 2025 मध्ये OpenAIच्या निधीतून सुरू झाला. स्कॅनिंग उपकरणे आणि पद्धती तपासणे, स्कॅनमधून मजकूर काढण्यासाठी ऑप्टिकल कॅरेक्टर रिकग्निशन आणि हस्तलिखित मजकूर ओळखण्याच्या पद्धती तपासणे, तसेच AI-सहाय्यित मेटाडेटा आणि संग्रह-शोधाचा अभ्यास करणे, अशी त्याची कामे आहेत. या कामांतून डिजिटल प्रतिमा, लिप्यंतरे आणि सूची-नोंदी तयार होऊ शकतात. स्कॅन केलेले पान एखादी प्रणाली वाचू शकते का हे तपासणे म्हणजे ते पान किंवा त्याचे लिप्यंतर मॉडेल-प्रशिक्षण डेटासंचात गेले, असा पुरावा होत नाही.
Bodleian सांगते की त्यांच्या Global Dissertations संग्रहातील सुमारे 125,000 प्रतिमा टिपल्या आहेत आणि हस्तलिखित सूचीपत्रांमधून आणखी 429,000 फाइल्स तयार केल्या आहेत. प्रकल्प-पानात प्रबंधांच्या नमुन्याचे वर्णन एकोणिसाव्या आणि विसाव्या शतकातील युरोपीय व अमेरिकन पीएचडी प्रबंध असे आहे; 2025 च्या घोषणेत 1498 ते 1884 मधील 3,500 प्रबंध नमूद होते. स्कॅन किंवा हस्तांतरित सामग्रीशी हे वर्णन कसे जुळते, हे सार्वजनिक पानांवर स्पष्ट नाही. या संख्या डिजिटायझेशनच्या निष्पत्ती दर्शवतात; OpenAIच्या प्रशिक्षण डेटाची प्रकाशित यादी नाहीत.
नव्या वृत्तांकनातून काय समोर आले
The Guardianच्या म्हणण्यानुसार, OpenAIने डिजिटाइझ केलेल्या Bodleian सामग्रीबद्दल अंतर्गत कागदपत्रांत “OpenAIचा प्रशिक्षण संच भरण्यास मदत” असा उल्लेख आहे. जून 2025 पर्यंत ऐतिहासिक प्रबंधांच्या 125,000 प्रतिमा OpenAIसोबत सामायिक केल्या होत्या, असेही वृत्तात म्हटले आहे; स्कॅन केलेल्या इतर मजकुरात सोळाव्या शतकातील 10,000 ब्रॉडसाइड गाथांचा समावेश असल्याचे सांगितले आहे. स्कॅन केलेल्या प्रत्येक गाथेचा प्रशिक्षण डेटात समावेश झाला, असा पुरावा वृत्तात नाही. माहिती स्वातंत्र्याच्या विनंतीतून मिळालेल्या विद्यापीठाच्या बैठकीच्या इतिवृत्तांत भागीदारीच्या प्रतिष्ठाविषयक आणि पर्यावरणीय जोखमींबद्दल कर्मचाऱ्यांच्या चिंता नोंदल्या आहेत, असे वृत्तपत्राने म्हटले आहे. आम्ही तपासू शकलेल्या स्रोतांत ती अंतर्गत कागदपत्रे उपलब्ध नव्हती; त्यामुळे Guardianच्या वृत्तापलीकडील त्यांचे नेमके शब्द, तारखा आणि व्याप्ती येथे स्वतंत्ररीत्या पडताळलेली नाही.
विद्यापीठाच्या प्रवक्त्याने The Guardianला सांगितले की डिजिटाइझ होणारी सामग्री मर्यादित प्रमाणात, कॉपीराइटमुक्त होती आणि OpenAIला अनन्य नसलेल्या अटींवर उपलब्ध होती. स्कॅनवरील हक्क Bodleianकडे राहतील आणि काही महिन्यांत ते ऑनलाइन खुले प्रकाशित करण्याची योजना आहे, असे प्रवक्त्याने सांगितले. मशीन-लर्निंगचा भाग लपवला होता, हा आरोपही त्यांनी फेटाळला; या प्रकल्पातून प्रशिक्षण डेटा मिळेल हे कर्मचारी उघडपणे सांगत होते, असे वृत्तपत्राला सांगितले. ऐतिहासिक ज्ञान AI मॉडेल्समध्ये प्रतिबिंबित होण्यास मदत करताना अभिमान वाटतो, असे OpenAIने The Guardianला सांगितले; त्याची प्रकाशित NextGenAI घोषणा Bodleianमधील कामाचे वर्णन दुर्मीळ ग्रंथांचे डिजिटायझेशन आणि त्यांचे लिप्यंतरण करण्यासाठी APIचा वापर असे करते.
एकत्रितपणे पाहता, या वृत्तांकनावरून आणि Oxfordच्या प्रतिसादावरून या व्यवस्थेत प्रशिक्षण डेटासाठी सामग्री देण्याचा भाग आहे, असे म्हणता येते. मात्र संग्रहातील कोणत्या वस्तू कोणत्या डेटासंचात टाकल्या, प्रतिमा वापरल्या की लिप्यंतरित मजकूर, त्यावर विशिष्ट प्रकाशित मॉडेल प्रशिक्षित झाले का, किंवा OpenAIला त्या पुन्हा वापरण्याच्या कोणत्या अटी आहेत, हे यातून सिद्ध होत नाही. विशिष्ट मॉडेलचे प्रशिक्षण सुरू होण्यापूर्वी प्रशिक्षण संच तयार केला जाऊ शकतो. Oxfordचे सार्वजनिक डिजिटायझेशन-वर्णन आणि OpenAIची 2025 ची घोषणा या उणिवा भरून काढत नाहीत.
प्रशिक्षणातील वापराचा मागोवा घेण्यासाठी अजून नोंदी हव्यात
Oxfordच्या प्रकल्प-पानानुसार, पाचही कार्यप्रवाहांवर मुक्त प्रवेशाचे अहवाल प्रकाशित करण्याची टीमची योजना होती. OpenAIला दिलेल्या सामग्रीची नावे आणि तिच्या प्रशिक्षणासाठीच्या अनुमत वापरांचे वर्णन करणारा अहवाल किंवा संग्रह-सूची असेल, तर सार्वजनिक प्रवेशाच्या लाभाची कंपनीला दिलेल्या डेटाशी विद्वानांना तुलना करता येईल. तोपर्यंत, या दुसऱ्या वापराबद्दलचा सर्वात स्पष्ट तपशील Guardianचे कागदपत्रांवर आधारित वृत्तांकन आणि Oxford व OpenAIने दिलेली उत्तरे एवढाच आहे.
स्रोत आणि पुढील वाचन
The Guardianचा 26 सप्टेंबर 2026 चा तपासात्मक अहवाल अंतर्गत कागदपत्रांतील दाव्यासाठी, प्रबंधांच्या प्रतिमा सामायिक केल्याच्या वृत्तासाठी, बैठकीच्या इतिवृत्तांतील चिंतांसाठी आणि Oxford व OpenAIच्या प्रतिसादांसाठीचा स्रोत आहे. त्यामागील अंतर्गत कागदपत्रे आम्हाला स्वतंत्र तपासणीसाठी उपलब्ध नव्हती.
Oxfordची 4 मार्च 2025 ची सहकार्याविषयीची घोषणा सार्वजनिक क्षेत्रातील प्रायोगिक प्रकल्प आणि संशोधकांना अपेक्षित प्रवेश यांचा तपशील देते. OpenAIच्या मॉडेल-प्रशिक्षणातील वापराचा उल्लेख करत नाही.
The Bodleian Digitisation Research प्रकल्प-पान प्रायोगिक प्रकल्पाच्या कार्यप्रवाहांची आणि प्रतिमांच्या संख्येची माहिती देते. ही आकडेवारी स्कॅनिंगच्या निष्पत्तीची आहे; प्रशिक्षण डेटासंच किंवा त्यावर प्रशिक्षित मॉडेलची ओळख पानावर दिलेली नाही.
OpenAIची 4 मार्च 2025 ची NextGenAI घोषणा Bodleianमधील डिजिटायझेशन आणि API वापरून केलेल्या लिप्यंतरणाचे वर्णन करते. स्कॅनमधील सामग्रीवर आधारित प्रशिक्षण संच किंवा मॉडेलची ओळख देत नाही.



