ऑक्सफोर्ड ने OpenAI के साथ अपने काम को सार्वजनिक डोमेन की पुस्तकालय सामग्री स्कैन करने और शोधकर्ताओं के लिए उसे खोजना आसान बनाने का तरीका बताया। The Guardian की 26 सितंबर की रिपोर्ट के अनुसार, विश्वविद्यालय के आंतरिक दस्तावेज़ डिजिटलीकृत सामग्री को OpenAI के प्रशिक्षण सेट को भरने में मददगार बताते हैं। ऑक्सफोर्ड के एक प्रवक्ता ने अखबार से कहा कि कर्मचारी इस परियोजना से प्रशिक्षण डेटा मिलने की बात पहले से खुलकर बताते रहे हैं। सार्वजनिक परियोजना-विवरण में स्कैनिंग और लिप्यंतरण के शोध का विस्तार है, लेकिन इस दूसरे उपयोग का विवरण नहीं है।

बड़ा बदलाव: डिजिटलीकरण से AI प्रशिक्षण के लिए भी सामग्री मिलती है

  • क्या बदला: ऑक्सफोर्ड ने अपने सार्वजनिक डिजिटलीकरण पायलट के साथ प्रशिक्षण डेटा देने के उद्देश्य को भी स्वीकार किया है। यह Guardian की आंतरिक दस्तावेज़ों पर आधारित रिपोर्ट के बाद हुआ। सार्वजनिक रिकॉर्ड अब भी बोडलियन सामग्री पर प्रशिक्षित किसी मॉडल की पहचान नहीं करता।
  • यह क्यों मायने रखता है: पुस्तकालयों को खोजने योग्य डिजिटल संग्रह मिल सकते हैं, जबकि प्रौद्योगिकी साझेदार को AI विकास की सामग्री मिलती है। इस आदान-प्रदान का आकलन करने के लिए शोधकर्ताओं और जनता को जानना होगा कि कौन-से संग्रह किस उद्देश्य में इस्तेमाल हुए।
  • अब क्या देखना है: ऑक्सफोर्ड का कहना है कि स्कैन पर अधिकार उसी के पास हैं और वह डिजिटलीकृत सामग्री को खुले तौर पर प्रकाशित करने की योजना बना रहा है। OpenAI के साथ क्या साझा किया गया और प्रशिक्षण के किस उपयोग के लिए—इसका संग्रह-वार विवरण व्यवस्था का आकलन आसान करेगा।

सार्वजनिक परियोजना स्कैनिंग और लिप्यंतरण के बारे में है

ऑक्सफोर्ड की मार्च 2025 की घोषणा में सार्वजनिक डोमेन की बोडलियन सामग्री को डिजिटाइज़ करने का पायलट बताया गया था, जो पहले ऑनलाइन उपलब्ध नहीं थी। उसमें 1498 से 1884 के बीच के Global Dissertations संग्रह के 3,500 शोध-प्रबंधों को लक्षित संग्रहों में गिनाया गया था और कहा गया था कि नतीजे दुनिया भर के छात्रों तथा शोधकर्ताओं के लिए खोजने योग्य और उपलब्ध होंगे। उसमें OpenAI के प्रशिक्षण सेट में सामग्री देने का उल्लेख नहीं था।

बोडलियन का परियोजना पृष्ठ कहता है कि पायलट फरवरी 2025 में OpenAI के वित्तपोषण से शुरू हुआ। इसके कार्य-क्षेत्रों में स्कैनिंग उपकरणों और तरीकों का परीक्षण, स्कैन से पाठ निकालने के लिए ऑप्टिकल कैरेक्टर रिकग्निशन और हस्तलिखित पाठ पहचान की जाँच, और AI-सहायता से मेटाडेटा तथा संग्रह खोजने की पड़ताल शामिल है। इन कामों से डिजिटल छवियाँ, लिप्यंतरण और सूची-रिकॉर्ड बन सकते हैं। यह जाँचना कि कोई प्रणाली स्कैन किया पन्ना पढ़ सकती है, अपने-आप यह साबित नहीं करता कि पन्ना या उसका लिप्यंतरण मॉडल-प्रशिक्षण के डेटा में शामिल हुआ।

बोडलियन का कहना है कि उसने अपने Global Dissertations संग्रह से लगभग 125,000 छवियाँ ली हैं और हस्तलिखित सूची-पर्चियों से 429,000 अन्य फ़ाइलें बनाई हैं। उसके पृष्ठ में शोध-प्रबंधों के नमूने को 19वीं और 20वीं सदी के यूरोपीय तथा अमेरिकी पीएचडी शोध-प्रबंध बताया गया है; 2025 की घोषणा में 1498 से 1884 के 3,500 शोध-प्रबंधों की पहचान की गई थी। सार्वजनिक पृष्ठ यह नहीं समझाते कि ये विवरण स्कैन की गई या हस्तांतरित सामग्री से कैसे मेल खाते हैं। ये संख्याएँ डिजिटलीकरण के नतीजे बताती हैं, OpenAI के प्रशिक्षण डेटा की प्रकाशित सूची नहीं।

नई रिपोर्टिंग से क्या पता चलता है

The Guardian के अनुसार, आंतरिक दस्तावेज़ बोडलियन की OpenAI द्वारा डिजिटाइज़ की गई सामग्री के लिए ‘OpenAI के प्रशिक्षण सेट को भरना’ वाक्यांश इस्तेमाल करते हैं। अखबार ने यह भी बताया कि जून 2025 तक ऐतिहासिक शोध-प्रबंधों की 125,000 छवियाँ OpenAI के साथ साझा की गई थीं और स्कैन किए गए अन्य पाठों में 16वीं सदी के 10,000 ब्रॉडसाइड गीत-पत्र शामिल थे। रिपोर्ट यह साबित नहीं करती कि हर स्कैन किया गया गीत-पत्र प्रशिक्षण डेटा बना। अखबार के मुताबिक, सूचना-अधिकार अनुरोध से मिले विश्वविद्यालय बैठक के कार्यवृत्त में साझेदारी के प्रतिष्ठा-संबंधी और पर्यावरणीय जोखिमों पर कर्मचारियों की चिंताएँ दर्ज हैं। जिन आंतरिक दस्तावेज़ों का अखबार ने हवाला दिया, वे हमारे देखे जा सकने वाले स्रोतों में उपलब्ध नहीं थे; इसलिए उनका सटीक शब्दांकन, तारीखें और Guardian के विवरण से परे दायरा यहाँ स्वतंत्र रूप से सत्यापित नहीं है।

विश्वविद्यालय के प्रवक्ता ने Guardian से कहा कि डिजिटाइज़ की जा रही सामग्री सीमित मात्रा में, कॉपीराइट से मुक्त और गैर-अनन्य आधार पर OpenAI के लिए उपलब्ध थी। प्रवक्ता ने कहा कि बोडलियन ने स्कैन पर अधिकार अपने पास रखे हैं और कुछ महीनों में उन्हें खुले तौर पर ऑनलाइन प्रकाशित करने की योजना है। प्रवक्ता ने यह सुझाव भी खारिज किया कि मशीन-लर्निंग वाला हिस्सा छिपाया गया था; उन्होंने अखबार से कहा कि कर्मचारी प्रशिक्षण डेटा में योगदान देने की बात खुलकर बताते रहे हैं। OpenAI ने Guardian से कहा कि उसे खुशी है कि ऐतिहासिक ज्ञान AI मॉडलों में शामिल हो; उसकी प्रकाशित NextGenAI की घोषणा में बोडलियन के काम को दुर्लभ पाठों के डिजिटलीकरण और उन्हें लिप्यंतरित करने के लिए उसके API के इस्तेमाल के रूप में बताया गया है।

रिपोर्ट और ऑक्सफोर्ड की प्रतिक्रिया को साथ पढ़ने पर यह कहना उचित है कि इस व्यवस्था में प्रशिक्षण डेटा का योगदान शामिल है। उनसे यह साबित नहीं होता कि कौन-सी संग्रह-वस्तुएँ किस डेटासेट में रखी गईं, छवियों या लिप्यंतरित पाठ में से क्या इस्तेमाल हुआ, क्या उन पर कोई खास जारी मॉडल प्रशिक्षित हुआ, या OpenAI को सामग्री दोबारा इस्तेमाल करने की क्या शर्तें मिलीं। किसी खास मॉडल को प्रशिक्षित करने से पहले भी प्रशिक्षण सेट तैयार किया जा सकता है। ऑक्सफोर्ड का सार्वजनिक डिजिटलीकरण-विवरण और OpenAI की 2025 की घोषणा इन सवालों का जवाब नहीं देते।

प्रशिक्षण में उपयोग का पता लगाने के लिए रिकॉर्ड अभी बाकी हैं

ऑक्सफोर्ड के परियोजना पृष्ठ के अनुसार, टीम ने अपने पाँच कार्य-क्षेत्रों में से हर एक पर खुले तौर पर उपलब्ध रिपोर्ट देने की योजना बनाई थी। ऐसी रिपोर्ट या संग्रह-सूची, जिसमें OpenAI को दी गई सामग्री और उसके अनुमत प्रशिक्षण-उपयोग का विवरण हो, विद्वानों को सार्वजनिक पहुँच के लाभ की तुलना कंपनी को दी गई सामग्री से करने देगी। तब तक इस दूसरे उपयोग का सबसे स्पष्ट विवरण Guardian की दस्तावेज़-आधारित रिपोर्टिंग और उसे ऑक्सफोर्ड तथा OpenAI के दिए जवाब हैं।

स्रोत और आगे पढ़ें

द गार्डियन की 26 सितंबर 2026 की पड़ताल आंतरिक दस्तावेज़ों के दावे, शोध-प्रबंधों की छवियाँ साझा किए जाने, बैठक के कार्यवृत्त में दर्ज चिंताओं और ऑक्सफोर्ड तथा OpenAI की प्रतिक्रियाओं का स्रोत है। उसके मूल आंतरिक दस्तावेज़ हमारी स्वतंत्र जाँच के लिए उपलब्ध नहीं थे।

ऑक्सफोर्ड की 4 मार्च 2025 की सहयोग-घोषणा सार्वजनिक डोमेन के पायलट और शोधकर्ताओं के लिए सामग्री उपलब्ध कराने की योजना बताती है। इसमें OpenAI द्वारा मॉडल-प्रशिक्षण के उपयोग का उल्लेख नहीं है।

बोडलियन का डिजिटलीकरण अनुसंधान परियोजना पृष्ठ पायलट के कार्य-क्षेत्र और छवियों की संख्या बताता है। इसके आँकड़े स्कैनिंग के नतीजे हैं; पृष्ठ किसी प्रशिक्षण डेटासेट या उस पर प्रशिक्षित मॉडल की पहचान नहीं करता।

OpenAI की 4 मार्च 2025 की NextGenAI घोषणा बोडलियन में डिजिटलीकरण और उसके API से लिप्यंतरण का विवरण देती है। इसमें प्रशिक्षण सेट की सामग्री या स्कैन पर प्रशिक्षित मॉडल की पहचान नहीं है।