दुनिया ठहरी नहीं है।RSS
BIG CHANGE.

Markdown संस्करण

AI-translated from English; not yet reviewed by a fluent editor.

# ऑक्सफोर्ड का कहना है कि बोडलियन के डिजिटलीकरण से OpenAI के प्रशिक्षण डेटा को भी सामग्री मिलती है

> ऑक्सफोर्ड के अनुसार, उसकी बोडलियन डिजिटलीकरण परीक्षण-परियोजना OpenAI को प्रशिक्षण डेटा देती है। सार्वजनिक परियोजना रिकॉर्ड में स्कैनिंग और लिप्यंतरण का विवरण है, लेकिन सामग्री या इस्तेमाल हुए मॉडलों की पहचान नहीं है।

By BIG CHANGE Editorial

Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

![An unidentified open bound volume rests in an archival cradle beneath a mounted document camera, with library shelves behind it.](https://bigchange.ai/api/media/file/oxford-bodleian-digitisation-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

ऑक्सफोर्ड ने OpenAI के साथ अपने काम को सार्वजनिक डोमेन की पुस्तकालय सामग्री स्कैन करने और शोधकर्ताओं के लिए उसे खोजना आसान बनाने का तरीका बताया। [The Guardian की 26 सितंबर की रिपोर्ट](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) के अनुसार, विश्वविद्यालय के आंतरिक दस्तावेज़ डिजिटलीकृत सामग्री को OpenAI के प्रशिक्षण सेट को भरने में मददगार बताते हैं। ऑक्सफोर्ड के एक प्रवक्ता ने अखबार से कहा कि कर्मचारी इस परियोजना से प्रशिक्षण डेटा मिलने की बात पहले से खुलकर बताते रहे हैं। सार्वजनिक परियोजना-विवरण में स्कैनिंग और लिप्यंतरण के शोध का विस्तार है, लेकिन इस दूसरे उपयोग का विवरण नहीं है।

## बड़ा बदलाव: डिजिटलीकरण से AI प्रशिक्षण के लिए भी सामग्री मिलती है

- **क्या बदला:** ऑक्सफोर्ड ने अपने सार्वजनिक डिजिटलीकरण पायलट के साथ प्रशिक्षण डेटा देने के उद्देश्य को भी स्वीकार किया है। यह Guardian की आंतरिक दस्तावेज़ों पर आधारित रिपोर्ट के बाद हुआ। सार्वजनिक रिकॉर्ड अब भी बोडलियन सामग्री पर प्रशिक्षित किसी मॉडल की पहचान नहीं करता।
- **यह क्यों मायने रखता है:** पुस्तकालयों को खोजने योग्य डिजिटल संग्रह मिल सकते हैं, जबकि प्रौद्योगिकी साझेदार को AI विकास की सामग्री मिलती है। इस आदान-प्रदान का आकलन करने के लिए शोधकर्ताओं और जनता को जानना होगा कि कौन-से संग्रह किस उद्देश्य में इस्तेमाल हुए।
- **अब क्या देखना है:** ऑक्सफोर्ड का कहना है कि स्कैन पर अधिकार उसी के पास हैं और वह डिजिटलीकृत सामग्री को खुले तौर पर प्रकाशित करने की योजना बना रहा है। OpenAI के साथ क्या साझा किया गया और प्रशिक्षण के किस उपयोग के लिए—इसका संग्रह-वार विवरण व्यवस्था का आकलन आसान करेगा।

## सार्वजनिक परियोजना स्कैनिंग और लिप्यंतरण के बारे में है

[ऑक्सफोर्ड की मार्च 2025 की घोषणा](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) में सार्वजनिक डोमेन की बोडलियन सामग्री को डिजिटाइज़ करने का पायलट बताया गया था, जो पहले ऑनलाइन उपलब्ध नहीं थी। उसमें 1498 से 1884 के बीच के Global Dissertations संग्रह के 3,500 शोध-प्रबंधों को लक्षित संग्रहों में गिनाया गया था और कहा गया था कि नतीजे दुनिया भर के छात्रों तथा शोधकर्ताओं के लिए खोजने योग्य और उपलब्ध होंगे। उसमें OpenAI के प्रशिक्षण सेट में सामग्री देने का उल्लेख नहीं था।

बोडलियन का [परियोजना पृष्ठ](https://www.bodleian.ox.ac.uk/node/4611321) कहता है कि पायलट फरवरी 2025 में OpenAI के वित्तपोषण से शुरू हुआ। इसके कार्य-क्षेत्रों में स्कैनिंग उपकरणों और तरीकों का परीक्षण, स्कैन से पाठ निकालने के लिए ऑप्टिकल कैरेक्टर रिकग्निशन और हस्तलिखित पाठ पहचान की जाँच, और AI-सहायता से मेटाडेटा तथा संग्रह खोजने की पड़ताल शामिल है। इन कामों से डिजिटल छवियाँ, लिप्यंतरण और सूची-रिकॉर्ड बन सकते हैं। यह जाँचना कि कोई प्रणाली स्कैन किया पन्ना पढ़ सकती है, अपने-आप यह साबित नहीं करता कि पन्ना या उसका लिप्यंतरण मॉडल-प्रशिक्षण के डेटा में शामिल हुआ।

बोडलियन का कहना है कि उसने अपने Global Dissertations संग्रह से लगभग 125,000 छवियाँ ली हैं और हस्तलिखित सूची-पर्चियों से 429,000 अन्य फ़ाइलें बनाई हैं। उसके पृष्ठ में शोध-प्रबंधों के नमूने को 19वीं और 20वीं सदी के यूरोपीय तथा अमेरिकी पीएचडी शोध-प्रबंध बताया गया है; 2025 की घोषणा में 1498 से 1884 के 3,500 शोध-प्रबंधों की पहचान की गई थी। सार्वजनिक पृष्ठ यह नहीं समझाते कि ये विवरण स्कैन की गई या हस्तांतरित सामग्री से कैसे मेल खाते हैं। ये संख्याएँ डिजिटलीकरण के नतीजे बताती हैं, OpenAI के प्रशिक्षण डेटा की प्रकाशित सूची नहीं।

## नई रिपोर्टिंग से क्या पता चलता है

The Guardian के अनुसार, आंतरिक दस्तावेज़ बोडलियन की OpenAI द्वारा डिजिटाइज़ की गई सामग्री के लिए ‘OpenAI के प्रशिक्षण सेट को भरना’ वाक्यांश इस्तेमाल करते हैं। अखबार ने यह भी बताया कि जून 2025 तक ऐतिहासिक शोध-प्रबंधों की 125,000 छवियाँ OpenAI के साथ साझा की गई थीं और स्कैन किए गए अन्य पाठों में 16वीं सदी के 10,000 ब्रॉडसाइड गीत-पत्र शामिल थे। रिपोर्ट यह साबित नहीं करती कि हर स्कैन किया गया गीत-पत्र प्रशिक्षण डेटा बना। अखबार के मुताबिक, सूचना-अधिकार अनुरोध से मिले विश्वविद्यालय बैठक के कार्यवृत्त में साझेदारी के प्रतिष्ठा-संबंधी और पर्यावरणीय जोखिमों पर कर्मचारियों की चिंताएँ दर्ज हैं। जिन आंतरिक दस्तावेज़ों का अखबार ने हवाला दिया, वे हमारे देखे जा सकने वाले स्रोतों में उपलब्ध नहीं थे; इसलिए उनका सटीक शब्दांकन, तारीखें और Guardian के विवरण से परे दायरा यहाँ स्वतंत्र रूप से सत्यापित नहीं है।

विश्वविद्यालय के प्रवक्ता ने Guardian से कहा कि डिजिटाइज़ की जा रही सामग्री सीमित मात्रा में, कॉपीराइट से मुक्त और गैर-अनन्य आधार पर OpenAI के लिए उपलब्ध थी। प्रवक्ता ने कहा कि बोडलियन ने स्कैन पर अधिकार अपने पास रखे हैं और कुछ महीनों में उन्हें खुले तौर पर ऑनलाइन प्रकाशित करने की योजना है। प्रवक्ता ने यह सुझाव भी खारिज किया कि मशीन-लर्निंग वाला हिस्सा छिपाया गया था; उन्होंने अखबार से कहा कि कर्मचारी प्रशिक्षण डेटा में योगदान देने की बात खुलकर बताते रहे हैं। OpenAI ने Guardian से कहा कि उसे खुशी है कि ऐतिहासिक ज्ञान AI मॉडलों में शामिल हो; उसकी प्रकाशित [NextGenAI की घोषणा](https://openai.com/index/introducing-nextgenai/) में बोडलियन के काम को दुर्लभ पाठों के डिजिटलीकरण और उन्हें लिप्यंतरित करने के लिए उसके API के इस्तेमाल के रूप में बताया गया है।

रिपोर्ट और ऑक्सफोर्ड की प्रतिक्रिया को साथ पढ़ने पर यह कहना उचित है कि इस व्यवस्था में प्रशिक्षण डेटा का योगदान शामिल है। उनसे यह साबित नहीं होता कि कौन-सी संग्रह-वस्तुएँ किस डेटासेट में रखी गईं, छवियों या लिप्यंतरित पाठ में से क्या इस्तेमाल हुआ, क्या उन पर कोई खास जारी मॉडल प्रशिक्षित हुआ, या OpenAI को सामग्री दोबारा इस्तेमाल करने की क्या शर्तें मिलीं। किसी खास मॉडल को प्रशिक्षित करने से पहले भी प्रशिक्षण सेट तैयार किया जा सकता है। ऑक्सफोर्ड का सार्वजनिक डिजिटलीकरण-विवरण और OpenAI की 2025 की घोषणा इन सवालों का जवाब नहीं देते।

## प्रशिक्षण में उपयोग का पता लगाने के लिए रिकॉर्ड अभी बाकी हैं

ऑक्सफोर्ड के परियोजना पृष्ठ के अनुसार, टीम ने अपने पाँच कार्य-क्षेत्रों में से हर एक पर खुले तौर पर उपलब्ध रिपोर्ट देने की योजना बनाई थी। ऐसी रिपोर्ट या संग्रह-सूची, जिसमें OpenAI को दी गई सामग्री और उसके अनुमत प्रशिक्षण-उपयोग का विवरण हो, विद्वानों को सार्वजनिक पहुँच के लाभ की तुलना कंपनी को दी गई सामग्री से करने देगी। तब तक इस दूसरे उपयोग का सबसे स्पष्ट विवरण Guardian की दस्तावेज़-आधारित रिपोर्टिंग और उसे ऑक्सफोर्ड तथा OpenAI के दिए जवाब हैं।

## स्रोत और आगे पढ़ें

द [गार्डियन की 26 सितंबर 2026 की पड़ताल](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) आंतरिक दस्तावेज़ों के दावे, शोध-प्रबंधों की छवियाँ साझा किए जाने, बैठक के कार्यवृत्त में दर्ज चिंताओं और ऑक्सफोर्ड तथा OpenAI की प्रतिक्रियाओं का स्रोत है। उसके मूल आंतरिक दस्तावेज़ हमारी स्वतंत्र जाँच के लिए उपलब्ध नहीं थे।

[ऑक्सफोर्ड की 4 मार्च 2025 की सहयोग-घोषणा](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) सार्वजनिक डोमेन के पायलट और शोधकर्ताओं के लिए सामग्री उपलब्ध कराने की योजना बताती है। इसमें OpenAI द्वारा मॉडल-प्रशिक्षण के उपयोग का उल्लेख नहीं है।

बोडलियन का [डिजिटलीकरण अनुसंधान परियोजना पृष्ठ](https://www.bodleian.ox.ac.uk/node/4611321) पायलट के कार्य-क्षेत्र और छवियों की संख्या बताता है। इसके आँकड़े स्कैनिंग के नतीजे हैं; पृष्ठ किसी प्रशिक्षण डेटासेट या उस पर प्रशिक्षित मॉडल की पहचान नहीं करता।

[OpenAI की 4 मार्च 2025 की NextGenAI घोषणा](https://openai.com/index/introducing-nextgenai/) बोडलियन में डिजिटलीकरण और उसके API से लिप्यंतरण का विवरण देती है। इसमें प्रशिक्षण सेट की सामग्री या स्कैन पर प्रशिक्षित मॉडल की पहचान नहीं है।

## Sources

- [The Guardian: OpenAI को बोडलियन पुस्तकालय पर AI मॉडल प्रशिक्षित करने की ऑक्सफोर्ड की अनुमति](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — 26 सितंबर 2026 की मूल रिपोर्ट आंतरिक दस्तावेज़ों और विश्वविद्यालय बैठक के कार्यवृत्त पर आधारित है; इसमें ऑक्सफोर्ड और OpenAI के जवाब भी शामिल हैं। मूल आंतरिक दस्तावेज़ हमारी स्वतंत्र जाँच के लिए उपलब्ध नहीं थे, इसलिए प्रशिक्षण-सेट के शब्दांकन और साझा करने के विवरण Guardian की रिपोर्ट के रूप में दिए गए हैं।
- [ऑक्सफोर्ड और OpenAI ने शोध तथा शिक्षा को आगे बढ़ाने के लिए सहयोग शुरू किया](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — ऑक्सफोर्ड की 4 मार्च 2025 की घोषणा में सार्वजनिक डोमेन की बोडलियन सामग्री के डिजिटलीकरण पायलट, शोधकर्ताओं के लिए प्रस्तावित पहुँच और शुरुआती शोध-प्रबंध संग्रह का विवरण है। इसमें प्रशिक्षण डेटा के उपयोग का उल्लेख नहीं है।
- [बोडलियन का डिजिटलीकरण अनुसंधान परियोजना](https://www.bodleian.ox.ac.uk/node/4611321) — बोडलियन का सार्वजनिक परियोजना पृष्ठ स्कैनिंग, OCR/HTR, मेटाडेटा और सामग्री खोज के कार्य-क्षेत्र बताता है और छवियों की संख्या देता है। ये डिजिटलीकरण के नतीजे हैं, OpenAI की प्रशिक्षण सामग्री की प्रकाशित सूची नहीं।
- [OpenAI: NextGenAI का परिचय](https://openai.com/index/introducing-nextgenai/) — OpenAI की 4 मार्च 2025 की घोषणा बोडलियन के डिजिटलीकरण और उसके API से लिप्यंतरण का विवरण देती है। इसमें सामग्री पर बने प्रशिक्षण सेट या प्रशिक्षित मॉडल की पहचान नहीं है।