পৃথিবী স্থির নেই।RSS
BIG CHANGE.

Markdown সংস্করণ

AI-translated from English; not yet reviewed by a fluent editor.

# Oxford বলছে, Bodleian-এর digitisation প্রকল্প OpenAI-র training data-ও জোগায়

> Oxford বলেছে, Bodleian-এর digitisation pilot OpenAI-কে training data দেয়। প্রকাশ্য প্রকল্পের নথিতে scan ও transcription-এর বিবরণ আছে, কিন্তু কোন উপকরণ বা model জড়িত তা বলা নেই।

By BIG CHANGE Editorial

Published: 2026-09-27T01:10:31.965Z
Updated: 2026-09-27T01:10:31.965Z
Canonical: https://bigchange.ai/blog/oxford-bodleian-digitisation-openai-training-data

![An unidentified open bound volume rests in an archival cradle beneath a mounted document camera, with library shelves behind it.](https://bigchange.ai/api/media/file/oxford-bodleian-digitisation-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Oxford, OpenAI-র সঙ্গে তাদের যৌথ কাজকে public-domain গ্রন্থাগার সামগ্রী scan করে গবেষকদের জন্য সহজে খুঁজে পাওয়ার ব্যবস্থা হিসেবে তুলে ধরেছে। [Guardian-এর ২৬ সেপ্টেম্বরের প্রতিবেদনে](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) বলা হয়েছে, বিশ্ববিদ্যালয়ের অভ্যন্তরীণ নথিতে digitise করা সামগ্রী OpenAI-র training set-এ যোগ করার কাজে লাগবে বলে বর্ণনা আছে। Oxford-এর এক মুখপাত্র সংবাদপত্রটিকে বলেছেন, প্রকল্প থেকে training data-তে অবদান রাখা হবে—এ কথা কর্মীরা খোলাখুলিভাবে জানিয়েছেন। প্রকাশ্য প্রকল্প-বিবরণে scan ও transcription নিয়ে গবেষণার বিশদ আছে, কিন্তু দ্বিতীয় ব্যবহারটি নির্দিষ্ট করা হয়নি।

## মূল পরিবর্তন: digitisation-এ AI training-ও যুক্ত

- **কী বদলেছে:** Oxford প্রকাশ্য digitisation pilot-এর পাশাপাশি training data তৈরির উদ্দেশ্যও স্বীকার করেছে, Guardian-এর অভ্যন্তরীণ নথি নিয়ে প্রতিবেদন প্রকাশের পর। Bodleian-এর উপকরণে প্রশিক্ষিত কোনো model-এর নাম এখনও প্রকাশ্য নথিতে নেই।
- **কেন গুরুত্বপূর্ণ:** গ্রন্থাগার searchable ডিজিটাল সংগ্রহ তৈরি করতে পারে, আর প্রযুক্তি-সহযোগী পেতে পারে AI উন্নয়নের উপকরণ। বিনিময়টি বোঝার জন্য কোন সংগ্রহ কোন কাজে ব্যবহৃত হয়েছে—গবেষক ও সাধারণ মানুষের তা জানা দরকার।
- **যা নজরে রাখা দরকার:** scan-এর অধিকার তাদের কাছেই আছে এবং digitise করা উপকরণ প্রকাশ্যে দেওয়ার পরিকল্পনা আছে বলে Oxford জানিয়েছে। OpenAI-কে কোন সংগ্রহ থেকে কী দেওয়া হয়েছে এবং তা কোন training কাজে লাগবে—এমন সংগ্রহভিত্তিক বিবরণ চুক্তিটি যাচাই করা সহজ করবে।

## প্রকাশ্য প্রকল্পে scan ও transcription-এর কথা আছে

[Oxford-এর ২০২৫ সালের মার্চের ঘোষণায়](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) আগে অনলাইনে না থাকা public-domain Bodleian উপকরণ digitise করার pilot-এর কথা ছিল। প্রাথমিক সংগ্রহে ১৪৯৮ থেকে ১৮৮৪ সালের ৩,৫০০টি বৈশ্বিক dissertation-এর নাম দেওয়া হয়েছিল; ফলাফল বিশ্বের শিক্ষার্থী ও গবেষকদের জন্য searchable ও সহজলভ্য হবে বলেও জানানো হয়। ঘোষণায় উপকরণ OpenAI-র training set-এ দেওয়ার কথা ছিল না।

Bodleian-এর [প্রকল্পের পাতায়](https://www.bodleian.ox.ac.uk/node/4611321) বলা হয়েছে, OpenAI-র অর্থায়নে pilot-টি ২০২৫ সালের ফেব্রুয়ারিতে শুরু হয়। এর কাজের ধারাগুলোতে scan-এর যন্ত্র ও পদ্ধতি পরীক্ষা, scan থেকে optical character recognition ও handwriting text recognition কীভাবে লেখা বের করে তা পর্যালোচনা, এবং AI-সহায়তায় metadata ও সংগ্রহ খোঁজার উপায় খতিয়ে দেখা রয়েছে। এসব কাজে ডিজিটাল ছবি, transcription ও catalogue record তৈরি হতে পারে। কোনো system scan করা পাতা পড়তে পারে কি না পরীক্ষা করলেই সেই পাতা বা transcription model-training dataset-এ ঢুকেছে—তা প্রমাণ হয় না।

Bodleian জানিয়েছে, তাদের Global Dissertations সংগ্রহ থেকে প্রায় ১,২৫,০০০ ছবি তোলা হয়েছে এবং হাতে লেখা catalogue card থেকে আরও ৪,২৯,০০০ file তৈরি হয়েছে। প্রকল্পের পাতায় dissertation নমুনাকে উনিশ ও বিশ শতকের ইউরোপীয় ও আমেরিকান PhD thesis বলা হয়েছে; ২০২৫ সালের ঘোষণায় আবার ১৪৯৮ থেকে ১৮৮৪ সালের ৩,৫০০ dissertation-এর কথা ছিল। প্রকাশ্য পাতাগুলোতে এই বর্ণনাগুলোর সঙ্গে scan বা হস্তান্তর করা উপকরণের সম্পর্ক ব্যাখ্যা করা হয়নি। এই সংখ্যা digitisation-এর ফল, OpenAI-র training data-র প্রকাশিত তালিকা নয়।

## নতুন প্রতিবেদন থেকে যা জানা যায়

Guardian বলেছে, OpenAI scan করা Bodleian উপকরণ নিয়ে অভ্যন্তরীণ নথিতে “OpenAI training set পূরণে” ব্যবহারের কথা আছে। আরও জানিয়েছে, ২০২৫ সালের জুনের মধ্যে ঐতিহাসিক dissertation-এর ১,২৫,০০০ ছবি OpenAI-র সঙ্গে ভাগ করা হয়েছিল; এবং scan করা অন্য লেখার মধ্যে ষোড়শ শতকের ১০,০০০ broadside ballad-ও ছিল। সব scan করা ballad training data-তে গেছে—এ প্রতিবেদন তা প্রতিষ্ঠা করে না। সংবাদপত্রটি বলেছে, তথ্য অধিকার আইনে পাওয়া বিশ্ববিদ্যালয়ের সভার কার্যবিবরণীতে অংশীদারত্বের সুনাম ও পরিবেশগত ঝুঁকি নিয়ে কর্মীদের উদ্বেগ নথিভুক্ত আছে। আমরা যে সূত্রগুলো দেখতে পেরেছি, তাতে ওই অভ্যন্তরীণ নথি প্রকাশিত হয়নি; তাই Guardian-এর বিবরণের বাইরে সেগুলোর সুনির্দিষ্ট ভাষা, তারিখ ও পরিধি এখানে যাচাই করা যায়নি।

বিশ্ববিদ্যালয়ের এক মুখপাত্র Guardian-কে বলেছেন, digitise করা উপকরণ পরিমাণে সীমিত, কপিরাইটমুক্ত এবং non-exclusive ভিত্তিতে OpenAI-কে দেওয়া হয়েছে। মুখপাত্রের বক্তব্য অনুযায়ী, Bodleian scan-এর অধিকার রেখেছে এবং কয়েক মাসের মধ্যে সেগুলো অনলাইনে উন্মুক্তভাবে প্রকাশ করার পরিকল্পনা করেছে। machine-learning অংশটি গোপন রাখা হয়েছে—এ কথাও মুখপাত্র নাকচ করে বলেন, প্রকল্পে training data-র অবদান থাকবে তা কর্মীরা খোলাখুলিভাবে জানিয়েছেন। OpenAI Guardian-কে বলেছে, ঐতিহাসিক জ্ঞান AI model-এ প্রতিফলিত হতে সাহায্য করতে তারা গর্বিত; তাদের প্রকাশিত [NextGenAI ঘোষণায়](https://openai.com/index/introducing-nextgenai/) Bodleian-এর কাজকে বিরল লেখা digitise করা এবং তা transcribe করতে নিজেদের API ব্যবহারের প্রকল্প হিসেবে বর্ণনা করা হয়েছে।

সব মিলিয়ে, প্রতিবেদন ও Oxford-এর জবাব থেকে বলা যায় যে এই ব্যবস্থার অংশ হিসেবে training data-তে অবদান রাখা হচ্ছে। কিন্তু কোন সংগ্রহের কোন উপকরণ কোন dataset-এ গেছে, ছবি না transcription ব্যবহার হয়েছে, প্রকাশিত কোনো নির্দিষ্ট model সেগুলো দিয়ে প্রশিক্ষিত কি না, কিংবা OpenAI কোন শর্তে উপকরণ পুনর্ব্যবহার করতে পারবে—এসব প্রতিষ্ঠিত হয় না। নির্দিষ্ট model-কে training দেওয়ার আগেই training set তৈরি হতে পারে। Oxford-এর প্রকাশ্য digitisation বিবরণ ও OpenAI-র ২০২৫ সালের ঘোষণা এই প্রশ্নগুলোর উত্তর দেয় না।

## training-এ কী গেছে তা বুঝতে আরও নথি দরকার

Oxford-এর প্রকল্পের পাতায় বলা হয়েছে, পাঁচটি কাজের ধারার প্রতিটির ওপর উন্মুক্ত প্রতিবেদন প্রকাশের পরিকল্পনা ছিল। OpenAI-কে দেওয়া উপকরণের নাম এবং তার অনুমোদিত training ব্যবহার জানানো কোনো প্রতিবেদন বা সংগ্রহ-তালিকা পণ্ডিতদের জনসাধারণের প্রবেশাধিকারের সুফলের সঙ্গে কোম্পানিকে দেওয়া data-র তুলনা করতে সাহায্য করবে। তত দিন দ্বিতীয় ব্যবহারের সবচেয়ে স্পষ্ট বিবরণ থাকবে Guardian-এর নথিভিত্তিক প্রতিবেদন এবং Oxford ও OpenAI-র দেওয়া জবাবে।

## সূত্র ও আরও পড়ুন

Guardian-এর [২৬ সেপ্টেম্বর ২০২৬-এর অনুসন্ধান](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) অভ্যন্তরীণ নথি নিয়ে দাবি, dissertation-এর ছবি ভাগ করা, সভার কার্যবিবরণীতে উদ্বেগ এবং Oxford ও OpenAI-র জবাবের মূল সূত্র। তাদের পেছনের অভ্যন্তরীণ নথি আমরা স্বাধীনভাবে পরীক্ষা করতে পারিনি।

[Oxford-এর ৪ মার্চ ২০২৫-এর সহযোগিতা ঘোষণা](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) public-domain pilot এবং গবেষকদের জন্য উপকরণ উন্মুক্ত করার পরিকল্পনা তুলে ধরে। এতে OpenAI model training-এর ব্যবহারের উল্লেখ নেই।

এই [Bodleian Digitisation Research প্রকল্পের পাতা](https://www.bodleian.ox.ac.uk/node/4611321) pilot-এর কাজের ধারা ও ছবির সংখ্যা জানায়। সংখ্যাগুলো scan-এর ফল; ওই পাতায় training dataset বা তাতে প্রশিক্ষিত কোনো model শনাক্ত করা হয়নি।

[OpenAI-র ৪ মার্চ ২০২৫-এর NextGenAI ঘোষণা](https://openai.com/index/introducing-nextgenai/) Bodleian-এ digitisation ও API দিয়ে transcription-এর কথা বলে। এতে training set-এর উপাদান বা scan-এ প্রশিক্ষিত কোনো model শনাক্ত করা হয়নি।

## Sources

- [The Guardian: Oxford lets OpenAI train its AI models on Bodleian Library](https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt) — ২৬ সেপ্টেম্বর ২০২৬-এর মূল প্রতিবেদনে অভ্যন্তরীণ নথি ও বিশ্ববিদ্যালয়ের সভার কার্যবিবরণীর কথা আছে; Oxford ও OpenAI-র জবাবও রয়েছে। পেছনের অভ্যন্তরীণ নথি আমরা স্বাধীনভাবে পরীক্ষা করতে পারিনি; তাই training set-সংক্রান্ত ভাষা ও উপকরণ ভাগের বিবরণ Guardian-এর নামে আরোপ করা হয়েছে।
- [Oxford and OpenAI launch collaboration to advance research and education](https://www.bodleian.ox.ac.uk/about/media/oxford-and-openai-launch) — Oxford-এর ৪ মার্চ ২০২৫-এর ঘোষণায় public-domain Bodleian digitisation pilot, গবেষকদের জন্য প্রবেশাধিকার এবং প্রাথমিক dissertation সংগ্রহের কথা আছে। এতে training data ব্যবহারের কথা নির্দিষ্ট করা হয়নি।
- [Bodleian Digitisation Research প্রকল্প](https://www.bodleian.ox.ac.uk/node/4611321) — Bodleian-এর প্রকাশ্য প্রকল্প-পাতায় scan, OCR/HTR, metadata ও অনুসন্ধান-সুবিধার কাজের ধারা এবং ছবির সংখ্যা আছে। এগুলো digitisation-এর ফল, OpenAI-র training উপকরণের প্রকাশিত তালিকা নয়।
- [OpenAI: Introducing NextGenAI](https://openai.com/index/introducing-nextgenai/) — OpenAI-র ৪ মার্চ ২০২৫-এর ঘোষণায় Bodleian-এর digitisation ও নিজেদের API দিয়ে transcription-এর কথা আছে। এতে training set বা উপকরণ দিয়ে প্রশিক্ষিত কোনো model শনাক্ত করা হয়নি।