Oxford, OpenAI-র সঙ্গে তাদের যৌথ কাজকে public-domain গ্রন্থাগার সামগ্রী scan করে গবেষকদের জন্য সহজে খুঁজে পাওয়ার ব্যবস্থা হিসেবে তুলে ধরেছে। Guardian-এর ২৬ সেপ্টেম্বরের প্রতিবেদনে বলা হয়েছে, বিশ্ববিদ্যালয়ের অভ্যন্তরীণ নথিতে digitise করা সামগ্রী OpenAI-র training set-এ যোগ করার কাজে লাগবে বলে বর্ণনা আছে। Oxford-এর এক মুখপাত্র সংবাদপত্রটিকে বলেছেন, প্রকল্প থেকে training data-তে অবদান রাখা হবে—এ কথা কর্মীরা খোলাখুলিভাবে জানিয়েছেন। প্রকাশ্য প্রকল্প-বিবরণে scan ও transcription নিয়ে গবেষণার বিশদ আছে, কিন্তু দ্বিতীয় ব্যবহারটি নির্দিষ্ট করা হয়নি।

মূল পরিবর্তন: digitisation-এ AI training-ও যুক্ত

  • কী বদলেছে: Oxford প্রকাশ্য digitisation pilot-এর পাশাপাশি training data তৈরির উদ্দেশ্যও স্বীকার করেছে, Guardian-এর অভ্যন্তরীণ নথি নিয়ে প্রতিবেদন প্রকাশের পর। Bodleian-এর উপকরণে প্রশিক্ষিত কোনো model-এর নাম এখনও প্রকাশ্য নথিতে নেই।
  • কেন গুরুত্বপূর্ণ: গ্রন্থাগার searchable ডিজিটাল সংগ্রহ তৈরি করতে পারে, আর প্রযুক্তি-সহযোগী পেতে পারে AI উন্নয়নের উপকরণ। বিনিময়টি বোঝার জন্য কোন সংগ্রহ কোন কাজে ব্যবহৃত হয়েছে—গবেষক ও সাধারণ মানুষের তা জানা দরকার।
  • যা নজরে রাখা দরকার: scan-এর অধিকার তাদের কাছেই আছে এবং digitise করা উপকরণ প্রকাশ্যে দেওয়ার পরিকল্পনা আছে বলে Oxford জানিয়েছে। OpenAI-কে কোন সংগ্রহ থেকে কী দেওয়া হয়েছে এবং তা কোন training কাজে লাগবে—এমন সংগ্রহভিত্তিক বিবরণ চুক্তিটি যাচাই করা সহজ করবে।

প্রকাশ্য প্রকল্পে scan ও transcription-এর কথা আছে

Oxford-এর ২০২৫ সালের মার্চের ঘোষণায় আগে অনলাইনে না থাকা public-domain Bodleian উপকরণ digitise করার pilot-এর কথা ছিল। প্রাথমিক সংগ্রহে ১৪৯৮ থেকে ১৮৮৪ সালের ৩,৫০০টি বৈশ্বিক dissertation-এর নাম দেওয়া হয়েছিল; ফলাফল বিশ্বের শিক্ষার্থী ও গবেষকদের জন্য searchable ও সহজলভ্য হবে বলেও জানানো হয়। ঘোষণায় উপকরণ OpenAI-র training set-এ দেওয়ার কথা ছিল না।

Bodleian-এর প্রকল্পের পাতায় বলা হয়েছে, OpenAI-র অর্থায়নে pilot-টি ২০২৫ সালের ফেব্রুয়ারিতে শুরু হয়। এর কাজের ধারাগুলোতে scan-এর যন্ত্র ও পদ্ধতি পরীক্ষা, scan থেকে optical character recognition ও handwriting text recognition কীভাবে লেখা বের করে তা পর্যালোচনা, এবং AI-সহায়তায় metadata ও সংগ্রহ খোঁজার উপায় খতিয়ে দেখা রয়েছে। এসব কাজে ডিজিটাল ছবি, transcription ও catalogue record তৈরি হতে পারে। কোনো system scan করা পাতা পড়তে পারে কি না পরীক্ষা করলেই সেই পাতা বা transcription model-training dataset-এ ঢুকেছে—তা প্রমাণ হয় না।

Bodleian জানিয়েছে, তাদের Global Dissertations সংগ্রহ থেকে প্রায় ১,২৫,০০০ ছবি তোলা হয়েছে এবং হাতে লেখা catalogue card থেকে আরও ৪,২৯,০০০ file তৈরি হয়েছে। প্রকল্পের পাতায় dissertation নমুনাকে উনিশ ও বিশ শতকের ইউরোপীয় ও আমেরিকান PhD thesis বলা হয়েছে; ২০২৫ সালের ঘোষণায় আবার ১৪৯৮ থেকে ১৮৮৪ সালের ৩,৫০০ dissertation-এর কথা ছিল। প্রকাশ্য পাতাগুলোতে এই বর্ণনাগুলোর সঙ্গে scan বা হস্তান্তর করা উপকরণের সম্পর্ক ব্যাখ্যা করা হয়নি। এই সংখ্যা digitisation-এর ফল, OpenAI-র training data-র প্রকাশিত তালিকা নয়।

নতুন প্রতিবেদন থেকে যা জানা যায়

Guardian বলেছে, OpenAI scan করা Bodleian উপকরণ নিয়ে অভ্যন্তরীণ নথিতে “OpenAI training set পূরণে” ব্যবহারের কথা আছে। আরও জানিয়েছে, ২০২৫ সালের জুনের মধ্যে ঐতিহাসিক dissertation-এর ১,২৫,০০০ ছবি OpenAI-র সঙ্গে ভাগ করা হয়েছিল; এবং scan করা অন্য লেখার মধ্যে ষোড়শ শতকের ১০,০০০ broadside ballad-ও ছিল। সব scan করা ballad training data-তে গেছে—এ প্রতিবেদন তা প্রতিষ্ঠা করে না। সংবাদপত্রটি বলেছে, তথ্য অধিকার আইনে পাওয়া বিশ্ববিদ্যালয়ের সভার কার্যবিবরণীতে অংশীদারত্বের সুনাম ও পরিবেশগত ঝুঁকি নিয়ে কর্মীদের উদ্বেগ নথিভুক্ত আছে। আমরা যে সূত্রগুলো দেখতে পেরেছি, তাতে ওই অভ্যন্তরীণ নথি প্রকাশিত হয়নি; তাই Guardian-এর বিবরণের বাইরে সেগুলোর সুনির্দিষ্ট ভাষা, তারিখ ও পরিধি এখানে যাচাই করা যায়নি।

বিশ্ববিদ্যালয়ের এক মুখপাত্র Guardian-কে বলেছেন, digitise করা উপকরণ পরিমাণে সীমিত, কপিরাইটমুক্ত এবং non-exclusive ভিত্তিতে OpenAI-কে দেওয়া হয়েছে। মুখপাত্রের বক্তব্য অনুযায়ী, Bodleian scan-এর অধিকার রেখেছে এবং কয়েক মাসের মধ্যে সেগুলো অনলাইনে উন্মুক্তভাবে প্রকাশ করার পরিকল্পনা করেছে। machine-learning অংশটি গোপন রাখা হয়েছে—এ কথাও মুখপাত্র নাকচ করে বলেন, প্রকল্পে training data-র অবদান থাকবে তা কর্মীরা খোলাখুলিভাবে জানিয়েছেন। OpenAI Guardian-কে বলেছে, ঐতিহাসিক জ্ঞান AI model-এ প্রতিফলিত হতে সাহায্য করতে তারা গর্বিত; তাদের প্রকাশিত NextGenAI ঘোষণায় Bodleian-এর কাজকে বিরল লেখা digitise করা এবং তা transcribe করতে নিজেদের API ব্যবহারের প্রকল্প হিসেবে বর্ণনা করা হয়েছে।

সব মিলিয়ে, প্রতিবেদন ও Oxford-এর জবাব থেকে বলা যায় যে এই ব্যবস্থার অংশ হিসেবে training data-তে অবদান রাখা হচ্ছে। কিন্তু কোন সংগ্রহের কোন উপকরণ কোন dataset-এ গেছে, ছবি না transcription ব্যবহার হয়েছে, প্রকাশিত কোনো নির্দিষ্ট model সেগুলো দিয়ে প্রশিক্ষিত কি না, কিংবা OpenAI কোন শর্তে উপকরণ পুনর্ব্যবহার করতে পারবে—এসব প্রতিষ্ঠিত হয় না। নির্দিষ্ট model-কে training দেওয়ার আগেই training set তৈরি হতে পারে। Oxford-এর প্রকাশ্য digitisation বিবরণ ও OpenAI-র ২০২৫ সালের ঘোষণা এই প্রশ্নগুলোর উত্তর দেয় না।

training-এ কী গেছে তা বুঝতে আরও নথি দরকার

Oxford-এর প্রকল্পের পাতায় বলা হয়েছে, পাঁচটি কাজের ধারার প্রতিটির ওপর উন্মুক্ত প্রতিবেদন প্রকাশের পরিকল্পনা ছিল। OpenAI-কে দেওয়া উপকরণের নাম এবং তার অনুমোদিত training ব্যবহার জানানো কোনো প্রতিবেদন বা সংগ্রহ-তালিকা পণ্ডিতদের জনসাধারণের প্রবেশাধিকারের সুফলের সঙ্গে কোম্পানিকে দেওয়া data-র তুলনা করতে সাহায্য করবে। তত দিন দ্বিতীয় ব্যবহারের সবচেয়ে স্পষ্ট বিবরণ থাকবে Guardian-এর নথিভিত্তিক প্রতিবেদন এবং Oxford ও OpenAI-র দেওয়া জবাবে।

সূত্র ও আরও পড়ুন

Guardian-এর ২৬ সেপ্টেম্বর ২০২৬-এর অনুসন্ধান অভ্যন্তরীণ নথি নিয়ে দাবি, dissertation-এর ছবি ভাগ করা, সভার কার্যবিবরণীতে উদ্বেগ এবং Oxford ও OpenAI-র জবাবের মূল সূত্র। তাদের পেছনের অভ্যন্তরীণ নথি আমরা স্বাধীনভাবে পরীক্ষা করতে পারিনি।

Oxford-এর ৪ মার্চ ২০২৫-এর সহযোগিতা ঘোষণা public-domain pilot এবং গবেষকদের জন্য উপকরণ উন্মুক্ত করার পরিকল্পনা তুলে ধরে। এতে OpenAI model training-এর ব্যবহারের উল্লেখ নেই।

এই Bodleian Digitisation Research প্রকল্পের পাতা pilot-এর কাজের ধারা ও ছবির সংখ্যা জানায়। সংখ্যাগুলো scan-এর ফল; ওই পাতায় training dataset বা তাতে প্রশিক্ষিত কোনো model শনাক্ত করা হয়নি।

OpenAI-র ৪ মার্চ ২০২৫-এর NextGenAI ঘোষণা Bodleian-এ digitisation ও API দিয়ে transcription-এর কথা বলে। এতে training set-এর উপাদান বা scan-এ প্রশিক্ষিত কোনো model শনাক্ত করা হয়নি।