৫ অক্টোবর textGrain ঘোষণা করে OpenAI। এটি একটি অদৃশ্য ওয়াটারমার্ক, যা মডেলগুলোর বেছে নেওয়া শব্দের পরিসংখ্যানগত ধরন বদলে দেয়। কোম্পানির ভাষ্য, ইইউর টেক্সটের উৎস-সংক্রান্ত নিয়মের জবাবে ধাপে ধাপে এটি চালু করা হচ্ছে। সামঞ্জস্যপূর্ণ ডিটেক্টর কোনো অনুচ্ছেদে সেই ধরন খুঁজতে পারে, তবে ফলাফল থেকে OpenAI-এর কোনো ব্যবস্থা টেক্সটটি তৈরি বা প্রক্রিয়া করেছে কি না, সে বিষয়ে কেবল সীমিত ইঙ্গিত মেলে।

মূল পরিবর্তন

  • কী বদলেছে: টেক্সটের উৎস শনাক্তকরণকে গবেষণার বিষয় থেকে সীমিত পর্যায়ের উন্মুক্তিতে নিচ্ছে OpenAI। ইইউতে শর্তপূরণকারী ChatGPT ও Codex আউটপুটে আগামী কয়েক সপ্তাহে ওয়াটারমার্ক যোগ হবে; নির্বাচিত API গ্রাহকেরা এখনই বিশ্বজুড়ে এটি চালু করতে পারেন।
  • কেন গুরুত্বপূর্ণ: AI-লিখিত টেক্সট যাচাই করা প্রতিষ্ঠানগুলো ভবিষ্যতে শব্দচয়নের মধ্যেই থাকা সংকেত পেতে পারে। OpenAI-র প্রকাশিত ফলাফল দেখায়, ডিটেক্টরের ফল বুঝতে প্রেক্ষাপট কেন জরুরি: ছোট বা কঠোরভাবে সীমাবদ্ধ অনুচ্ছেদ এবং সম্পাদিত টেক্সট শনাক্তকরণ এড়িয়ে যেতে পারে, আর ভুলভাবে শনাক্ত হওয়ার সম্ভাবনাও থাকে।
  • কী লক্ষ করবেন: তাৎক্ষণিক পরীক্ষা হলো, দৈনন্দিন ব্যবহারে বিভিন্ন দৈর্ঘ্য, বিষয় ও ভাষার টেক্সটে সংকেতটি কতটা নির্ভরযোগ্যভাবে টিকে থাকে। এই সীমাগুলো মূল্যায়নের সময় OpenAI অনুমোদিত গবেষক ও বিশেষজ্ঞ সংস্থার জন্য ডিটেক্টরের প্রবেশাধিকার সীমিত রাখছে।

দুটি উন্মুক্তি, প্রবেশাধিকারের নিয়ম আলাদা

OpenAI জানিয়েছে আগামী কয়েক সপ্তাহে ইউরোপীয় ইউনিয়নের সব প্ল্যানে শর্তপূরণকারী ChatGPT ও Codex-এর টেক্সট আউটপুটে textGrain যোগ করা হবে। এটি পরিকল্পিত আঞ্চলিক বিস্তার; এর অর্থ এই নয় যে আজ ইইউর প্রতিটি উত্তরে ওয়াটারমার্ক রয়েছে। API-তে ৫ অক্টোবর থেকে বিশ্বজুড়ে গ্রাহকেরা নির্বাচিত মডেলে এটি চালু করতে পারবেন; ডিফল্টভাবে ওয়াটারমার্ক বন্ধ থাকে। OpenAI বলেছে, প্রকল্প বা প্রতিষ্ঠানের সেটিংসে গ্রাহকেরা এটি চালু করে সমর্থিত মডেল বেছে নিতে পারেন। উপযুক্ত মডেলের তালিকা ওই সেটিংসে দেখা যায় এবং বদলাতে পারে।

সম্ভাব্য শব্দ বা শব্দাংশ—যেগুলোকে টোকেন বলা হয়—থেকে মডেল কীভাবে বেছে নেয়, তার ওপর textGrain কাজ করে। OpenAI বলেছে, একটি গোপন কী তৈরির সময় এই বাছাইয়ে সামান্য পরিবর্তন আনে। এরপর একই কী ও সেটিংসযুক্ত ডিটেক্টর দেখে, অনুচ্ছেদে তৈরি হওয়া পরিসংখ্যানগত ধরনটি আছে কি না। ওয়াটারমার্ক কোনো লুকানো অক্ষর, ফাঁক বা দৃশ্যমান যতিচিহ্ন যোগ করে না। তাই টেক্সট কপি করতে আলাদা মেটাডেটা বহন করতে হয় না, তবে শব্দ অপরিবর্তিত রাখলেই সংকেত শনাক্ত হবে—এমন নিশ্চয়তা নেই।

এই পার্থক্য অনুচ্ছেদ যাচাই করতে কারা পারবেন, সেটিও সীমিত করে। OpenAI টেক্সট ডিটেক্টর ব্যবহারের আবেদন নিচ্ছে; প্রাথমিকভাবে অনুমোদিত গবেষক ও বিশেষজ্ঞ সংস্থার কাছ থেকে। চালুর সময় ডিটেক্টরটি জনসাধারণের জন্য খুলে দেওয়া হচ্ছে না। সমর্থিত ছবি ও অডিও যাচাইয়ের জন্য তাদের প্রকাশ্য সরঞ্জামগুলো আলাদা; সেগুলো textGrain পরীক্ষা করার উন্মুক্ত সুযোগ দেয় না।

সংকেতটি বাদ পড়তে পারে বা ভুলভাবে ধরা পড়তে পারে

একটি মূল্যায়নে OpenAI শনাক্তকরণের হার জানিয়েছে ১% লক্ষ্যভিত্তিক ভুল-ইতিবাচক হারের শর্তে। মনোবিজ্ঞানের অনুচ্ছেদে, ২০০ টোকেনের নমুনার প্রায় ৮০% এবং ৪০০ টোকেনের নমুনার প্রায় ৯৫%-এ ডিটেক্টর ওয়াটারমার্ক পেয়েছে। গণিতে শনাক্তকরণ উল্লেখযোগ্যভাবে কম ছিল বলে জানিয়েছে কোম্পানিটি, কারণ সেখানে শব্দচয়নের স্বাধীনতা কম। নির্দিষ্ট শর্তে কোম্পানির মূল্যায়নের ফল এগুলো; বাস্তবে পাওয়া টেক্সটে মাপা সফলতার হার নয়।

৪০০ টোকেনের অনুচ্ছেদ নিয়ে কোম্পানির আরেক পরীক্ষায় সম্পাদনা সংকেত দুর্বল করেছে: ১০% শব্দ সমার্থক শব্দ দিয়ে বদলালে শনাক্তকরণ প্রায় ৯২% থেকে ৬৬%-এ নেমেছে; ২৫% বদলালে তা ১৭% হয়েছে। OpenAI-র নথি অনুযায়ী, অনুবাদ, ব্যাপক পুনর্লিখন, ছোট উত্তর ও কোডও শনাক্ত করা কঠিন। ভাষাভেদে শনাক্তকরণ বদলায় বলে জানিয়েছে কোম্পানি। তাই নেগেটিভ ফল থেকে টেক্সটটি মানুষ লিখেছে বলে প্রমাণ হয় না। অনুচ্ছেদটি খুব ছোট বা সম্পাদিত হতে পারে, চালুর আগে তৈরি হতে পারে, কিংবা এমন মডেল বা পণ্য থেকে আসতে পারে যার আওতায় এই ওয়াটারমার্ক নেই।

পজিটিভ ফলেরও সীমা আছে। ডিটেক্টর ভুল করে ওয়াটারমার্কের উপস্থিতি জানাতে পারে। সংকেত পেলে OpenAI-র ভাষ্য, সেটি প্রমাণ করে যে তাদের ব্যবস্থা সম্ভবত অনুচ্ছেদের অন্তত কিছু অংশ তৈরি বা প্রক্রিয়া করেছে। এতে কোনো ব্যক্তির অবদানের পরিমাণ মাপা যায় না, অ্যাকাউন্ট বা প্রম্পট শনাক্ত হয় না, কিংবা কে লিখেছে, মালিক বা দায়ী—তা স্থির হয় না। অনুচ্ছেদটি সঠিক কি না, তাও যাচাই করা যায় না। ফলাফল থেকে একা বোঝা যায় না কে সরঞ্জামটি ব্যবহার করেছে।

আরও মূল্যায়নের পরিকল্পনা করেছে OpenAI এবং textGrain-কে ওপেন-সোর্স প্রযুক্তি হিসেবে প্রকাশের ইচ্ছা জানিয়েছে। আপাতত বাস্তব পরিবর্তনটি সীমিত: OpenAI-র নতুন তৈরি কিছু টেক্সটে যন্ত্রে-পাঠযোগ্য সংকেত থাকবে, তবে তা পরীক্ষা করার উপায় এবং সেই সংকেত থেকে সমর্থিত সিদ্ধান্ত সীমাবদ্ধই থাকবে। OpenAI-র ঘোষণা ও সহায়তা নথির ভিত্তিতে প্রতিবেদনটি তৈরি; BIG CHANGE ওয়াটারমার্কযুক্ত টেক্সট তৈরি করেনি বা ডিটেক্টর চালায়নি।