প্রতিষ্ঠানগুলো model-এর উত্তর তুলনা করতে, ভুল ব্যাখ্যা করতে এবং ভালো কাজের উদাহরণ দিতে মানুষকে নিয়োগ করে। এ কাজে শুধু ঝকঝকে উত্তরই পুরো মূল্য নয়। ক্রেতা হয়তো এমন বিচারবুদ্ধির জন্য মূল্য দিচ্ছেন, যা পর্যালোচনাধীন model থেকে আসেনি।

404 Media-র প্রতিবেদন-এ OpenAI-সংশ্লিষ্ট প্রকল্পে কাজ করা তিনজন contractor AI ব্যবহার নিষিদ্ধ করার নিয়মের কথা বলেছেন; তাঁদের মধ্যে দুজন জানান, এ কারণে contractor-দের প্রকল্প থেকে সরানো হয়েছিল। সাক্ষাৎকারে থাকা দুই ব্যক্তিকে কাজ দেওয়া Mercor প্রকাশনাটিকে বলেছে, প্রকল্পের কাজ শেষ করতে বড় ভাষা model ব্যবহার তাদের চুক্তিতে নিষিদ্ধ, এবং লঙ্ঘন নিশ্চিত হলে সংশ্লিষ্ট ব্যক্তিকে সরানো হয়। OpenAI মন্তব্য করতে অস্বীকার করেছে। আমরা ব্যক্তিগত প্রকল্পের নথি দেখিনি এবং আলাদা ঘটনাগুলো স্বাধীনভাবে যাচাইও করিনি।

একটি contractor platform-এর বাইরে বড় প্রশ্নটি হলো: ব্যবসা যখন স্বাধীন মানবিক পর্যালোচনা চায়, তখন সেই কাজকে AI-সহায়তা যেখানে গ্রহণযোগ্য, সেখান থেকে কীভাবে আলাদা রাখা যায়?

বড় পরিবর্তন

  • কী বদলেছে: contractor-দের নিয়ে বিরোধের এই প্রতিবেদন AI প্রশিক্ষণের কাজে আসলে কী দরকার, তা নিয়ে টানাপোড়েন দেখায়: সম্পন্ন উত্তর, নাকি স্বাধীন মানবিক মূল্যায়ন।
  • কেন গুরুত্বপূর্ণ: Mercor-এর প্রকাশ্য pilot-এ পেশাগত বিচারবুদ্ধিকেই পরিমাপ করা হয়। model-কে দিয়ে তৈরি ranking সেই বিচারবুদ্ধির জায়গা নিলে জমা দেওয়া কাজ সুন্দরভাবে লেখা হলেও মূল্যায়নের মাপকাঠি বদলে যায়।
  • কী লক্ষ করবেন: মূল্যায়ন কেনা প্রতিষ্ঠানকে ঠিক করতে হবে, কোন ধাপে AI-সহায়তা ছাড়া বিচার করতে হবে। কাজ গ্রহণের আগে কাজের নির্দেশনায় এই শর্ত স্পষ্ট থাকা উচিত।

যে মূল্য কেনা হচ্ছে, তা হতে পারে স্বাধীন বিচারবুদ্ধি

কাজ যদি দ্রুত প্রথম খসড়া তৈরি করা হয়, AI সহকারী কাজে লাগে। কিন্তু কাজটি যদি প্রেক্ষাপটসহ উত্তর বা স্বাধীন তুলনা দেওয়া হয় এবং এই পার্থক্য আড়াল করা হয়, তখন সেই সহায়কই সমস্যা হয়ে দাঁড়ায়।

Mercor-এর প্রকাশ্য শিল্পখাতের বিশেষজ্ঞদের জন্য model-evaluation pilot-এ এই শর্তটি অস্বাভাবিক রকম স্পষ্ট। বিশেষজ্ঞরা পেশাগত কাজ করেন, model-এর পাঁচটি প্রচেষ্টার ranking ও score দেন এবং প্রমাণভিত্তিক যুক্তি লেখেন। তালিকা অনুযায়ী, আগে থেকে কোনো rubric বা সঠিক উত্তর দেওয়া হয় না, কারণ মাপা হচ্ছে পেশাগত বিচারবুদ্ধি। কাজ সমাধান, ranking, scoring ও যুক্তি লেখার সময় AI সহায়ক ব্যবহার নিষিদ্ধ।

এই শর্তগুলো একটি pilot-এর বিবরণ। এটি নির্ভর করে বিশেষজ্ঞের নিজস্ব মূল্যায়নের ওপর; সেই মূল্যায়ন model-কে দিয়ে করালে পরীক্ষাটিই বদলে যায়।

Synthetic প্রতিক্রিয়া মানেই খারাপ data নয়

AI-তৈরি প্রতিটি প্রশিক্ষণ-উত্তরকে “model collapse”-এর সঙ্গে জুড়ে দেওয়ার প্রবণতা থাকতে পারে। এখানে এমন সিদ্ধান্তে পৌঁছানোর মতো প্রমাণ নেই। Nature-এ প্রকাশিত গবেষণায় এমন পুনরাবৃত্ত প্রশিক্ষণ-পদ্ধতি পরীক্ষা করা হয়েছে, যেখানে মূল বণ্টন থেকে নেওয়া data-র বদলে তৈরি data ব্যবহৃত হয়। ওই পরীক্ষায় পরপর প্রশিক্ষিত model মূল বণ্টন সম্পর্কে তথ্য হারিয়েছে। গবেষণাটি প্রতিবেদন করা contractor-দের কাজ পরীক্ষা করেনি, কিংবা নির্দিষ্ট কোনো rating OpenAI-র deployed model-কে প্রভাবিত করেছিল কি না তাও বলেনি।

আরেকটি model-collapse গবেষণা দেখায়, এই পার্থক্য কেন জরুরি। গবেষকেরা দেখেছেন, প্রতিটি প্রজন্মে synthetic data মূল বাস্তব data-র জায়গা নিলে model collapse হয়; তবে তাঁদের পরীক্ষায় বাস্তব data রেখে তার সঙ্গে synthetic data যোগ করলে তা হয়নি। এতে প্রমাণ হয় না যে সব মিশ্রণ নিরাপদ। বরং বোঝা যায়, শুধু “AI-তৈরি” বললে যথেষ্ট ব্যাখ্যা হয় না; data-র উৎস, নির্বাচন ও প্রশিক্ষণ-পদ্ধতিও গুরুত্বপূর্ণ।

অনুমোদিত workflow স্পষ্ট করুন

সংক্ষিপ্ত বিবরণে কোন tool অনুমোদিত, কোন ধাপে AI-সহায়তা ছাড়া বিচার চাই এবং সহায়তা নেওয়া হলে কীভাবে তা জানাতে হবে—এসব স্পষ্ট থাকা দরকার। Mercor-এর pilot-এ কাজ সমাধান এবং মূল্যায়ন—দুটির ক্ষেত্রেই স্বাধীনতা নির্দিষ্ট করা হয়েছে। সহায়তা নিয়ে করা কাজ যেসব ক্রেতা গ্রহণ করবেন, তাঁদের বলা উচিত কর্মীর কাছ থেকে কোন পেশাগত বিচারবুদ্ধি এখনো প্রত্যাশিত।

পর্যালোচনাতেও একই সতর্কতা দরকার। 404 Media-র প্রতিবেদন অনুযায়ী, একটি অভ্যন্তরীণ নথিতে পর্যালোচকদের AI শনাক্তকরণ tool ব্যবহার না করতে বলা হয়েছিল; সেগুলোকে অবিশ্বস্ত বলা হয়। এটি ব্যবস্থাপনার একটি মৌলিক নীতির সঙ্গে মেলে: যতিচিহ্ন, গতি বা ঝকঝকে ভাষা—কোনোটিই প্রমাণ করে না যে কেউ model ব্যবহার করেছেন। পর্যালোচক যুক্তিতে মূল উৎসের উল্লেখ আছে কি না দেখতে পারেন, কর্মীকে সিদ্ধান্ত ব্যাখ্যা করতে বলতে পারেন, বারবার জমা দেওয়া কাজ তুলনা করতে পারেন এবং প্রকল্পের নিয়ম মেনে আইনত সংগ্রহ করা tool record দেখতে পারেন। শুধু লেখার ধরন দেখে কোনো কর্মীর বিষয়ে সিদ্ধান্ত হওয়া উচিত নয়।

কর্মীদের অনুমান করতে হয় এমন খেলা নয়, চ্যালেঞ্জ করা যায় এমন নিয়ম দরকার

স্বাধীন contractor-কে দ্রুত প্রকল্প থেকে সরানো যায়। তাই বিশ্বাসযোগ্য প্রক্রিয়ায় কাজ শুরু ও পারিশ্রমিকযুক্ত task গ্রহণের আগেই নিয়ম জানাতে হবে, সন্দেহভাজন লঙ্ঘন আর নিশ্চিত লঙ্ঘন আলাদা করতে হবে এবং প্রাসঙ্গিক প্রমাণ ব্যাখ্যা করার সুযোগ দিতে হবে। এটি ন্যায্য প্রক্রিয়ার সুপারিশ; কোনো চুক্তি বা আইনে থাকা অধিকারের দাবি নয়।

অন্যদিকে, AI-সহায়তা ছাড়া বিচার করার শর্তকে কর্মীদের কাজের বিবরণের অংশ হিসেবে দেখা উচিত। অনুমোদিত tool অপরিহার্য মনে হলে, ব্যবহার করার আগে তারা জিজ্ঞেস করতে পারেন বা কাজটি প্রত্যাখ্যান করতে পারেন। model সুন্দর ভাষা লিখতে পারে বলেই গোপন সহায়তা গ্রহণযোগ্য হয়ে যায় না—যেমন উত্তর সঠিক হলেই নিষিদ্ধ বাহ্যিক সহায়তা গ্রহণযোগ্য হয় না।

কে বিচার করেছেন তা স্পষ্ট করুন

Mercor-এর প্রকাশ্য pilot-এ কাজের বিবরণ পরিষ্কার: পেশাজীবীর AI-সহায়তা ছাড়া করা মূল্যায়ন। সহায়তাযুক্ত কাজের জন্য ক্রেতাদেরও ঠিক ততটাই স্পষ্ট করে বলা উচিত কোন tool অনুমোদিত এবং কর্মীর কাছ থেকে কী ধরনের বিচার প্রত্যাশিত।