তিনটি নতুন preprint Jev-কে বিভিন্নভাবে evaluator হিসেবে পরীক্ষা করেছে। একটিতে উত্তর-পছন্দ ও প্রমাণভিত্তিক তথ্য যাচাইয়ে শক্তিশালী language-model judge-এর কাছাকাছি ফল পাওয়া যায়; এরপর অনিশ্চিত ক্ষেত্রে confidence দিয়ে অন্যের কাছে পাঠানো হয়। দ্বিতীয় গবেষণায় grade দেওয়া rubric-এ এই routing থেকে সামান্য লাভ মেলে, কারণ fallback model-গুলো প্রায়ই Jev-এর আত্মবিশ্বাসী ভুলই আবার করে। তৃতীয় চিকিৎসা benchmark-এ research abstract-ভিত্তিক প্রশ্নে কাছাকাছি accuracy, কিন্তু কঠিন diagnosis case-এ বড় ব্যবধান দেখা যায়।

বাস্তব উত্তরটি “AI দিয়ে AI-কে বিচার করানো যায়” কথাটির চেয়ে সীমিত। নির্দিষ্ট ও ভালোভাবে সংজ্ঞায়িত কাজে Jev দ্রুত প্রথম ধাপের judge হতে পারে; কিন্তু সব ধরনের উত্তরের জন্য এক নির্ভরযোগ্য বিচারক হিসেবে প্রমাণ নেই। confidence কেবল তখনই কাজ বণ্টনে সাহায্য করতে পারে, যখন কোনো দল নিজেদের উদাহরণে যাচাই করেছে এটি কী অনুমান করতে পারে।

কোনো model-এর বিচারক হওয়ার অর্থ

evaluator এক বা একাধিক model-এর output নিয়ে কোনো নিয়মে score বা verdict দেয়। judge prompt আরও ভালো মানে—এমন দুটি উত্তরের মধ্যে বেছে নিতে পারে, দেওয়া document কোনো দাবি সমর্থন করে কি না ঠিক করতে পারে, rubric অনুযায়ী উত্তরকে score দিতে পারে, অথবা চিকিৎসা-সংক্রান্ত multiple-choice case থেকে সঠিক বিকল্প বেছে নিতে পারে। এসব কাজ evaluator-এর কাছ থেকে আলাদা ধরনের দক্ষতা চায়।

Jev হলো TypeSafe-এর hosted decision model। এর API-তে structured input এবং অনুমোদিত response type পাঠালে নির্দিষ্ট label-গুলোর probability-সহ একটি choice বা score ফেরত আসে। সীমাবদ্ধ ফল আশা করে এমন software-এ কোনো কাজ সংযুক্ত করতে এই interface কাজে লাগতে পারে। তবে probability হলো model-এর অনুমান; এটি নিজে থেকে মূল উত্তরটি যাচাই করে না। TypeSafe-এর নথিতে interface বর্ণনা করা হয়েছে; নিচের গবেষণাগুলো নির্দিষ্ট test set-এ performance তুলনা করে।

এই JEV-as-a-Judge গবেষণা, 27 সেপ্টেম্বর সংশোধিত সংস্করণে, 16টি generative ও reward-model judge-এর সঙ্গে Jev 1.13-এর তুলনা করেছে। rubric-judge গবেষণা, 24 সেপ্টেম্বর পোস্ট করা, Jev-এর সঙ্গে তিনটি কম খরচের language model তুলনা করেছে। চিকিৎসা benchmark, 27 সেপ্টেম্বর পোস্ট করা, দুই reasoning setting-এ Jev 1.13 ও GPT-6 Sol-এর তুলনা করেছে। তিনটিই preprint। কোনোটিই clinical deployment study নয়, এবং কোনোটিই peer review পায়নি।

কিছু রায়ে কাছাকাছি, যুক্তিনির্ভর কাজে দুর্বল

প্রথম গবেষণায় preference pair, প্রমাণভিত্তিক factuality এবং final-answer check মিলিয়ে 5,172টি বিচার মূল্যায়ন করা হয়েছে; এরপর follow-up test ও বাইরে রাখা data-তে routing-এর দুটি study যোগ হয়েছে। Jev-এর প্রধান public benchmark score ছিল—RewardBench থেকে নমুনা নেওয়া 1,500 preference pair-এ 92.5%, JudgeBench-এর 350 pair-এ 78.6% এবং প্রমাণের বিপরীতে যাচাই করা HaluEval-এর 3,000 উত্তর-এ 87.3%। এসব কাজে সবচেয়ে শক্তিশালী GPT-6 Astra তুলনামূলকভাবে যথাক্রমে 92.5%, 93.1% ও 88.4% পেয়েছে। গবেষণার timing panel-এ Jev-এর প্রতি 1,000টি মূল বিচার করতে $0.044 এবং median latency 0.15 সেকেন্ড বলা হয়েছে; study-র শর্তে GPT-6 Astra-র খরচ ছিল $12.182 এবং সময় 1.89 সেকেন্ড।

এই গড় ফলাফলের আড়ালে লেখকদের চিহ্নিত সীমা আছে। chat quality, safety refusal ও প্রমাণভিত্তিক factuality-তে Jev, GPT-6-এর প্রায় দুই point-এর মধ্যে ছিল। কোনো ফল বের করা বা যাচাই করা দরকার এমন কাজে পিছিয়ে পড়ে: math-এ 14.3 point, code-এ 12.9 point এবং logic puzzle-এ 27.6 point। JudgeBench-এর objective correctness set-এ GPT-6-এর 93.1%-এর বিপরীতে Jev পেয়েছে 78.6%। 990টি item-এর একটি উপসেটে বিতর্কিত case-গুলোর blind adjudication-এ GPT-6, বিতর্কিত JudgeBench-এর 69টির মধ্যে 57টিতে জেতে; Jev জেতে একটিতে। adjudication সীমিত ও বাছাই করা ছিল, তবে এতে ইঙ্গিত মেলে ব্যবধানটি শুধু benchmark label-এর সমস্যার কারণে নয়।

এখানে “judge” বলতে বোঝানো হয়েছে দুটি তৈরি করা উত্তরের মধ্যে বেছে নেওয়া, অথবা দেওয়া reference অনুযায়ী একটিমাত্র উত্তর সমর্থিত বা সঠিক কি না ঠিক করা। লেখকেরা generative judge-দের Jev-এর মতো একই সীমাবদ্ধ verdict ও probability format দিয়েছেন, কোনো rationale ছাড়াই। তাই তুলনাটি ওই শর্তে verdict নিয়ে, কোন judge মানুষকে নিজের যুক্তি ভালোভাবে বোঝাতে পারে তা নিয়ে নয়।

ভুল আলাদা হলে confidence routing কাজে দেয়

cascade-এ প্রথমে কম খরচের judge ব্যবহার হয়, কিছু case বেশি ব্যয়বহুল fallback-এ পাঠানো হয়। প্রথম গবেষণায় rule ছিল: Jev-এর সবচেয়ে বেশি label probability অন্তত 0.9 হলে তার verdict গ্রহণ, কম হলে পরের model-এ পাঠানো। বাইরে রাখা 1,610টি preference pair-এ দুই order-এর cascade 31.5% case বাড়তি review-তে পাঠিয়ে GPT-6-এর 92.5%-এর বিপরীতে 93.4% score করেছে এবং GPT-6-এর fee-এর 41% খরচ হয়েছে। দুটি নতুন correctness workload থেকে আগে নির্দিষ্ট করা 570টি বাইরের pair-এর live test-এ Jev একা GPT-6-এর চেয়ে 14 point পিছিয়েছে; cascade 74% case বাড়তি review-তে পাঠিয়ে GPT-6-এর সমান accuracy পেয়েছে এবং তার fee-এর প্রায় এক-চতুর্থাংশ বাঁচিয়েছে।

এই ফলের একটি নির্দিষ্ট শর্ত আছে: Jev যে case-গুলোতে অনিশ্চিত, সেখানে এমন ভুল থাকতে হবে যা fallback সংশোধন করতে পারে। style-adversarial pair-এ confidence routing দুর্বল হয়েছে; reference-বিহীন prose-এ ব্যর্থ হয়েছে, যেখানে পরীক্ষিত সব judge-এর ফল প্রায় chance-এর সমান, কিন্তু তারা প্রায়ই আত্মবিশ্বাসী ছিল। দুই উত্তর কোন ক্রমে দেওয়া হয়েছে তার প্রভাবও দুই order-এর verdict গড় করলে কমে—গবেষণায় এমন পাওয়া গেছে। threshold স্থানীয়ভাবে label করা উদাহরণ দিয়ে বেছে নেওয়া হয়েছিল; paper-এ lower-confidence-bound পদ্ধতি ও বাইরে রাখা data-তে যাচাইয়ের পরামর্শ আছে।

আলাদা rubric গবেষণায় সাতটি benchmark থেকে নেওয়া নয়টি panel-এ প্রতি criterion অনুযায়ী score পরীক্ষা করা হয়েছে; মোট 5,003টি item–criterion pair। দুটি panel ছিল binary, সাতটিতে ordered rating scale ছিল। চার judge-ই একই criterion text পেয়েছে এবং evaluation-এর আগে লেখকেরা rubric স্থির করেছিলেন। 27টি paired comparison-এর আটটির 95% confidence interval-এ শূন্য accuracy difference ছিল না; multiple comparison সংশোধনের পর চারটি রয়ে যায়। অন্য কিছু comparison paper-এ নির্ধারিত equivalence margin পূরণ করেছে, আবার অনেকগুলোর ফল এত অনির্দিষ্ট যে পার্থক্য বা সমতা—কোনোটিই প্রতিষ্ঠিত হয়নি। binary criterion-এ অন্যদের তুলনায় Jev সেরা করেছিল। graded panel-এ matched judge-দের মধ্যে এটি কখনো শীর্ষে ছিল না; আর সব judge-ই human rater-দের চেয়ে সাধারণত কম score দিয়েছে।

ওই setup-এ মূল্য ও গতির সাশ্রয় ছিল বড়। Jev-এর নয়টি panel মিলিয়ে খরচ প্রায় ছয় সেন্ট; তিনটি language-model judge-এর খরচ 29 থেকে 325 গুণ বেশি এবং সময় লেগেছে 30 থেকে 220 গুণ। তবু Jev-এর confidence শক্তিশালী cascade তৈরি করেনি। বেশিরভাগ panel-এ confidence তার ভুলগুলোকে ক্রমানুসারে ধরতে পেরেছে, কিন্তু fallback model-গুলো Jev-এর সবচেয়ে আত্মবিশ্বাসী প্রায় সব ভুলই পুনরাবৃত্তি করেছে। cross-fitted threshold-এ সেরা একক judge-এর তুলনায় cascade গড়ে সর্বোচ্চ 1.5 percentage point উন্নতি করেছে; নয়টির মধ্যে ছয়টি panel-এ ওই judge-এর চেয়েও খারাপ করেছে। এই replay-তে ভবিষ্যৎ live deployment নয়, আগে রেকর্ড করা verdict ব্যবহার হয়েছে।

দুটি গবেষণার পার্থক্যটি শিক্ষণীয়। উত্তরের pairwise তুলনায় প্রথম গবেষণায় Jev-এর কম-confidence ভুল ও শক্তিশালী fallback-এর দক্ষতার মধ্যে কাজে লাগানোর মতো বিভাজন ছিল। criterion score-এ fallback-এর ভুল প্রায় একই হওয়ায়, বাড়তি review তেমন সংশোধন ছাড়াই খরচ বাড়িয়েছে। model-এর confidence signal একাই বলে না, অন্য model কার্যকরভাবে ভিন্নমত দেবে কি না।

কাজের কঠিনতা অনুযায়ী চিকিৎসা-সংক্রান্ত multiple-choice ফল বদলায়

চিকিৎসা-সংক্রান্ত paper-এ চারটি বিদ্যমান dataset-এ Jev পরীক্ষা করা হয়েছে: MetaMedQA-র 1,373টি পরীক্ষার প্রশ্ন, research abstract দেখে উত্তর দেওয়া 500 PubMedQA প্রশ্ন, 915 DiagnosisArena multiple-choice case এবং প্রকাশিত final diagnosis-সহ 34 NEJM Case Challenge। Jev-এর সঙ্গে GPT-6 Sol তুলনা করা হয়েছে medium reasoning-সহ ও reasoning ছাড়া। মোট 8,469টি model request-এ প্রতিবারই গ্রহণযোগ্য structured answer এসেছে।

PubMedQA-তে medium reasoning-সহ Jev ও GPT-6 Sol যথাক্রমে 78.4% ও 78.2% পেয়েছে। MetaMedQA-তে Jev 74.8%, GPT-6 82.7%; DiagnosisArena-তে 59.8% বনাম 82.4%; আর 34টি NEJM case-এ 61.8% বনাম 82.4%। reasoning ছাড়াও GPT-6-এর point estimate দুটি কঠিন case set-এ বেশি ছিল। 34-case NEJM-এর estimate অনির্দিষ্ট, আর multiple comparison-এর সংশোধনের পর তার প্রধান তুলনা statistically significant থাকেনি। অনেক বড় DiagnosisArena ব্যবধানটি explicit reasoning ছাড়াও ছিল।

এটি দেওয়া বিকল্পের মধ্যে থেকে বেছে নেওয়ার পরীক্ষা; রোগের differential diagnosis তৈরি করা বা রোগীকে চিকিৎসা দেওয়ার পরীক্ষা নয়। benchmark-এর উত্তর clinician-রা adjudicate করেছেন—paper-এ এমন তথ্য নেই। paper-এ উল্লেখ আছে, NEJM-এর image model-কে caption হিসেবে দেওয়া হয়েছে এবং কঠিন DiagnosisArena case অন্য language model দিয়ে ছেঁকে নেওয়া হয়েছিল। লেখকেরা ফলকে preliminary বলেছেন; স্বাধীন replication, reference answer-এ clinical adjudication এবং run-ভেদে স্থিতিশীলতার পরীক্ষা এখনো বাকি। চিকিৎসাসেবার সিদ্ধান্তে ফল ব্যবহার না করতে paper-এ স্পষ্ট বলা হয়েছে।

probability threshold-এর উপযোগিতা একরকম ছিল না। MetaMedQA-তে Jev-এর 52.9% উত্তরের confidence অন্তত 0.9 ছিল; সেগুলোর 93.4% সঠিক। কাছাকাছি সংখ্যক প্রশ্ন গ্রহণ করেও GPT-6 সমান বা বেশি সঠিক ছিল। DiagnosisArena-তে Jev-এর probability ranking দুর্বল: একই 0.9 threshold-এ মাত্র 17.3% item গ্রহণ করা হয়েছিল, তবু গ্রহণ করা উত্তরের চারটির একটিই ভুল ছিল। সব benchmark-এ model-গুলোর বেছে নেওয়া option-এর গড় probability তাদের accuracy ছাড়িয়েছে। এই নমুনায় উচ্চ score মানে নিশ্চিত ফল নয়।

দলগুলো গবেষণা থেকে কী নিতে পারে

একত্রে, paper-গুলো নির্দিষ্ট কাজের evaluator হিসেবে Jev পরীক্ষা করার পক্ষে প্রমাণ দেয়—বিশেষত যখন দেওয়া text থেকে verdict বোঝা যায় বা evidence দিয়ে যাচাই করা যায়। confidence field-কে সর্বজনীন safety switch হিসেবে ব্যবহারের পক্ষে প্রমাণ দেয় না। কাজ ভেদে ফল আলাদা ছিল, আর rubric study দেখায় fallback-এর raw accuracy-এর পাশাপাশি তার ভুলগুলো প্রথম model-এর ভুল থেকে স্বাধীন কি না যাচাই করা জরুরি।

এই পদ্ধতি বিবেচনা করা দলের নিজেদের কাজ থেকে representative, label করা নমুনা দরকার। সঠিক সিদ্ধান্ত বলতে কী বোঝাবে তা আগে ঠিক করতে হবে; কঠিন ও বিভ্রান্তিকর উদাহরণ রাখতে হবে; human review বা অন্য সমর্থনযোগ্য reference-এর সঙ্গে তুলনা করে error rate এবং confidence সঠিক ও ভুল সিদ্ধান্ত কতটা আলাদা করতে পারে—দুটিই মাপতে হবে। cascade হলে fallback প্রথম ধাপের ভুল সত্যিই ঠিক করছে কি না, কত case বাড়তি review-তে যাচ্ছে এবং তার ফলে খরচ ও দেরি কত হচ্ছে তাও নথিভুক্ত করা উচিত। threshold বেছে নেওয়ার উদাহরণের বাইরে সেটি চলে কি না, সংরক্ষিত test set তা দেখাতে পারে।

এগুলো গবেষণা থেকে নেওয়া ব্যবহারিক পরামর্শ; BIG CHANGE-এর পরীক্ষিত পদ্ধতি নয়। আমরা Jev API call করিনি বা local benchmark চালাইনি। TypeSafe-এর API documentation-এ structured request, অনুমোদিত answer type এবং model খোঁজার উপায় নথিভুক্ত; কিন্তু কোনো দলের workload-এ accuracy স্বাধীনভাবে প্রতিষ্ঠা করে না। product access, মূল্য ও model বদলাতে পারে, তাই trial পরিকল্পনার সময় বর্তমান documentation যাচাই করা উচিত।

আপাতত, কাজটি সীমিত, label স্পষ্ট এবং নিজস্ব মূল্যায়নে confidence কার্যকরভাবে ভুল আলাদা করলে Jev সম্ভাব্য প্রথম judge হিসেবে উপযোগী মনে হয়। বিচার করতে গভীর reasoning লাগলে, rating লুকানো rater-রীতি নির্ভর হলে, বা একাধিক model একই ভুল করলে—human review বা অন্য যাচাইকৃত পরীক্ষা প্রক্রিয়ায় রেখে দেওয়ার কারণ গবেষণাগুলো দেয়।

মূল পরিবর্তন

Jev-এর নতুন evaluation প্রশ্নটিকে “decision model কম খরচে verdict দিতে পারে কি না” থেকে “কখন verdict-টি ব্যবহার করার মতো যথেষ্ট কার্যকর” পর্যায়ে এনেছে। উত্তর কাজের ওপর নির্ভর করে: confidence routing বাইরে রাখা pairwise-evaluation cascade-এ উন্নতি করেছে, কিন্তু আলাদা rubric study-তে ভুলগুলো মিলে যাওয়ায় লাভ কম ছিল। চিকিৎসা-সংক্রান্ত multiple-choice ফলও কাজের কঠিনতায় তীব্রভাবে বদলেছে। AI দলগুলোর পরবর্তী পদক্ষেপ হলো এমন local validation set তৈরি করা, যা correctness, confidence ও fallback-এর আচরণ একসঙ্গে যাচাই করে।

সূত্র ও আরও পাঠ

  • JEV-as-a-Judge: Accept When Confident, Escalate When Unsure, Yubo Li, Yidi Miao, Ramayya Krishnan ও Rema Padman; version 2, 27 সেপ্টেম্বর 2026। 16টি judge-এর সঙ্গে Jev-এর তুলনামূলক preprint; এতে বাছাই করা blind human adjudication ও বাইরে রাখা data-তে confidence routing test আছে।
  • Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places, Delip Rao ও Chris Callison-Burch; 24 সেপ্টেম্বর 2026। নয়টি benchmark panel-এ প্রতি criterion-এ binary ও graded rubric বিচার মূল্যায়ন করা preprint।
  • Jev in Medicine: A Benchmark Evaluation. Preliminary results., Alfredo Madrid-García ও Beatriz Merino-Barbancho; 27 সেপ্টেম্বর 2026। চিকিৎসা-সংক্রান্ত চারটি multiple-choice dataset-এ প্রাথমিক benchmark তুলনা; clinical study নয়।
  • TypeSafe API documentation, Jev-এর structured request ও output interface-এর আনুষ্ঠানিক reference। নথি product-এর আচরণ বর্ণনা করে, স্বাধীন performance evaluation নয়।