AI-translated from English; not yet reviewed by a fluent editor.

# Jev کے AI جج کے نتائج کام اور متبادل ماڈل کے لحاظ سے بدلتے ہیں

> تین ابتدائی تحقیقی مسودے Jev کو AI جوابی جج کے طور پر آزماتے ہیں۔ ترجیح، معیار اور طبی کاموں میں نتائج مختلف ہیں، اور confidence پر مبنی routing صرف تب فائدہ دیتی ہے جب متبادل ماڈل Jev کی غلطیوں کو درست کرے۔

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

تین نئے ابتدائی تحقیقی مسودے Jev کو مختلف طریقوں سے evaluator کے طور پر آزماتے ہیں۔ ایک مطالعہ جوابوں میں ترجیح اور شواہد کی بنیاد پر حقائق کی جانچ میں اسے مضبوط language-model جج کے قریب پاتا ہے، پھر غیر یقینی معاملات آگے بھیجنے کے لیے confidence استعمال کرتا ہے۔ دوسرے مطالعے میں درجہ بند rubrics پر اس routing کا فائدہ کم ملا کیونکہ متبادل ماڈل اکثر Jev کی پراعتماد غلطیاں دہرا دیتے ہیں۔ تیسرا طبی benchmark تحقیقی خلاصوں سے متعلق سوالات میں ملتی جلتی درستگی، مگر مشکل تر تشخیصی معاملات میں نمایاں فرق رپورٹ کرتا ہے۔

عملی نتیجہ “AI، AI کا فیصلہ کر سکتا ہے” سے زیادہ محدود ہے۔ واضح طور پر متعین کام میں Jev تیز ابتدائی جج ہو سکتا ہے، مگر شواہد ہر طرح کے جواب کے لیے ایک قابلِ اعتماد جج ثابت نہیں کرتے۔ Confidence routing تبھی مدد کر سکتی ہے جب ٹیم اپنے نمونوں پر جانچ لے کہ confidence کیا پیش گوئی کرتی ہے۔

## ماڈل کے جج ہونے کا مطلب

Evaluator ایک یا کئی model outputs لے کر کسی قاعدے کے تحت score یا فیصلہ دیتا ہے۔ جج منتخب کر سکتا ہے کہ دو جوابوں میں سے کون prompt پر بہتر عمل کرتا ہے، فیصلہ کر سکتا ہے کہ دعویٰ فراہم کردہ دستاویزات سے ثابت ہے یا نہیں، rubric کے مطابق جواب کا score دے سکتا ہے، یا طبی کثیر الانتخابی معاملے میں درست انتخاب کر سکتا ہے۔ یہ کام evaluator سے مختلف قسم کی صلاحیتیں مانگتے ہیں۔

Jev، TypeSafe کا میزبانی کردہ decision model ہے۔ اس کی API ساخت یافتہ input اور اجازت یافتہ response type قبول کرتی ہے، پھر مقررہ labels میں سے انتخاب یا score اور ہر label کے لیے probabilities لوٹاتی ہے۔ یہ interface کسی ایسے software میں کام آ سکتا ہے جسے محدود جواب درکار ہو۔ تاہم probability ماڈل کا تخمینہ ہے؛ یہ بنیادی جواب کی آزادانہ تصدیق نہیں کرتی۔ TypeSafe کی دستاویز interface کی وضاحت کرتی ہے، جبکہ ذیل کے تحقیقی تقابل مخصوص test sets پر کارکردگی جانچتے ہیں۔

یہ [JEV-as-a-Judge مطالعہ](https://arxiv.org/abs/2609.26550v2)، جس پر 27 ستمبر کو نظرثانی ہوئی، Jev 1.13 کا 16 generative اور reward-model ججوں سے تقابل کرتا ہے۔ [rubric judge مطالعہ](https://arxiv.org/abs/2609.29769v1)، 24 ستمبر کو شائع ہوا، Jev کا تین کم لاگت language models سے تقابل کرتا ہے۔ [طبی benchmark](https://arxiv.org/abs/2609.34024v1)، 27 ستمبر کو شائع ہوا، Jev 1.13 کا دو reasoning settings میں GPT-6 Sol سے تقابل کرتا ہے۔ تینوں ابتدائی تحقیقی مسودے ہیں۔ کوئی بھی clinical deployment study نہیں اور کسی کا peer review نہیں ہوا۔

## کچھ فیصلوں میں قریب، استدلال والے کاموں میں کمزور

پہلا مقالہ ترجیحی جوڑوں، شواہد پر مبنی factuality اور حتمی جواب کی جانچ میں 5,172 فیصلے ناپتا ہے، پھر اضافی tests اور دو الگ رکھے گئے routing مطالعات کرتا ہے۔ Jev کے مرکزی عوامی benchmark scores، نمونے میں لیے گئے 1,500 RewardBench ترجیحی جوڑوں میں 92.5%، 350 JudgeBench جوڑوں میں 78.6%، اور شواہد کے مطابق جانچے گئے 3,000 HaluEval جوابوں میں 87.3% تھے۔ انہی کاموں میں مضبوط ترین GPT-6 Astra موازنے والے نے بالترتیب 92.5%، 93.1% اور 88.4% حاصل کیے۔ مقالہ اپنے timing panel میں Jev کی قیمت ہر 1,000 بنیادی فیصلوں پر $0.044 اور درمیانی latency 0.15 سیکنڈ بتاتا ہے؛ مطالعے کے حالات میں GPT-6 Astra کے اعداد $12.182 اور 1.89 سیکنڈ تھے۔

ان اوسطوں سے مصنفین کی نشاندہی کردہ حد پوشیدہ رہتی ہے۔ chat quality، safety refusals اور شواہد پر مبنی factuality میں Jev، GPT-6 سے تقریباً دو percentage points کے اندر تھا۔ نتیجہ اخذ کرنے یا جانچنے والے کاموں میں وہ پیچھے رہا: ریاضی میں 14.3 points، code میں 12.9، اور logic puzzles میں 27.6 points۔ JudgeBench کے objective correctness set میں Jev نے GPT-6 کے 93.1% کے مقابلے میں 78.6% حاصل کیے۔ 990 items کے ذیلی نمونے میں متنازع معاملات کی blind adjudication نے 69 متنازع JudgeBench items میں سے 57 پر GPT-6 اور ایک پر Jev کی تائید کی۔ یہ adjudication منتخب اور محدود تھی، مگر اشارہ کرتی ہے کہ یہ فرق صرف benchmark کے labels کا مسئلہ نہیں تھا۔

یہاں “جج” سے مراد دو تیار شدہ جوابوں میں انتخاب یا دیے گئے حوالے کے مطابق ایک جواب کے درست یا شواہد سے ثابت ہونے کا فیصلہ تھا۔ مصنفین نے generative ججوں کو، Jev کی طرح، بغیر وضاحت کے محدود فیصلہ اور probability دینے کے لیے جان بوجھ کر پابند کیا۔ اس لیے تقابل اس طے شدہ format میں فیصلوں کا ہے، اس بات کا نہیں کہ کون سا جج انسان کو اپنا استدلال سمجھا سکتا ہے۔

## جب غلطیاں الگ ہوں تو confidence routing کام کرتی ہے

Cascade میں کم خرچ ابتدائی جج استعمال ہوتا ہے اور کچھ معاملات زیادہ خرچ والے متبادل کو بھیجے جاتے ہیں۔ پہلے مطالعے میں قاعدہ یہ تھا کہ Jev کا فیصلہ قبول کریں اگر اس کی زیادہ سے زیادہ label probability کم از کم 0.9 ہو، اور کم confidence والے معاملات آگے بھیجیں۔ الگ رکھے گئے 1,610 ترجیحی جوڑوں پر دونوں ترتیبوں والی cascade نے 31.5% معاملات آگے بھیجے، GPT-6 کے 92.5% کے مقابلے میں 93.4% score کیا، اور اس کی فیس کا 41% خرچ کیا۔ correctness کے دو نئے کاموں سے لیے گئے 570 الگ جوڑوں کے پہلے سے متعین live test میں Jev اکیلا GPT-6 سے 14 points پیچھے رہا؛ cascade نے 74% آگے بھیجتے ہوئے GPT-6 جتنی درستگی حاصل کی اور اس کی فیس کا تقریباً ایک چوتھائی بچایا۔

اس نتیجے کی ایک خاص شرط ہے: جن معاملات میں Jev غیر یقینی ہو ان میں ایسی غلطیاں ہوں جنہیں متبادل ماڈل درست کر سکے۔ مصنفین کے مطابق انداز پر مبنی adversarial جوڑوں میں confidence routing کمزور ہوئی، اور بغیر حوالے والی نثر پر ناکام رہی، جہاں تمام آزمودہ ججوں کی کارکردگی اتفاقی انتخاب کے قریب تھی مگر وہ اکثر پراعتماد تھے۔ مطالعے میں یہ بھی ملا کہ جوابوں کی دونوں ترتیبوں کے فیصلے اوسط کرنے سے position effects گھٹ گئے۔ Thresholds مقامی، label لگائے گئے نمونوں سے چنے گئے؛ مقالہ lower-confidence-bound طریقہ اور الگ رکھے گئے نمونے پر جانچ کی سفارش کرتا ہے۔

الگ rubric مطالعہ سات benchmarks سے لیے گئے نو panels پر فی معیار score آزماتا ہے؛ مجموعی طور پر 5,003 item–criterion جوڑے تھے۔ دو panels binary اور سات میں ترتیب وار rating scales تھیں۔ چاروں ججوں نے ایک ہی criterion text دیکھا اور مصنفین نے evaluation سے پہلے rubrics طے کیے۔ 27 جوڑی دار تقابل میں آٹھ کے 95% confidence intervals میں فرق صفر سے الگ تھا؛ متعدد تقابل کی اصلاح کے بعد چار باقی رہے۔ کچھ دوسرے تقابل مقالے کی equivalence حد پر پورے اترے، جبکہ کئی اتنے غیر دقیق تھے کہ فرق یا مساوات میں سے کوئی ثابت نہ ہو سکی۔ Binary معیار پر Jev دوسرے ججوں کے مقابلے میں بہتر تھا۔ graded panels میں وہ کبھی بھی ملائے گئے ججوں میں سرفہرست نہیں آیا، اور تمام جج انسانی raters سے کم scores دینے کی طرف مائل تھے۔

اس ترتیب میں قیمت اور رفتار کی بچت بڑی تھی۔ Jev کے نو panels کے لیے تقریباً چھ سینٹ خرچ ہوئے؛ تین language-model ججوں کی قیمت 29 سے 325 گنا زیادہ اور وقت 30 سے 220 گنا زیادہ لگا۔ اس کے باوجود Jev کے confidence نے مضبوط cascade نہیں بنائی۔ بیشتر panels میں confidence نے اس کی غلطیوں کی درجہ بندی کی، مگر متبادل ماڈلوں نے Jev کی تقریباً تمام پراعتماد ترین غلطیاں دہرائیں۔ Cross-fitted thresholds کے ساتھ cascade نے اوسطاً بہترین اکیلے جج سے زیادہ سے زیادہ 1.5 percentage points بہتری دی؛ نو میں سے چھ panels پر وہ اس جج سے بھی بدتر تھی۔ اس replay میں کسی آئندہ live deployment کے بجائے پہلے سے درج شدہ فیصلے استعمال ہوئے۔

دونوں مقالوں کا فرق سبق آموز ہے۔ جوابوں کے جوڑی دار تقابل میں پہلے مطالعے نے Jev کی کم confidence والی غلطیوں اور مضبوط متبادل ماڈل کی صلاحیت کے درمیان مفید تقسیم دیکھی۔ معیار کے scoring میں متبادل نے اکثر وہی غلطیاں کیں، اس لیے escalation سے زیادہ تصحیح کے بغیر لاگت بڑھی۔ صرف ماڈل کا confidence signal یہ نہیں بتاتا کہ دوسرا model مفید انداز میں اختلاف کرے گا یا نہیں۔

## طبی کثیر الانتخابی نتائج کام کی مشکل کے لحاظ سے بدلتے ہیں

طبی مقالہ Jev کو چار موجودہ datasets پر جانچتا ہے: MetaMedQA کے 1,373 امتحانی سوالات، تحقیقی abstracts سے جواب دیے گئے 500 PubMedQA سوالات، DiagnosisArena کے 915 کثیر الانتخابی معاملات، اور شائع شدہ حتمی تشخیص والے 34 NEJM Case Challenges۔ اس نے Jev کا GPT-6 Sol سے درمیانی reasoning اور بغیر reasoning، دونوں صورتوں میں تقابل کیا۔ کل 8,469 model requests تھیں اور ہر درخواست نے درست ساخت یافتہ جواب لوٹایا۔

PubMedQA پر Jev اور درمیانی reasoning والا GPT-6 Sol بالترتیب 78.4% اور 78.2% پر تھے۔ MetaMedQA پر Jev نے GPT-6 Sol کے 82.7% کے مقابلے میں 74.8% حاصل کیے؛ DiagnosisArena پر 82.4% کے مقابلے میں 59.8%؛ اور 34 NEJM معاملات پر 82.4% کے مقابلے میں 61.8%۔ بغیر reasoning کے GPT-6 کے point estimates بھی دو مشکل تر case sets پر زیادہ تھے۔ 34 NEJM cases کا تخمینہ غیر دقیق ہے، اور متعدد تقابل کی اصلاح کے بعد اس کا مرکزی تقابل شماریاتی طور پر نمایاں نہیں رہا۔ DiagnosisArena کا کہیں بڑا فرق واضح reasoning کے بغیر بھی برقرار تھا۔

یہ فراہم کردہ اختیارات میں سے انتخاب کا test ہے، differential diagnosis بنانے یا مریضوں کا علاج کرنے کا نہیں۔ مقالہ benchmark جوابات پر clinician adjudication رپورٹ نہیں کرتا۔ اس میں بتایا گیا ہے کہ NEJM تصاویر ماڈلوں کو captions کی صورت میں دی گئیں، اور مشکل DiagnosisArena معاملات کو دوسرے language models کے مقابلے کے بعد چھانٹا گیا۔ مصنفین نتائج کو ابتدائی کہتے ہیں اور بتاتے ہیں کہ آزادانہ تکرار، حوالہ جوابات کی clinical adjudication اور بار بار چلانے پر استحکام کی جانچ باقی ہے۔ مقالہ واضح طور پر کہتا ہے کہ نتائج کو clinical care کی رہنمائی کے لیے استعمال نہ کیا جائے۔

Probability thresholds کا فائدہ یکساں نہیں تھا۔ MetaMedQA پر Jev کے 52.9% انتخابوں کا confidence کم از کم 0.9 تھا اور ان کی درستگی 93.4% تھی۔ اسی طرح کے coverage پر GPT-6 اتنا ہی درست یا اس سے زیادہ درست تھا۔ DiagnosisArena پر Jev کی probability ranking کمزور تھی: اسی 0.9 threshold پر صرف 17.3% items قبول ہوئے، اور قبول شدہ ہر چار جوابوں میں سے ایک پھر بھی غلط تھا۔ ہر benchmark میں ماڈلوں کے منتخب اختیارات کی اوسط probability ان کی درستگی سے زیادہ تھی۔ اس نمونے میں بلند score یقین کے برابر نہیں تھا۔

## ٹیمیں ان مطالعات سے کیا سیکھ سکتی ہیں

مجموعی طور پر مقالے Jev کو کسی مخصوص کام کے evaluator کے طور پر آزمانے کی حمایت کرتے ہیں، خصوصاً جہاں فیصلہ فراہم کردہ متن سے پڑھا جا سکتا ہو یا شواہد کے مقابل جانچا جا سکے۔ وہ confidence field کو ہر جگہ لاگو ہونے والا safety switch سمجھنے کی تائید نہیں کرتے۔ مختلف کاموں کے نتائج مختلف تھے؛ rubric study دکھاتا ہے کہ متبادل ماڈل کو صرف مجموعی درستگی کے بجائے غلطیوں کی عدم وابستگی پر بھی جانچنا کیوں ضروری ہے۔

ایسا طریقہ اپنانے والی ٹیم کو اپنے کام سے نمائندہ، label لگایا ہوا نمونہ درکار ہے۔ اسے درست فیصلے کی تعریف کرنی، مشکل اور گمراہ کن مثالیں شامل کرنی، انسانی جائزے یا کسی دوسرے قابلِ دفاع حوالے سے موازنہ کرنا، پھر غلطیوں کی شرح اور یہ دونوں ناپنا چاہییں کہ confidence درست اور غلط فیصلوں میں کتنا فرق کرتی ہے۔ Cascade میں یہ بھی درج کریں کہ متبادل ماڈل نے پہلے مرحلے کی غلطیاں واقعی درست کیں یا نہیں، کتنے معاملات آگے بھیجے گئے، اور اس سے لاگت اور تاخیر پر کیا اثر پڑا۔ محفوظ رکھا گیا test set بتا سکتا ہے کہ threshold ان مثالوں سے آگے بھی کام کرتا ہے یا نہیں جن سے اسے منتخب کیا گیا تھا۔

یہ مطالعات سے اخذ کیے گئے عملی مضمرات ہیں، BIG CHANGE کا آزمایا ہوا طریقۂ کار نہیں۔ ہم نے Jev API کو call نہیں کیا اور مقامی benchmark نہیں چلایا۔ TypeSafe کی [API documentation](https://api.typesafe.ai/docs) ساخت یافتہ درخواستوں، اجازت یافتہ جواب کی اقسام اور ماڈل تلاش کرنے کی سہولت بیان کرتی ہے؛ یہ کسی ٹیم کے اپنے کام پر درستگی آزادانہ طور پر ثابت نہیں کرتی۔ مصنوعات تک رسائی، قیمتیں اور ماڈلز بدل سکتے ہیں، اس لیے trial کی منصوبہ بندی کرتے وقت موجودہ دستاویزات دیکھیں۔

فی الحال Jev ایک ممکنہ ابتدائی جج کے طور پر مفید دکھائی دیتا ہے، جب کام محدود ہو، labels واضح ہوں اور مقامی جانچ ثابت کرے کہ confidence غلطیوں کو مؤثر طور پر آگے بھیجتی ہے۔ جب فیصلے کے لیے گہرا استدلال چاہیے، grading پوشیدہ rater conventions پر منحصر ہو، یا کئی ماڈل ایک ہی غلطی کریں، تو یہ مطالعات انسانی جائزہ یا کسی اور توثیق شدہ جانچ کو عمل میں برقرار رکھنے کی وجہ دیتی ہیں۔

## بڑی تبدیلی

Jev کے نئے evaluations سوال کو سستے فیصلے دینے والے model سے آگے بڑھا کر یہ بناتے ہیں کہ وہ فیصلہ کب اتنا مفید ہے کہ اسے برقرار رکھا جائے۔ جواب کام پر منحصر ہے: confidence routing نے الگ رکھے گئے جوڑی دار evaluation cascade کو بہتر کیا، جبکہ الگ rubric study میں غلطیاں مشترک ہونے کے باعث فائدہ کم تھا۔ طبی کثیر الانتخابی نتائج بھی کام کی مشکل کے ساتھ بہت بدل گئے۔ AI ٹیموں کا اگلا قدم ایسا مقامی validation set ہے جو درستگی، confidence اور متبادل model کے رویے کو ایک ساتھ جانچے۔

## ذرائع اور مزید مطالعہ

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure](https://arxiv.org/abs/2609.26550v2)، Yubo Li، Yidi Miao، Ramayya Krishnan اور Rema Padman، ورژن 2 مورخہ 27 ستمبر 2026۔ Jev کا 16 ججوں سے تقابل کرنے والا ابتدائی مقالہ، جس میں blind انسانی adjudication اور الگ رکھے گئے confidence-routing tests شامل ہیں۔
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places](https://arxiv.org/abs/2609.29769v1)، Delip Rao اور Chris Callison-Burch، 24 ستمبر 2026۔ نو benchmark panels پر فی معیار binary اور graded rubric فیصلوں کا جائزہ لینے والا ابتدائی مقالہ۔
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results.](https://arxiv.org/abs/2609.34024v1)، Alfredo Madrid-García اور Beatriz Merino-Barbancho، 27 ستمبر 2026۔ چار طبی کثیر الانتخابی datasets پر ابتدائی benchmark تقابل؛ clinical study نہیں۔
- [TypeSafe API documentation](https://api.typesafe.ai/docs)، Jev کے ساخت یافتہ request اور output interface کا سرکاری حوالہ۔ دستاویز مصنوعات کے رویے کی وضاحت ہے، آزادانہ evaluation نہیں۔ دستیابی اور قیمتیں بدل سکتی ہیں۔

## Sources

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure (v2)](https://arxiv.org/abs/2609.26550v2) — 22 ستمبر کو جمع اور 27 ستمبر کو نظرثانی شدہ بنیادی ابتدائی مقالہ۔ Jev 1.13 کا 16 ججوں سے ترجیح، شواہد پر مبنی factuality اور حتمی جواب کے کاموں پر تقابل؛ اس میں منتخب blind adjudication، پہلے سے طے شدہ offline cascades کے تجزیے اور دو پہلے سے طے شدہ live، الگ رکھے گئے workload tests شامل ہیں۔ peer review یا deployment study نہیں؛ compute matching، منتخب adjudication، workload کی وسعت، لاگت اور timing کی حدود SOURCE-AUDIT.md میں درج ہیں۔
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places (v1)](https://arxiv.org/abs/2609.29769v1) — Jev کا تین flash-tier LLMs سے نو benchmark panels اور 5,003 rubric-item جوڑوں پر تقابل کرنے والا بنیادی ابتدائی مقالہ۔ ایک جیسے criterion texts؛ دو binary اور سات graded panels۔ باہم متعلقہ پراعتماد غلطیاں اور زیادہ تر replay پر مبنی routing analysis دکھاتا ہے۔ peer review نہیں؛ بہت سے تقابل شماریاتی طور پر غیرحتمی ہیں اور نتائج چنے گئے rubrics، panels اور serving conditions تک محدود ہیں۔
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results. (v1)](https://arxiv.org/abs/2609.34024v1) — چار طبی کثیر الانتخابی benchmarks پر Jev 1.13 کا GPT-6 Sol سے تقابل کرنے والا بنیادی ابتدائی مقالہ۔ درستگی، calibration/selective prediction، جواب سے دستبرداری، latency اور لاگت شامل ہیں۔ clinical deployment یا clinician adjudication نہیں؛ مصنفین کے مطابق آزادانہ تکرار اور نتائج کی تصدیق باقی ہے اور وہ clinical care میں استعمال سے منع کرتے ہیں۔
- [TypeSafe API documentation](https://api.typesafe.ai/docs) — 29 ستمبر 2026 کو حاصل کردہ سرکاری OpenAPI دستاویز، جس میں ساخت یافتہ request/response schemas، system-one endpoint اور model discovery دکھائے گئے ہیں۔ صرف interface کی وضاحت کی تائید کرتی ہے، آزاد performance دعووں کی نہیں۔ مصنوعات کی دستیابی اور قیمتیں بدل سکتی ہیں۔
- [مالک کی حوالہ کردہ Instagram Reel Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — صرف assignment lead: Reel حاصل یا transcribe نہیں کی جا سکی۔ Caption اور metadata کو ثبوت کے طور پر استعمال نہیں کیا؛ ویڈیو سے کوئی دعویٰ منسوب نہیں کیا۔
