تختبر ثلاث مسودات بحثية جديدة Jev بوصفه مقيّماً بطرق مختلفة. ترى إحداها أنه يقترب من أداء حَكَم قوي قائم على نموذج لغوي في تفضيل الإجابات والتحقق من الوقائع استناداً إلى الأدلة، ثم تستخدم الثقة لتوجيه الحالات غير المحسومة. وتجد ثانية أن هذا التوجيه لا يضيف فائدة تُذكر عند التقييم وفق سلالم معيارية، لأن النماذج الاحتياطية كثيراً ما تكرر أخطاء Jev الواثقة. أما دراسة طبية ثالثة فتسجل دقة متقاربة في الأسئلة المستندة إلى ملخصات أبحاث وفجوات كبيرة في حالات التشخيص الأصعب.
الخلاصة العملية أضيق من عبارة «يمكن للذكاء الاصطناعي أن يحكم على الذكاء الاصطناعي». قد يكون Jev حَكَماً سريعاً للفرز الأولي في مهمة محددة جيداً، لكن الأدلة لا تثبت وجود حَكَم واحد موثوق لكل أنواع الإجابات. ولا يفيد توجيه العمل بحسب الثقة إلا بعد أن تختبر الفرق ما الذي تتنبأ به هذه الثقة على أمثلتها الخاصة.
ما المقصود بأن يحكم نموذج على إجابة؟
يتلقى المقيّم مخرجاً واحداً أو أكثر من النماذج، ثم يعيد درجة أو حكماً وفق قاعدة ما. فقد يختار الحَكَم أي الإجابتين تتبع التعليمات بصورة أفضل، أو يقرر إن كان ادعاء ما مدعوماً بالوثائق المقدمة، أو يقيّم إجابة وفق مقياس، أو ينتقي الخيار الصحيح في سؤال طبي متعدد الخيارات. وتفرض هذه المهام متطلبات مختلفة على المقيّم.
Jev هو نموذج القرار الذي تستضيفه TypeSafe. تقبل واجهته البرمجية مدخلات منظّمة ونوعاً مسموحاً للاستجابة، ثم تعيد اختياراً أو درجة مع احتمالات للتسميات المتاحة. ويمكن لهذه الواجهة أن تلائم مهمة ضمن برنامج يتوقع نتيجة محددة النطاق. لكن الاحتمال تقدير من النموذج، ولا يتحقق بمفرده من صحة الإجابة الأساسية. تصف وثائق TypeSafe الواجهة، فيما تقيس المقارنات البحثية أدناه الأداء على مجموعات اختبار محددة.
دراسة JEV بوصفه حَكَماً، المنقحة في 27 سبتمبر، تقارن Jev 1.13 بستة عشر حَكَماً من النماذج التوليدية ونماذج المكافأة. أما دراسة التحكيم وفق المعايير، المنشورة في 24 سبتمبر، فتقارن Jev بثلاثة نماذج لغوية أقل تكلفة. وتقارن المقارنة الطبية، المنشورة في 27 سبتمبر، Jev 1.13 بـGPT-6 Sol مع إعدادين للاستدلال. والدراسات الثلاث مسودات بحثية لم تخضع لمراجعة الأقران. ولا تمثل أي منها دراسة لنشر سريري.
أحكام متقاربة في بعض المهام، وأداء أضعف في الاستدلال
تقيّم الورقة الأولى 5,172 حكماً عبر أزواج تفضيل الإجابات، والتحقق من الوقائع المستندة إلى الأدلة، وفحوص الإجابة النهائية، ثم تضيف اختبارات متابعة ودراستين لتوجيه الحالات المحجوبة. وبلغت درجات Jev في المعايير العامة الرئيسية 92.5% على عينة من 1,500 زوج تفضيل من RewardBench، و78.6% على 350 زوجاً من JudgeBench، و87.3% على 3,000 إجابة من HaluEval قُيّمت بمقارنتها بالأدلة. وفي المهام نفسها سجل أقوى نموذج مقارن، GPT-6 Astra، 92.5% و93.1% و88.4% على التوالي. وتذكر الورقة أن تكلفة Jev بلغت 0.044 دولار لكل ألف حكم أساسي، وأن وسيط زمن الاستجابة في لوحة القياس كان 0.15 ثانية؛ أما GPT-6 Astra فبلغت تكلفته 12.182 دولاراً وزمنه 1.89 ثانية ضمن ظروف الدراسة.
لكن هذه المتوسطات تخفي الفارق الذي رصده الباحثون. فقد كان Jev ضمن نحو نقطتين من GPT-6 في جودة المحادثة ورفض الطلبات غير الآمنة والتحقق من الوقائع المستندة إلى الأدلة. وتراجع في المهام التي تتطلب اشتقاق نتيجة أو التحقق منها: بفارق 14.3 نقطة في الرياضيات و12.9 نقطة في البرمجة، وبفارق 27.6 نقطة في ألغاز المنطق. وفي مجموعة التحقق الموضوعي من JudgeBench سجل Jev نسبة 78.6% مقابل 93.1% لـGPT-6. وفي مراجعة عمياء لحالات خلاف ضمن عينة من 990 بنداً، رجّح المحكّمون GPT-6 في 57 من أصل 69 حالة خلاف في JudgeBench، ورجّحوا Jev في حالة واحدة. وكانت المراجعة انتقائية ومحدودة، لكنها تشير إلى أن هذا الفارق لم يكن مجرد مشكلة في تسميات المعيار.
كان المقصود بكلمة «حَكَم» هنا الاختيار بين إجابتين مولدتين، أو تقرير ما إذا كانت إجابة واحدة مدعومة أو صحيحة قياساً إلى مرجع محدد. وقد أعطى الباحثون النماذج التوليدية عمداً صيغة الإخراج المقيّدة نفسها التي يستخدمها Jev، أي حكماً واحتمالاً من دون تعليل. لذلك تقارن الدراسة الأحكام وفق هذا الاتفاق، لا قدرة كل حَكَم على شرح استدلاله للإنسان.
ينجح التوجيه بالثقة عندما تختلف الأخطاء
تستخدم آلية التتابع حَكَماً أولياً أقل تكلفة، وتحيل بعض الحالات إلى نموذج احتياطي أعلى تكلفة. وفي الدراسة الأولى، قبلت القاعدة حكم Jev عندما بلغ أعلى احتمال لتسمية ما 0.9 على الأقل، وأحالت الحالات الأقل ثقة. ومن بين 1,610 أزواج تفضيل محجوبة، صعّدت آلية التتابع ذات المرحلتين 31.5% من الحالات، وسجلت 93.4% مقابل 92.5% لـGPT-6، وبلغت تكلفتها 41% من رسوم GPT-6. وفي اختبار حي محدد مسبقاً شمل 570 زوجاً محجوباً من مهمتين جديدتين للتحقق من الصحة، تأخر Jev وحده عن GPT-6 بمقدار 14 نقطة؛ أما آلية التتابع فطابقت دقة GPT-6 مع تصعيد 74% من الحالات وتوفير نحو ربع تكلفته.
لهذه النتيجة شرط محدد: يجب أن تتضمن الحالات التي لا يثق Jev فيها أخطاءً يستطيع النموذج الاحتياطي تصحيحها. ووجد الباحثون أن التوجيه بالثقة تراجع مع أزواج الإجابات المصممة لمغالطة التقييم الأسلوبي، وأخفق في النثر الذي لا يستند إلى مرجع، حيث كان أداء كل الحكام المختبرين قريباً من التخمين رغم ثقتهم العالية كثيراً. كما وجدت الدراسة أن متوسط القرارات عبر ترتيبي الإجابتين خفّض أثر الموقع. واختيرت العتبات باستخدام أمثلة محلية موسومة، وأوصت الورقة باستخدام حد أدنى محافظ للثقة ثم التحقق على عينة محجوبة.
تختبر دراسة المعايير المنفصلة التقييم بحسب كل معيار على تسع مجموعات فرعية مأخوذة من سبعة معايير مرجعية، بإجمالي 5,003 أزواج من العناصر والمعايير. واستخدمت مجموعتان إجابات ثنائية، فيما استخدمت سبع مجموعات سلالم تقييم مرتبة. ورأى الحكام الأربعة نص المعيار نفسه، وثبّت الباحثون المقاييس قبل التقييم. استبعدت فواصل الثقة 95% احتمال عدم وجود فرق في ثماني مقارنات من أصل 27 مقارنة مزدوجة؛ وبقيت أربع بعد تصحيح تعدد المقارنات. وحققت مقارنات أخرى هامش التكافؤ الذي حددته الورقة، بينما لم تكن نتائج كثيرة دقيقة بما يكفي لإثبات فرق أو تكافؤ. وكان أداء Jev نسبياً الأفضل في المعايير الثنائية. أما في مجموعات التقييم المتدرج فلم يكن أبداً أفضل حَكَم في مقارنة متطابقة، كما مالت جميع الحكام إلى منح درجات أدنى من المقيمين البشر.
كانت وفورات السعر والوقت كبيرة في ذلك الإعداد. كلف Jev نحو ستة سنتات لتقييم المجموعات التسع كلها؛ أما النماذج اللغوية الثلاثة فكانت تكلفتها أعلى من 29 إلى 325 مرة واستغرقت من 30 إلى 220 مرة أطول. لكن ثقة Jev لم تؤسس آلية تتابع قوية. فقد ساعدت الثقة على ترتيب أخطائه في معظم المجموعات، إلا أن النماذج الاحتياطية كررت تقريباً كل أخطائه الأكثر ثقة. ومع استخدام عتبات محسوبة بالتقاطع، لم تحسن آلية التتابع متوسط الأداء بأكثر من 1.5 نقطة مئوية مقارنة بأفضل حَكَم منفرد؛ وكان أداؤها أسوأ من ذلك الحَكَم في ست مجموعات من أصل تسع. وأُعيد هذا التحليل باستخدام أحكام مسجلة، لا في نشر حي مستقبلي.
يكشف التباين بين الورقتين أمراً مهماً. ففي مقارنة الإجابات على شكل أزواج، وجدت الدراسة الأولى فرقاً مفيداً بين أخطاء Jev منخفضة الثقة وقدرات نموذج احتياطي أقوى. أما في التقييم وفق المعايير، فغالباً ما شارك النموذج الاحتياطي Jev الأخطاء نفسها، فزاد التصعيد التكلفة من دون تصحيح يُذكر. وإشارة ثقة النموذج وحدها لا تخبر الفريق إن كان نموذج آخر سيختلف عنه بطريقة مفيدة.
تعتمد نتائج أسئلة الاختيار الطبي على صعوبة المهمة
تقيّم الورقة الطبية Jev على أربع مجموعات بيانات قائمة: 1,373 سؤال امتحان من MetaMedQA، و500 سؤال من PubMedQA تُجاب بالاستناد إلى ملخصات الأبحاث، و915 حالة اختيار من متعدد من DiagnosisArena، و34 تحدياً سريرياً من NEJM مع تشخيص نهائي منشور. وقارنت Jev بـGPT-6 Sol مع الاستدلال المتوسط ومن دونه. وأُرسلت 8,469 مطالبة إلى النماذج، وأعادت جميعها إجابات منظّمة صالحة.
في PubMedQA، سجل Jev وGPT-6 Sol مع الاستدلال المتوسط 78.4% و78.2%. وفي MetaMedQA، سجل Jev نسبة 74.8% مقابل 82.7%؛ وفي DiagnosisArena سجل 59.8% مقابل 82.4%؛ وفي حالات NEJM الأربع والثلاثين سجل 61.8% مقابل 82.4%. كما كانت التقديرات النقطية لـGPT-6 من دون استدلال أعلى في مجموعتي الحالات الأصعب. وتقدير NEJM المبني على 34 حالة غير دقيق، ولم تبقَ المقارنة الرئيسية فيه ذات دلالة إحصائية بعد تصحيح تعدد المقارنات. أما الفجوة الأكبر بكثير في DiagnosisArena فاستمرت من دون استدلال صريح.
هذا اختبار لاختيار إجابة من خيارات مقدمة، وليس لإعداد تشخيص تفريقي أو علاج المرضى. ولا تذكر الورقة أن أطباءً راجعوا إجابات المعايير المرجعية. وتشير إلى أن صور NEJM قُدمت للنماذج على هيئة تعليقات نصية، وأن حالات DiagnosisArena الصعبة صُفّيت باستخدام نماذج لغوية أخرى. ويصف المؤلفون النتائج بأنها أولية، ويقولون إن التكرار المستقل والتحكيم السريري للإجابات المرجعية وفحوص استقرار النتائج بين مرات التشغيل لا تزال معلقة. وتنص الورقة صراحة على عدم استخدام النتائج لتوجيه الرعاية السريرية.
تفاوتت قيمة عتبات الاحتمال. ففي MetaMedQA، بلغت ثقة Jev 0.9 أو أكثر في 52.9% من اختياراته، وكانت دقتها 93.4%. وعند تغطية مماثلة، لم يكن GPT-6 أقل دقة. أما في DiagnosisArena فكان ترتيب Jev للاحتمالات ضعيفاً: عند عتبة 0.9 نفسها، لم تُقبل إلا 17.3% من البنود، وكان واحد من كل أربعة أجوبة مقبولة خاطئاً. وفي كل معيار، تجاوز متوسط احتمال الخيار الذي اختاره النموذج دقته الفعلية. وفي هذه العينة، لم تكن الدرجة المرتفعة تعني اليقين.
ما الذي يمكن للفرق استخلاصه من الدراسات؟
تدعم الأوراق مجتمعة اختبار Jev كمقيّم لمهمة محددة، خصوصاً عندما يمكن استنتاج الحكم من نص مقدم أو التحقق منه بالأدلة. لكنها لا تبرر التعامل مع حقل الثقة فيه كمفتاح أمان يصلح لكل الحالات. فقد اختلفت النتائج باختلاف المهام، وتوضح دراسة المعايير سبب ضرورة تقييم النموذج الاحتياطي من حيث استقلال أخطائه أيضاً، لا دقته الخام فحسب.
يحتاج الفريق الذي يدرس هذا الأسلوب إلى عينة ممثلة وموسومة من مهمته نفسها. عليه تحديد ما يعد قراراً صحيحاً، وإدراج أمثلة صعبة ومضللة، والمقارنة بمراجعة بشرية أو مرجع آخر يمكن الدفاع عنه، ثم قياس معدلات الخطأ ومدى قدرة الثقة على التمييز بين القرارات الصحيحة والخاطئة. وإذا استخدم آلية تتابع، فعليه أيضاً تسجيل ما إذا كان النموذج الاحتياطي يصحح فعلاً أخطاء المرحلة الأولى، وعدد الحالات التي تُصعّد، والتكلفة والتأخير الناتجين. ويمكن لمجموعة اختبار احتياطية أن تكشف ما إذا كانت العتبة تنجح خارج الأمثلة التي استُخدمت لاختيارها.
هذه استنتاجات عملية من الدراسات، وليست إجراءً اختبرته BIG CHANGE. لم نستدع واجهة Jev البرمجية ولم نشغّل معياراً محلياً. وتوثق وثائق الواجهة البرمجية لدى TypeSafe الطلبات المنظّمة وأنواع الإجابات المسموح بها واكتشاف النماذج؛ لكنها لا تثبت بصورة مستقلة دقة النموذج في مهام فريق بعينه. وقد يتغير الوصول إلى المنتجات والأسعار والنماذج، لذا ينبغي للفرق مراجعة الوثائق الحالية عند التخطيط لتجربة.
في الوقت الراهن، يبدو Jev خياراً محتملاً للحَكَم الأول عندما تكون المهمة محددة، والتسميات واضحة، ويُظهر التقييم المحلي أن الثقة توجه الأخطاء بفاعلية. أما حين يتطلب التحكيم استدلالاً أعمق، أو يعتمد التقييم على أعراف خفية لدى المقيمين، أو تشترك نماذج عدة في الأخطاء نفسها، فتوفر الدراسات سبباً للإبقاء على المراجعة البشرية أو تحقق آخر مثبت ضمن سير العمل.
التغيير الأبرز
تنقل تقييمات Jev الجديدة السؤال من إمكان أن يعيد نموذج قرار حكماً منخفض التكلفة إلى الحالات التي يكون فيها ذلك الحكم مفيداً بما يكفي للاعتماد عليه. وتعتمد الإجابة على المهمة: فقد حسّن التوجيه بالثقة آلية تتابع لتقييم أزواج محجوبة، فيما وجدت دراسة منفصلة للتقييم وفق المعايير مكاسب محدودة بسبب تداخل الأخطاء. كما تباينت نتائج الاختيارات الطبية بشدة بحسب صعوبة المهمة. والخطوة التالية لفرق الذكاء الاصطناعي هي إعداد مجموعة تحقق محلية تختبر الصحة والثقة وسلوك النموذج الاحتياطي معاً.
المصادر ومواد إضافية للقراءة
- JEV بوصفه حَكَماً: القبول عند الثقة والتصعيد عند الشك، يوبو لي، ييدي مياو، رامايّا كريشنان وريما بادمان، النسخة الثانية المؤرخة 27 سبتمبر 2026. مسودة بحثية تقارن Jev بستة عشر حَكَماً، وتشمل تحكيماً بشرياً أعمى واختبارات محجوبة لتوجيه الحالات بحسب الثقة.
- Jev مقابل النماذج اللغوية الكبيرة في التحكيم وفق المعايير: أقل تكلفة وأسرع، لكن الأخطاء متشابهة، ديليب راو وكريس كاليزون-بورش، 24 سبتمبر 2026. مسودة بحثية تقيّم الأحكام الثنائية والمتدرجة وفق معايير على تسع مجموعات فرعية من المعايير المرجعية.
- Jev في الطب: تقييم معياري ونتائج أولية، ألفريدو مدريد-غارسيا وبياتريس ميرينو-باربانتشو، 27 سبتمبر 2026. مقارنة أولية على أربع مجموعات بيانات طبية متعددة الخيارات، وليست دراسة سريرية.
- وثائق TypeSafe للواجهة البرمجية، مرجع رسمي لواجهة الطلبات والمخرجات المنظّمة لـJev. تصف الوثائق سلوك المنتج، لا تقييماً مستقلاً للأداء.



