जग स्थिर नाही.RSS
BIG CHANGE.

Markdown आवृत्ती

AI-translated from English; not yet reviewed by a fluent editor.

# Jev या AI-निर्णायकाचे निकाल कामानुसार आणि पर्यायी मॉडेलनुसार बदलतात

> तीन प्रीप्रिंटमध्ये AI उत्तरांचा परीक्षक म्हणून Jev ची चाचणी केली आहे. पसंती, निकषाधारित मूल्यांकन आणि वैद्यकीय कामांमध्ये निकाल वेगवेगळे आहेत; पर्यायी मॉडेलने Jev च्या चुका दुरुस्त केल्यासच विश्वासपातळीवर आधारित मार्गनिवड उपयोगी ठरते.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

तीन नव्या प्रीप्रिंटमध्ये Jev ची वेगवेगळ्या प्रकारे मूल्यांकनकर्ता म्हणून चाचणी केली आहे. एका अभ्यासात उत्तरांमधील पसंती आणि पुराव्यावर आधारित तथ्यतपासणीसाठी त्याची कामगिरी एका सक्षम भाषा-मॉडेल परीक्षकाच्या जवळ असल्याचे आढळले; त्यानंतर अनिश्चित प्रकरणे पुढे पाठवण्यासाठी विश्वासपातळीचा वापर केला. दुसऱ्या अभ्यासात गुणांकनाच्या निकषांवर अशी मार्गनिवड फारशी उपयोगी ठरली नाही, कारण पर्यायी मॉडेल अनेकदा Jev च्या आत्मविश्वासपूर्ण चुका पुन्हा करतात. तिसऱ्या वैद्यकीय बेंचमार्कमध्ये संशोधन-सारांशांवरील प्रश्नांत साधारण समान अचूकता, पण अधिक कठीण निदान प्रकरणांत मोठी तफावत दिसली.

यातून मिळणारे व्यावहारिक उत्तर AI, AI चे मूल्यमापन करू शकते का या प्रश्नापेक्षा मर्यादित आहे. स्पष्टपणे परिभाषित कामासाठी Jev पहिल्या टप्प्यातील जलद परीक्षक ठरू शकतो; मात्र प्रत्येक प्रकारच्या उत्तरासाठी एकच विश्वासार्ह परीक्षक आहे, असे पुरावे सिद्ध करत नाहीत. विश्वासपातळीच्या आधारे काम पुढे पाठवण्यापूर्वी ती आपल्या उदाहरणांवर नेमके काय भाकीत करते हे पथकाने तपासलेले असावे.

## मॉडेलकडून निर्णय करून घेणे म्हणजे काय

मूल्यांकनकर्ता एक किंवा अधिक मॉडेलची उत्तरे घेऊन एखाद्या नियमाखाली गुण किंवा निकाल देतो. दोन उत्तरांपैकी कोणते प्रॉम्प्टचे अधिक चांगले पालन करते हे ठरवणे, दिलेल्या दस्तऐवजांमधून एखाद्या दाव्याला आधार मिळतो का हे तपासणे, निकषांनुसार उत्तराला गुण देणे किंवा वैद्यकीय बहुपर्यायी प्रकरणातील योग्य पर्याय निवडणे, अशी परीक्षकाची कामे असू शकतात. या प्रत्येक कामासाठी वेगवेगळ्या क्षमता लागतात.

Jev हे TypeSafe चे होस्ट केलेले निर्णय-मॉडेल आहे. त्याचा API संरचित इनपुट आणि अनुमत प्रतिसादाचा प्रकार स्वीकारतो, मग परवानगी असलेल्या लेबलांसाठी संभाव्यतांसह निवड किंवा गुण परत करतो. निश्चित मर्यादेतील निकाल अपेक्षित असलेल्या सॉफ्टवेअरमध्ये हे इंटरफेस काम बसवू शकते. मात्र संभाव्यता हे मॉडेलचे अनुमान असते; ती मूळ उत्तराची स्वतंत्र पडताळणी करत नाही. TypeSafe चे दस्तऐवजीकरण इंटरफेस स्पष्ट करते, तर खालील संशोधन-तुलना ठरावीक चाचणी-संचांवरील कामगिरी तपासतात.

Jev च्या [JEV-as-a-Judge अभ्यास](https://arxiv.org/abs/2609.26550v2), 27 सप्टेंबरला सुधारित आवृत्तीत प्रसिद्ध झालेल्या या अभ्यासात Jev 1.13 ची 16 जनरेटिव्ह आणि रिवॉर्ड-मॉडेल परीक्षकांशी तुलना केली आहे. [निकष-परीक्षक अभ्यास](https://arxiv.org/abs/2609.29769v1), 24 सप्टेंबरला प्रसिद्ध झालेल्या या अभ्यासात Jev ची कमी खर्चिक तीन भाषा-मॉडेलशी तुलना केली आहे. [वैद्यकीय बेंचमार्क](https://arxiv.org/abs/2609.34024v1), 27 सप्टेंबरला प्रसिद्ध झालेल्या या अभ्यासात तर्कशक्तीच्या दोन सेटिंगमध्ये Jev 1.13 ची GPT-6 Sol शी तुलना केली आहे. तिन्ही प्रीप्रिंट आहेत. यांपैकी एकही वैद्यकीय वापरातील तैनातीचा अभ्यास नाही किंवा समीक्षकांकडून समकक्ष-परीक्षण झालेले नाही.

## काही निकालांत जवळची कामगिरी, तर्कशक्तीत मागे

पहिल्या लेखात पसंतीच्या जोड्या, पुराव्यावर आधारित तथ्यनिश्चिती आणि अंतिम उत्तरांची तपासणी अशा एकूण 5,172 निर्णयांचे मूल्यांकन केले आहे. त्यात पुढील चाचण्या आणि प्रशिक्षणात न वापरलेल्या डेटावरील मार्गनिवडीचे दोन अभ्यासही आहेत. Jev चे मुख्य सार्वजनिक बेंचमार्क गुण असे होते: RewardBench मधील नमुना म्हणून निवडलेल्या 1,500 पसंती-जोड्यांवर 92.5%, JudgeBench मधील 350 जोड्यांवर 78.6%, आणि पुराव्याच्या आधारे तपासलेल्या HaluEval मधील 3,000 उत्तरांवर 87.3%. या कामांमध्ये सर्वाधिक मजबूत GPT-6 Astra तुलना-मॉडेलचे गुण अनुक्रमे 92.5%, 93.1% आणि 88.4% होते. अभ्यासाच्या वेळ-मोजणी तक्त्यानुसार Jev चा खर्च प्रत्येक 1,000 मूलभूत निर्णयांसाठी $0.044 आणि मध्यक प्रतिसाद-विलंब 0.15 सेकंद होता; त्याच परिस्थितीत GPT-6 Astra साठी हे $12.182 आणि 1.89 सेकंद होते.

या सरासरींमुळे लेखकांना दिसलेली मर्यादा झाकली जाते. संभाषणाची गुणवत्ता, सुरक्षिततेसाठी नकार आणि पुराव्यावर आधारित तथ्यनिश्चिती यांत Jev GPT-6 च्या साधारण दोन गुणांच्या आत होता. मात्र निकाल काढणे किंवा तपासणे आवश्यक असलेल्या कामांत तो मागे पडला: गणितात 14.3 गुणांनी, कोडमध्ये 12.9 गुणांनी, तर तर्ककोड्यांत 27.6 गुणांनी. JudgeBench च्या वस्तुनिष्ठ अचूकता संचावर Jev ला 78.6%, तर GPT-6 ला 93.1% मिळाले. 990 घटकांच्या उपसंचातील वादग्रस्त प्रकरणांच्या अंध पुनर्निर्णयात 69 विवादित JudgeBench घटकांपैकी 57 वेळा GPT-6 च्या बाजूने, तर एका वेळी Jev च्या बाजूने निर्णय झाला. हा पुनर्निर्णय निवडक आणि मर्यादित होता; तरीही या तफावतीचे कारण केवळ बेंचमार्कवरील लेबले नव्हती, असे तो सूचित करतो.

या अभ्यासात परीक्षकाचे काम म्हणजे दोन तयार केलेल्या उत्तरांपैकी एक निवडणे किंवा दिलेल्या संदर्भाच्या आधारे एका उत्तराला आधार आहे का किंवा ते बरोबर आहे का हे ठरवणे. जनरेटिव्ह परीक्षकांना कारणमीमांसा न देता Jev प्रमाणेच मर्यादित निकाल आणि संभाव्यता देण्याचे स्वरूप लेखकांनी जाणीवपूर्वक दिले. त्यामुळे ही तुलना त्या अटींनुसार दिलेल्या निकालांची आहे; कोणता परीक्षक माणसाला आपले तर्क अधिक चांगल्या प्रकारे समजावतो याची नाही.

## चुकांमध्ये फरक असेल तेव्हाच विश्वासपातळीवर आधारित मार्गनिवड उपयोगी

कॅस्केडमध्ये कमी खर्चिक पहिला परीक्षक वापरला जातो आणि काही प्रकरणे अधिक महाग पर्यायी परीक्षकाकडे पाठवली जातात. पहिल्या अभ्यासात Jev च्या लेबलची कमाल संभाव्यता किमान 0.9 असेल तर त्याचा निकाल स्वीकारला; त्यापेक्षा कमी विश्वासपातळीची प्रकरणे पुढे पाठवली. प्रशिक्षणात न वापरलेल्या 1,610 पसंती-जोड्यांवर, दोन्ही उत्तरक्रम तपासणाऱ्या कॅस्केडने 31.5% प्रकरणे पुढे पाठवली, GPT-6 च्या 92.5% च्या तुलनेत 93.4% गुण मिळवले आणि त्याच्या शुल्काच्या 41% खर्च केला. नव्या अचूकता-कामांतील प्रशिक्षणात न वापरलेल्या 570 जोड्यांच्या पूर्वनिश्चित प्रत्यक्ष चाचणीत Jev एकट्याची कामगिरी GPT-6 पेक्षा 14 गुणांनी कमी होती; कॅस्केडने 74% प्रकरणे पुढे पाठवून GPT-6 इतकी अचूकता गाठली आणि त्याच्या शुल्कातील सुमारे एक चतुर्थांश रक्कम वाचवली.

या निकालासाठी एक विशिष्ट अट आवश्यक आहे: Jev ला ज्या प्रकरणांबद्दल खात्री नसते, त्यात त्याच्या चुका असल्या पाहिजेत आणि पर्यायी मॉडेल त्या दुरुस्त करू शकले पाहिजे. शैलीला आव्हान देणाऱ्या जोड्यांवर विश्वासपातळीवर आधारित मार्गनिवड कमी प्रभावी झाली; संदर्भ नसलेल्या गद्यलेखनात ती अपयशी ठरली. तिथे तपासलेल्या सर्व परीक्षकांची कामगिरी योगायोगाच्या जवळ होती, तरीही त्यांना अनेकदा खात्री वाटत होती. दोन्ही उत्तरक्रमांतील निर्णयांची सरासरी काढल्याने क्रमामुळे होणारा परिणाम कमी झाल्याचेही अभ्यासात आढळले. मर्यादा स्थानिक पातळीवर लेबल केलेल्या उदाहरणांच्या आधारे निवडल्या; लेखात कमी विश्वासपातळीच्या खालच्या मर्यादेवर आधारित पद्धत आणि राखून ठेवलेल्या डेटावरील तपासणी सुचवली आहे.

वेगवेगळ्या निकषांनुसार गुण देण्याच्या नऊ संचांवर स्वतंत्र निकष-अभ्यासाने चाचणी केली; हे संच सात बेंचमार्कमधून घेतले असून एकूण 5,003 घटक-निकष जोड्या होत्या. दोन संचांमध्ये बायनरी आणि सातमध्ये क्रमवारीनुसार गुण देण्याची मापने होती. चारही परीक्षकांना निकषांचा समान मजकूर देण्यात आला आणि मूल्यांकनापूर्वी लेखकांनी निकष निश्चित केले. 27 जोडतुलनांपैकी आठमध्ये अचूकतेच्या फरकाची 95% विश्वास-अंतर मर्यादा शून्याला समाविष्ट करत नव्हती; अनेक तुलनांची दुरुस्ती केल्यानंतर चारच अशा राहिल्या. काही इतर तुलनांनी लेखातील समतुल्यता-मर्यादा पूर्ण केली; परंतु अनेक तुलना इतक्या अनिश्चित होत्या की फरक किंवा समतुल्यता, दोन्हींपैकी काहीही सिद्ध करता आले नाही. बायनरी निकषांवर इतर परीक्षकांच्या तुलनेत Jev सर्वोत्तम होता. गुणांकनाच्या क्रमवारीवाले संचांमध्ये तो एकदाही सर्वाधिक जुळणारा परीक्षक ठरला नाही; सर्व परीक्षक मानवी मूल्यांकनकर्त्यांपेक्षा कमी गुण देण्याकडे झुकले.

त्या मांडणीत खर्च आणि वेगातील बचत मोठी होती. नऊही संचांसाठी Jev चा खर्च साधारण सहा सेंट होता; तीन भाषा-मॉडेल परीक्षकांचा खर्च 29 ते 325 पट अधिक आणि लागलेला वेळ 30 ते 220 पट जास्त होता. तरीही Jev च्या विश्वासपातळीमुळे प्रभावी कॅस्केड तयार झाला नाही. बहुतेक संचांमध्ये विश्वासपातळीने त्याच्या चुका योग्य क्रमाने ओळखल्या, पण पर्यायी मॉडेलनी Jev च्या सर्वाधिक खात्रीने केलेल्या जवळजवळ सर्व चुका पुन्हा केल्या. वेगवेगळ्या भागांवर बसवलेल्या मर्यादांसह, सर्वोत्तम एकल परीक्षकाच्या तुलनेत कॅस्केडची सरासरी सुधारणा जास्तीत जास्त 1.5 टक्के-बिंदू होती; नऊपैकी सहा संचांमध्ये त्याची कामगिरी त्या परीक्षकापेक्षा वाईट होती. या पुनर्तपासणीत प्रत्यक्ष भविष्यातील वापराऐवजी आधी नोंदवलेले निकाल वापरले होते.

या दोन लेखांतील विरोधाभासातून महत्त्वाचा धडा मिळतो. जोड्यांतील उत्तर-तुलनेत पहिल्या अभ्यासाला Jev च्या कमी विश्वासपातळीच्या चुका आणि अधिक सक्षम पर्यायी मॉडेलच्या क्षमतेत उपयुक्त विभागणी आढळली. निकषांनुसार गुणांकनात पर्यायी मॉडेलच्या चुका अनेकदा सारख्याच होत्या; त्यामुळे पुढे पाठवल्याने खर्च वाढला, पण चुका फारशा दुरुस्त झाल्या नाहीत. मॉडेलचा विश्वासपातळी-संकेत एकटाच दुसरे मॉडेल उपयुक्तरीत्या असहमत ठरेल का हे पथकाला सांगत नाही.

## वैद्यकीय बहुपर्यायी निकाल कामाच्या कठीणपणावर अवलंबून

वैद्यकीय लेखात Jev ची चार विद्यमान डेटासेटवर चाचणी केली: MetaMedQA मधील 1,373 परीक्षा-प्रश्न, संशोधन-सारांशांच्या आधारे उत्तर द्यायचे PubMedQA मधील 500 प्रश्न, DiagnosisArena मधील 915 बहुपर्यायी प्रकरणे, आणि प्रकाशित अंतिम निदान असलेली NEJM Case Challenges मधील 34 प्रकरणे. मध्यम तर्कशक्ती वापरून आणि तर्कशक्ती न वापरता, अशा दोन्ही स्थितींमध्ये Jev ची GPT-6 Sol शी तुलना केली. मॉडेलकडे एकूण 8,469 विनंत्या करण्यात आल्या आणि प्रत्येक विनंतीतून वैध संरचित उत्तर मिळाले.

PubMedQA वर मध्यम तर्कशक्तीसह Jev आणि GPT-6 Sol यांना अनुक्रमे 78.4% आणि 78.2% गुण मिळाले. MetaMedQA वर Jev चे 74.8%, तर GPT-6 Sol चे 82.7% गुण होते; DiagnosisArena वर अनुक्रमे 59.8% आणि 82.4%; आणि 34 NEJM प्रकरणांवर 61.8% आणि 82.4%. तर्कशक्ती न वापरलेल्या GPT-6 चे अंदाजित गुणही दोन अधिक कठीण प्रकरण-संचांमध्ये जास्त होते. 34 NEJM प्रकरणांवरील अंदाज अनिश्चित आहे; अनेक तुलनांची दुरुस्ती केल्यानंतर मुख्य तुलना सांख्यिकीयदृष्ट्या महत्त्वपूर्ण राहिली नाही. DiagnosisArena मधील खूप मोठी तफावत स्पष्ट तर्कशक्ती न वापरतानाही कायम राहिली.

ही दिलेल्या पर्यायांमधून निवड करण्याची चाचणी आहे; विभेदक निदान तयार करण्याची किंवा रुग्णांवर उपचार करण्याची नाही. बेंचमार्क उत्तरांचे डॉक्टरांनी पुनर्निर्णय केल्याचे लेखात नमूद नाही. NEJM मधील प्रतिमा मॉडेलना मजकूर-कॅप्शन म्हणून देण्यात आल्या आणि DiagnosisArena मधील आव्हानात्मक प्रकरणे अन्य भाषा-मॉडेलच्या साहाय्याने निवडण्यात आल्याचे लेख सांगतो. लेखक निष्कर्षांना प्राथमिक म्हणतात; स्वतंत्र पुनरावृत्ती, संदर्भ-उत्तरांचे वैद्यकीय पुनर्निर्णय आणि प्रयोगागणिक स्थिरतेच्या तपासण्या अजून बाकी असल्याचे सांगतात. वैद्यकीय उपचारांना मार्गदर्शन करण्यासाठी हे निकाल वापरू नयेत, असे लेख स्पष्टपणे नमूद करतो.

संभाव्यता-मर्यादांचे मूल्य सर्व कामांमध्ये सारखे नव्हते. MetaMedQA वर Jev च्या 52.9% निवडींची विश्वासपातळी किमान 0.9 होती आणि त्या 93.4% अचूक होत्या. साधारण तितक्याच प्रमाणात प्रकरणे स्वीकारल्यावर GPT-6 तितकेच किंवा अधिक अचूक होते. DiagnosisArena वर Jev ची संभाव्यता-क्रमवारी कमकुवत होती: तीच 0.9 मर्यादा लावल्यावर फक्त 17.3% घटक स्वीकारले गेले आणि स्वीकारलेल्या प्रत्येक चार उत्तरांपैकी एक तरी चुकीचे होते. प्रत्येक बेंचमार्कवर मॉडेलने निवडलेल्या पर्यायाची सरासरी संभाव्यता त्याच्या अचूकतेपेक्षा जास्त होती. या नमुन्यात मोठा गुण म्हणजे खात्री नव्हती.

## या अभ्यासांतून पथकांना काय शिकता येईल

एकत्रितपणे, दिलेल्या मजकुरातून निकाल वाचता येतो किंवा पुराव्याशी पडताळता येतो अशा कामांसाठी Jev ला विशिष्ट कामाचा मूल्यांकनकर्ता म्हणून तपासण्यास हे लेख पाठिंबा देतात. त्याच्या विश्वासपातळीच्या घटकाला सार्वत्रिक सुरक्षा-स्विच मानण्यास ते समर्थन देत नाहीत. वेगवेगळ्या कामांत वेगवेगळे परिणाम दिसले; आणि निकष-अभ्यास दाखवतो की पर्यायी मॉडेलची केवळ मूळ अचूकताच नव्हे, तर त्याच्या चुका स्वतंत्र आहेत का हेही तपासणे का गरजेचे आहे.

ही पद्धत विचारात घेणाऱ्या पथकाला स्वतःच्या कामातून घेतलेला प्रतिनिधिक, लेबल केलेला नमुना आवश्यक आहे. योग्य निर्णय म्हणजे काय हे निश्चित करावे, कठीण आणि दिशाभूल करणारी उदाहरणे समाविष्ट करावीत, मानवी पुनरावलोकन किंवा अन्य समर्थनीय संदर्भाशी तुलना करावी आणि मग चुकीचे निर्णय किती होतात तसेच योग्य व अयोग्य निर्णय वेगळे ओळखण्यात विश्वासपातळी किती मदत करते हे मोजावे. कॅस्केडसाठी पर्यायी मॉडेल पहिल्या टप्प्यातील चुका खरोखर दुरुस्त करते का, किती प्रकरणे पुढे पाठवली जातात आणि त्यातून किती खर्च व विलंब होतो हेही नोंदवावे. मर्यादा निवडण्यासाठी वापरलेल्या उदाहरणांपलीकडे ती लागू होते का, हे राखून ठेवलेला स्वतंत्र चाचणी-संच दाखवू शकतो.

हे अभ्यासांतून काढलेले व्यावहारिक निष्कर्ष आहेत; BIG CHANGE ने तपासलेली प्रक्रिया नाही. आम्ही Jev API वापरला नाही किंवा स्थानिक बेंचमार्क चालवला नाही. TypeSafe चे [API दस्तऐवजीकरण](https://api.typesafe.ai/docs) संरचित विनंत्या, अनुमत उत्तरांचे प्रकार आणि मॉडेल शोध यांचे वर्णन करते; परंतु एखाद्या पथकाच्या कामावरील अचूकता स्वतंत्रपणे सिद्ध करत नाही. उत्पादनाचा प्रवेश, किंमती आणि मॉडेल बदलू शकतात, त्यामुळे चाचणीचे नियोजन करताना पथकांनी अद्ययावत दस्तऐवजीकरण तपासावे.

सध्या काम मर्यादित असेल, लेबले स्पष्ट असतील आणि स्थानिक मूल्यांकनात विश्वासपातळीवर आधारित मार्गनिवड चुका प्रभावीपणे हाताळत असल्याचे दिसले, तर Jev पहिला परीक्षक म्हणून उपयोगी उमेदवार वाटतो. निर्णयासाठी सखोल तर्कशक्ती लागते, गुणांकन लपलेल्या परीक्षक-परंपरांवर अवलंबून असते किंवा अनेक मॉडेल एकाच चुका करतात, तेव्हा मानवी पुनरावलोकन किंवा अन्य प्रमाणित तपासणी कार्यप्रवाहात ठेवण्याचे कारण हे अभ्यास देतात.

## मोठा बदल

Jev वरील नव्या मूल्यांकनांमुळे प्रश्न बदलतो: निर्णय-मॉडेल कमी खर्चात निकाल देऊ शकते का, यापेक्षा कोणत्या परिस्थितीत तो निकाल वापरण्याइतका उपयुक्त असतो? उत्तर कामावर अवलंबून आहे: विश्वासपातळीवर आधारित मार्गनिवडीने प्रशिक्षणात न वापरलेल्या डेटावरील जोड-तुलना कॅस्केड सुधारला; पण चुका एकमेकांशी जुळत असल्याने स्वतंत्र निकष-अभ्यासात फारसा फायदा दिसला नाही. वैद्यकीय बहुपर्यायी निकालही कामाच्या कठीणपणानुसार ठळकपणे बदलले. AI पथकांसाठी पुढचे पाऊल म्हणजे अचूकता, विश्वासपातळी आणि पर्यायी मॉडेलचे वर्तन एकत्र तपासणारा स्थानिक प्रमाणीकरण-संच.

## स्रोत आणि पुढील वाचन

- [JEV न्यायाधीश म्हणून: खात्री असेल तेव्हा स्वीकारा, शंका असेल तेव्हा पुढे पाठवा](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan आणि Rema Padman; 27 सप्टेंबर 2026 दिनांकित आवृत्ती 2. 16 परीक्षकांशी Jev ची तुलना करणारा प्रीप्रिंट; यात अंध मानवी पुनर्निर्णय आणि प्रशिक्षणात न वापरलेल्या डेटावरील विश्वासपातळी-मार्गनिवडीच्या चाचण्यांचा समावेश आहे.
- [निकष-परीक्षक म्हणून Jev विरुद्ध LLM: स्वस्त, जलद आणि त्याच ठिकाणी चुकीचे](https://arxiv.org/abs/2609.29769v1), Delip Rao आणि Chris Callison-Burch; 24 सप्टेंबर 2026. नऊ बेंचमार्क संचांवर प्रत्येक निकषासाठी बायनरी आणि गुणांकनाधारित परीक्षणाचे मूल्यांकन करणारा प्रीप्रिंट.
- [वैद्यकशास्त्रातील Jev: बेंचमार्क मूल्यांकन. प्राथमिक निष्कर्ष.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García आणि Beatriz Merino-Barbancho; 27 सप्टेंबर 2026. चार वैद्यकीय बहुपर्यायी डेटासेटची प्राथमिक बेंचमार्क तुलना; हा वैद्यकीय वापरातील अभ्यास नाही.
- [TypeSafe API दस्तऐवजीकरण](https://api.typesafe.ai/docs), Jev च्या संरचित विनंती आणि प्रतिसाद-इंटरफेसचा अधिकृत संदर्भ. हे दस्तऐवजीकरण उत्पादनाचे वर्तन सांगते; स्वतंत्र कामगिरी-मूल्यांकन नाही.

## Sources

- [JEV न्यायाधीश म्हणून: खात्री असेल तेव्हा स्वीकारा, शंका असेल तेव्हा पुढे पाठवा (v2)](https://arxiv.org/abs/2609.26550v2) — मुख्य प्रीप्रिंट, 22 सप्टेंबरला सादर आणि 27 सप्टेंबरला सुधारित. पसंती, पुराव्यावर आधारित तथ्यनिश्चिती आणि अंतिम उत्तरांच्या कामांत Jev 1.13 ची 16 परीक्षकांशी तुलना. यात निवडक अंध पुनर्निर्णय, आधी गोठवलेल्या ऑफलाइन कॅस्केड विश्लेषणांचा आणि नव्या कामांवरील पूर्वनिश्चित प्रत्यक्ष चाचण्यांचा समावेश आहे. समकक्ष-परीक्षण झालेले नाही आणि हा वापरातील तैनातीचा अभ्यास नाही; संगणकीय साधनांच्या तुलनेची समानता, निवडक पुनर्निर्णय, कामांची व्याप्ती, खर्च आणि वेळ यांवरील मर्यादा SOURCE-AUDIT.md मध्ये नोंदवल्या आहेत.
- [निकष-परीक्षक म्हणून Jev विरुद्ध LLM: स्वस्त, जलद आणि त्याच ठिकाणी चुकीचे (v1)](https://arxiv.org/abs/2609.29769v1) — नऊ बेंचमार्क संचांवरील आणि निकष-घटकांच्या 5,003 जोड्यांवरील मुख्य प्रीप्रिंट; यात Jev ची तीन flash-स्तरीय LLM शी तुलना केली आहे. निकषांचा मजकूर समान होता; दोन संच बायनरी आणि सात गुणांकनाधारित होते. परस्पर-संबंधित आत्मविश्वासपूर्ण चुका आणि मुख्यतः आधी नोंदवलेल्या निकालांवर आधारित मार्गनिवडीचे विश्लेषण दर्शवते. समकक्ष-परीक्षण झालेले नाही; अनेक तुलनांचे सांख्यिकीय निष्कर्ष अनिश्चित असून निष्कर्ष निवडलेल्या निकष, संच आणि सेवा-परिस्थितीपुरते मर्यादित आहेत.
- [वैद्यकशास्त्रातील Jev: बेंचमार्क मूल्यांकन. प्राथमिक निष्कर्ष. (v1)](https://arxiv.org/abs/2609.34024v1) — चार वैद्यकीय बहुपर्यायी बेंचमार्कवर Jev 1.13 ची GPT-6 Sol शी तुलना करणारा प्राथमिक मुख्य प्रीप्रिंट. यात अचूकता, कॅलिब्रेशन/निवडक भाकीत, उत्तर न देणे, प्रतिसाद-विलंब आणि खर्च यांचा समावेश आहे. वैद्यकीय तैनाती किंवा डॉक्टरांकडून पुनर्निर्णय नाही; स्वतंत्र पुनरावृत्ती आणि निकालांची पडताळणी बाकी असल्याचे लेखक सांगतात आणि वैद्यकीय उपचारांसाठी निकाल वापरू नयेत असा सल्ला देतात.
- [TypeSafe API दस्तऐवजीकरण](https://api.typesafe.ai/docs) — 29 सप्टेंबर 2026 रोजी पाहिलेले अधिकृत OpenAPI दस्तऐवजीकरण; संरचित विनंती/प्रतिसाद आराखडे, system-one एंडपॉइंट आणि मॉडेल शोध दाखवते. केवळ इंटरफेसच्या वर्णनाला आधार देते; स्वतंत्र कामगिरी-दाव्यांना नाही. उत्पादनाची उपलब्धता आणि किंमती बदलू शकतात.
- [मालकाकडून हस्तांतरित Instagram Reel Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — फक्त काम नेमण्याचा धागा: Reel मिळवता किंवा त्याचे प्रतिलेखन करता आले नाही. मथळा आणि मेटाडेटा पुरावा म्हणून वापरलेले नाहीत; दृश्यांना कोणतेही दावे जोडलेले नाहीत.