Sinusubok ng tatlong bagong preprint ang Jev bilang evaluator sa magkakaibang paraan. Nakita sa isa na malapit ito sa mahusay na language-model judge sa pagpili ng mas mainam na sagot at sa fact-check na nakabatay sa ebidensiya, at gumamit ito ng confidence upang i-escalate ang mga kasong hindi tiyak. Sa ikalawa, kakaunti ang pakinabang ng ganitong routing sa mga rubric na may marka dahil madalas ulitin ng mga fallback model ang mga kumpiyansang pagkakamali ng Jev. Iniulat naman ng ikatlong medical benchmark ang magkahawig na accuracy sa mga tanong tungkol sa research abstract at malaking agwat sa mas mahihirap na kaso ng diagnosis.
Mas makitid ang praktikal na konklusyon kaysa sa “kayang humatol ng AI sa AI.” Maaaring maging mabilis na unang tagahatol ang Jev para sa malinaw na takdang gawain, pero hindi ipinakikita ng ebidensiya na may iisang maaasahang judge para sa lahat ng uri ng sagot. Makakatulong lang ang confidence sa pag-route ng gawain kapag nasuri na ng team kung ano ang nahuhulaan nito sa sarili nilang mga halimbawa.
Ano ang ibig sabihin ng paghatol ng isang modelo
Tumatanggap ang evaluator ng isa o higit pang output ng modelo at nagbabalik ng score o pasya ayon sa isang tuntunin. Maaaring pumili ang judge kung alin sa dalawang sagot ang mas sumusunod sa prompt, magpasya kung sinusuportahan ng mga ibinigay na dokumento ang isang pahayag, magbigay ng marka batay sa rubric, o pumili ng tamang opsyon sa isang multiple-choice na kasong medikal. Magkakaiba ang hinihingi ng mga gawaing ito sa evaluator.
Ang Jev ang hosted decision model ng TypeSafe. Tumatanggap ang API nito ng structured input at pinapayagang uri ng sagot, at nagbabalik ng pagpili o score kasama ang mga probability para sa pinapayagang label. Maaaring iakma ng interface ang isang gawain sa software na nangangailangan ng limitadong uri ng resulta. Gayunman, tantiya ng modelo ang isang probability; hindi nito kusang bine-verify ang batayang sagot. Inilalarawan ng dokumentasyon ng TypeSafe ang interface, samantalang sinusukat ng mga paghahambing sa ibaba ang performance sa mga partikular na test set.
Ang pag-aaral sa JEV bilang Judge, na binago noong Setyembre 27, ay naghahambing sa Jev 1.13 at 16 na generative at reward-model judge. Inihahambing naman ng pag-aaral sa rubric judge, na inilathala noong Setyembre 24, ang Jev at tatlong mas murang language model. Inihahambing ng medical benchmark, na inilathala noong Setyembre 27, ang Jev 1.13 at GPT-6 Sol sa dalawang setting ng reasoning. Preprint ang tatlo. Wala sa mga ito ang pag-aaral ng klinikal na deployment, at wala ring peer review.
Malapit sa ilang pasya, mas mahina sa pangangatwiran
Sinusuri ng unang papel ang 5,172 pasya sa mga pares ng preference, fact check na nakabatay sa ebidensiya, at pagsusuri ng huling sagot, saka nagdagdag ng follow-up test at dalawang held-out na pag-aaral ng routing. Ang pangunahing public benchmark score ng Jev ay 92.5% sa 1,500 sample na RewardBench preference pair, 78.6% sa 350 JudgeBench pair, at 87.3% sa 3,000 HaluEval na sagot na sinuri batay sa ebidensiya. Sa mga gawaing iyon, nakakuha ang pinakamalakas na GPT-6 Astra comparator ng 92.5%, 93.1% at 88.4%. Iniulat ng papel na nagkakahalaga ang Jev ng $0.044 kada 1,000 batayang pasya at may 0.15 segundong median latency sa timing panel nito; $12.182 at 1.89 segundo naman ang GPT-6 Astra sa mga kundisyon ng pag-aaral.
Hindi ipinakikita ng mga average na ito ang hangganang nakita ng mga may-akda. Nasa humigit-kumulang dalawang puntos ang Jev mula sa GPT-6 sa kalidad ng chat, pagtanggi dahil sa kaligtasan at fact checking na nakabatay sa ebidensiya. Naiwan ito sa mga gawaing nangangailangan ng pagkuha o pag-check ng resulta: 14.3 puntos sa math at 12.9 sa code, at 27.6 puntos ang agwat sa mga logic puzzle. Sa objective correctness set ng JudgeBench, 78.6% ang Jev kumpara sa 93.1% ng GPT-6. Sa blind na paghusga sa pinagtatalunang kaso sa subset na may 990 item, kumampi ang mga tagasuri sa GPT-6 sa 57 sa 69 pinagtatalunang JudgeBench item at sa Jev sa isa. Pumili lamang sila ng limitadong bilang ng kaso, pero ipinahihiwatig nito na hindi lang label ng benchmark ang dahilan ng agwat.
Dito, nangangahulugan ang “judge” ng pagpili sa pagitan ng dalawang nabuong sagot o pagpapasya kung suportado o tama ang iisang sagot batay sa tinukoy na sanggunian. Sadyang binigyan ng mga may-akda ang generative judge ng kaparehong limitadong format ng pasya at probability gaya ng Jev, nang walang paliwanag. Kaya paghahambing ito ng mga pasya sa ilalim ng kontratang iyon, hindi ng kakayahan ng bawat judge na ipaliwanag sa tao ang pangangatwiran nito.
Gumagana ang confidence routing kapag magkahiwalay ang mga pagkakamali
Gumagamit ang cascade ng mas murang unang judge at ipinapasa ang ilang kaso sa mas mahal na fallback. Sa unang pag-aaral, tinatanggap ng tuntunin ang pasya ng Jev kapag hindi bababa sa 0.9 ang pinakamataas na probability ng label nito, at ipinapasa sa susunod ang mga kasong mas mababa ang confidence. Sa 1,610 held-out na pares ng preference, in-escalate ng cascade na may dalawang pagkakasunod-sunod ang 31.5% ng kaso, nakakuha ng 93.4% kumpara sa 92.5% ng GPT-6, at gumastos ng 41% ng bayad sa GPT-6. Sa paunang itinakdang live test na may 570 held-out na pares mula sa dalawang bagong correctness workload, 14 puntos na mas mababa ang Jev lamang kaysa GPT-6; katumbas ng GPT-6 ang accuracy ng cascade habang ini-escalate nito ang 74% at nakatitipid ng halos sangkapat ng bayad.
May partikular na kundisyon ang resultang iyon: dapat naglalaman ang mga kasong hindi tiyak para sa Jev ng mga pagkakamaling kayang itama ng fallback. Nakita ng mga may-akda na humina ang confidence routing sa mga pares na sadyang mapanlinlang sa estilo at pumalya ito sa prosa na walang sanggunian; halos tsamba lang ang lahat ng sinubok na judge roon kahit madalas mataas ang confidence. Napag-alaman din ng pag-aaral na nabawasan ang epekto ng pagkakasunod-sunod kapag in-average ang mga pasya sa dalawang ayos ng sagot. Pinili ang mga threshold gamit ang mga lokal na halimbawang may label; inirekomenda ng papel ang paraang gumagamit ng lower confidence bound at hiwalay na held-out na pagsusuri.
Sinusuri ng hiwalay na pag-aaral sa rubric ang pagmamarka kada criterion sa siyam na panel mula sa pitong benchmark, 5,003 pares ng item at criterion sa kabuuan. Binary ang dalawa sa mga panel; gumagamit naman ng nakaayos na rating scale ang pito. Iisa ang teksto ng criterion na nakita ng apat na judge, at itinakda ng mga may-akda ang rubric bago ang pagsusuri. Sa 27 ipinares na paghahambing, may walong 95% confidence interval na hindi sumaklaw sa kawalan ng pagkakaiba; apat ang natira matapos itama ang maraming paghahambing. Pasok sa itinakdang equivalence margin ng papel ang ilang iba pang paghahambing, samantalang masyadong hindi tiyak ang marami para maitaguyod ang pagkakaiba o pagkakapantay. Pinakamahusay ang Jev kumpara sa iba sa binary criteria. Sa mga graded panel, hindi ito naging nangungunang katugmang judge; at karaniwang mas mababa ang markang ibinigay ng lahat ng judge kaysa sa mga human rater.
Malaki ang natipid sa gastos at oras sa setup na iyon. Humigit-kumulang anim na sentimo ang gastos sa Jev para sa siyam na panel; 29 hanggang 325 ulit na mas mahal ang tatlong language-model judge at 30 hanggang 220 ulit na mas matagal. Gayunman, hindi naging mahusay ang confidence-based cascade ng Jev. Sa karamihan ng panel, nairanggo nang maayos ng confidence ang mga pagkakamali ni Jev, pero halos lahat ng maling pasya nito na pinakamataas ang confidence ay inulit ng mga fallback model. Sa mga cross-fitted na threshold, hanggang 1.5 percentage point lang ang karaniwang itinaas ng accuracy ng cascade kumpara sa pinakamagaling na nag-iisang judge; mas mababa pa ang accuracy nito kaysa sa judge na iyon sa anim sa siyam na panel. Gumamit sa replay na ito ng mga naitalang pasya sa halip na paunang planadong live deployment.
Mahalaga ang pagkakaiba ng dalawang papel. Sa paghahambing ng mga sagot nang pares, nakakita ang unang pag-aaral ng kapaki-pakinabang na paghahati sa pagitan ng mga pagkakamali ng Jev na mababa ang confidence at ng kakayahan ng mas malakas na fallback. Sa pagmamarka batay sa criterion, madalas magkapareho ang mga pagkakamali ng fallback kaya nagdagdag ng gastos ang escalation nang kaunti lang ang naitama. Hindi sapat ang signal ng confidence ng modelo para malaman ng team kung kapaki-pakinabang ang hindi pagsang-ayon ng isa pang modelo.
Nakadepende sa hirap ng gawain ang resulta sa medical multiple-choice
Sinusuri ng medical paper ang Jev sa apat na dati nang dataset: 1,373 tanong sa pagsusulit ng MetaMedQA, 500 tanong sa PubMedQA na sinagot batay sa research abstract, 915 multiple-choice na kaso ng DiagnosisArena, at 34 NEJM Case Challenge na may inilathalang pinal na diagnosis. Inihambing nito ang Jev at GPT-6 Sol kapwa sa medium reasoning at walang reasoning. May 8,469 kahilingan sa modelo, at nagbalik ng wastong structured answer ang bawat isa.
Sa PubMedQA, 78.4% ang Jev at 78.2% ang GPT-6 Sol na may medium reasoning. Sa MetaMedQA, 74.8% ang Jev kumpara sa 82.7%; sa DiagnosisArena, 59.8% kumpara sa 82.4%; at sa 34 NEJM case, 61.8% kumpara sa 82.4%. Mas mataas din ang point estimate ng GPT-6 na walang reasoning sa dalawang mas mahirap na case set. Hindi tiyak ang tantiya para sa 34 NEJM case, at hindi na naging statistically significant ang pangunahing paghahambing matapos itama ang maraming paghahambing. Nanatili ang mas malaking agwat sa DiagnosisArena kahit walang tahasang reasoning.
Pagsubok ito ng pagpili sa mga ibinigay na opsyon, hindi ng paggawa ng differential diagnosis o paggamot sa pasyente. Walang iniulat ang papel na paghusga ng clinician sa mga sagot ng benchmark. Binanggit nito na ibinigay sa mga modelo bilang caption ang mga larawan ng NEJM at sinala ang mahihirap na kaso ng DiagnosisArena gamit ang iba pang language model. Tinawag ng mga may-akda na paunang resulta ang mga natuklasan at sinabing kailangan pa ang independiyenteng pag-ulit, klinikal na paghusga sa mga reference answer, at pagsusuri ng consistency sa bawat run. Tahasang sinasabi ng papel na huwag gamitin ang resulta sa paggabay ng pangangalagang klinikal.
Hindi pare-pareho ang halaga ng probability threshold. Sa MetaMedQA, hindi bababa sa 0.9 ang confidence sa 52.9% ng mga pinili ng Jev, at 93.4% sa mga iyon ang tama. Sa katulad na coverage, kasing-tumpak o mas tumpak ang GPT-6. Mahina ang ranggo ng probability ng Jev sa DiagnosisArena: sa kaparehong 0.9 threshold, 17.3% lang ng item ang tinanggap, at mali pa rin ang isa sa bawat apat na tinanggap na sagot. Sa bawat benchmark, mas mataas ang average probability ng mga piniling opsyon ng mga modelo kaysa sa accuracy nila. Sa sample na ito, hindi katumbas ng katiyakan ang mataas na score.
Ano ang mapupulot ng mga team sa mga pag-aaral
Sama-samang sinusuportahan ng mga papel ang pagsubok sa Jev bilang evaluator para sa tiyak na gawain, lalo na kung mababasa ang pasya mula sa ibinigay na teksto o mache-check ito batay sa ebidensiya. Hindi nila sinusuportahan ang pagtrato sa confidence field nito bilang unibersal na safety switch. Magkakaiba ang naging resulta sa iba’t ibang workload, at ipinakikita ng pag-aaral sa rubric kung bakit kailangang tasahin ang fallback batay rin sa pagiging hiwalay ng mga pagkakamali nito, hindi lang sa pangkalahatang accuracy.
Kailangan ng team na isinasaalang-alang ang ganitong pattern ng kinatawan at may-label na sample mula sa sarili nitong gawain. Dapat nitong tukuyin kung ano ang maituturing na tamang pasya, magsama ng mahirap at mapanlinlang na mga halimbawa, maghambing sa human review o ibang mapagtatanggol na sanggunian, at sukatin ang error rate at kung gaano kahusay na naihihiwalay ng confidence ang tama sa mali. Para sa cascade, dapat ding itala kung talagang naitatama ng fallback ang mga pagkakamali sa unang yugto, ilang kaso ang ini-escalate, at ang kaugnay na gastos at pagkaantala. Maipakikita ng nakalaang test set kung maililipat ang threshold lampas sa mga halimbawang ginamit sa pagpili rito.
Mga praktikal na implikasyon ito ng mga pag-aaral, hindi isang prosesong sinubukan ng BIG CHANGE. Hindi namin tinawagan ang Jev API o nagpatakbo ng lokal na benchmark. Inilalarawan ng dokumentasyon ng API ng TypeSafe ang structured request, mga pinapayagang uri ng sagot at paghanap ng modelo; hindi nito kusang pinatutunayan ang accuracy sa workload ng isang team. Maaaring magbago ang access sa produkto, presyo at mga modelo, kaya dapat tingnan ng mga team ang kasalukuyang dokumentasyon kapag nagpaplano ng pagsubok.
Sa ngayon, mukhang kapaki-pakinabang ang Jev bilang kandidatong unang judge kapag makitid ang gawain, malinaw ang mga label at ipinakikita ng lokal na pagsusuri na mabisa ang confidence sa pag-route ng mga pagkakamali. Kapag nangangailangan ng mas malalim na pangangatwiran ang paghatol, nakadepende sa nakatagong kaugalian ng mga tagasuri ang pagmamarka, o pare-pareho ang pagkakamali ng maraming modelo, may dahilan ang mga pag-aaral para panatilihin ang human review o ibang napatunayang pagsusuri.
Ang malaking pagbabago
Inililipat ng mga bagong pagsusuri sa Jev ang tanong mula sa kung kaya bang magbigay ng murang pasya ang isang decision model tungo sa kung kailan sapat na kapaki-pakinabang ang pasyang iyon upang gamitin. Nakasalalay ang sagot sa gawain: pinagbuti ng confidence routing ang held-out na cascade sa pairwise evaluation, samantalang kakaunti ang pakinabang na nakita sa hiwalay na pag-aaral sa rubric dahil magkakapatong ang mga pagkakamali. Malaki rin ang ipinagbago ng resulta sa medical multiple-choice ayon sa hirap ng gawain. Para sa mga AI team, ang susunod na hakbang ay lokal na validation set na sabay sumusuri sa correctness, confidence at asal ng fallback.
Mga sanggunian at karagdagang babasahin
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure, Yubo Li, Yidi Miao, Ramayya Krishnan at Rema Padman, bersyon 2 na may petsang Setyembre 27, 2026. Preprint na naghahambing sa Jev at 16 na judge, kabilang ang blind na paghusga ng tao at held-out na mga pagsubok sa confidence routing.
- Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places, Delip Rao at Chris Callison-Burch, Setyembre 24, 2026. Preprint na sumusuri sa binary at graded rubric judgment kada criterion sa siyam na benchmark panel.
- Jev in Medicine: A Benchmark Evaluation. Preliminary results., Alfredo Madrid-García at Beatriz Merino-Barbancho, Setyembre 27, 2026. Paunang paghahambing ng benchmark sa apat na medical multiple-choice dataset; hindi klinikal na pag-aaral.
- Dokumentasyon ng TypeSafe API, opisyal na sanggunian para sa structured request at output interface ng Jev. Inilalarawan ng dokumentasyon ang gawi ng produkto, hindi ang independiyenteng pagsusuri nito.



