Три нова препринт рада на различите начине тестирају Jev као евалуатор. Један показује да је близу снажног судије заснованог на језичком моделу при поређењу одговора и провери чињеница према доказима, а затим користи поузданост за прослеђивање неизвесних случајева. Други налази малу корист од таквог усмеравања при оцењивању по рубрици јер резервни модели често понављају Jev-ове самоуверене грешке. Трећи медицински бенчмарк бележи сличну тачност на питањима заснованим на истраживачким сажецима и велике разлике у тежим дијагностичким случајевима.
Практичан закључак је ужи од тврдње „AI може да суди АИ-ју“. Jev може бити брз судија у првом пролазу за јасно дефинисан задатак, али докази не показују да постоји један поуздан судија за сваку врсту одговора. Поузданост може помоћи при усмеравању посла тек пошто тим провери шта она предвиђа на сопственим примерима.
Шта значи да модел суди
Евалуатор прима један или више излаза модела и враћа оцену или пресуду према неком правилу. Судија може да изабере који од два одговора боље прати промпт, утврди да ли тврдњу поткрепљују достављени документи, оцени одговор према рубрици или изабере тачну опцију у медицинском питању са више понуђених одговора. Ти задаци постављају различите захтеве пред евалуатор.
Jev је TypeSafe-ов хостовани модел за доношење одлука. Његов API прима структурисан улаз и дозвољени тип одговора, а затим враћа избор или оцену са вероватноћама за допуштене ознаке. Интерфејс може да уклопи задатак у софтвер који очекује ограничен резултат. Међутим, вероватноћа је процена модела; она независно не проверава основни одговор. TypeSafe-ова документација описује интерфејс, док истраживачка поређења у наставку процењују учинак на конкретним скуповима за тестирање.
Студија JEV-as-a-Judge, ревидирана 27. септембра, пореди Jev 1.13 са 16 генеративних судија и судија заснованих на моделима награђивања. Студија о судијама за рубрике, објављена 24. септембра, пореди Jev са три јефтинија језичка модела. Медицински бенчмарк, објављен 27. септембра, пореди Jev 1.13 са GPT-6 Sol уз два подешавања резоновања. Сва три рада су препринти. Ниједан није студија клиничке примене нити је прошао стручну рецензију.
Близу у неким пресудама, слабији у резоновању
Први рад процењује 5.172 пресуде на паровима преференција, провери чињеничне тачности заснованој на доказима и проверама коначних одговора, а затим додаје накнадне тестове и две издвојене студије усмеравања. Главни јавни бенчмарк резултати за Jev износили су 92,5% на узорку од 1.500 парова преференција RewardBench-а, 78,6% на 350 парова ЈудгеБенцх-а и 87,3% на 3.000 HaluEval одговора проверених према доказима. На тим задацима најјачи упоредни модел GPT-6 Astra остварио је 92,5%, 93,1% и 88,4%. Рад наводи цену за Jev од 0,044 долара на 1.000 основних пресуда и медијалну латенцију од 0,15 секунди на панелу за мерење времена; GPT-6 Astra је у условима студије коштао 12,182 долара и имао латенцију 1,89 секунди.
Ови просеци прикривају границу коју су аутори утврдили. Jev је био удаљен око два поена од GPT-6 у квалитету ћаскања, безбедносним одбијањима и провери чињеничне тачности заснованој на доказима. Заостајао је на задацима који захтевају извођење или проверу резултата: 14,3 поена у математици и 12,9 у коду, уз разлику од 27,6 поена на логичким загонеткама. На скупу објективне тачности ЈудгеБенцх-а Jev је постигао 78,6%, наспрам 93,1% за GPT-6. У слепој процени спорних случајева из подскупа од 990 ставки, процењивачи су пресудили у корист GPT-6 за 57 од 69 спорних JudgeBench ставки, а у корист Jev-а за једну. Процена је била селективна и ограничена, али указује на то да разлика није била само последица ознака у бенчмарк-у.
Овде „судија“ значи избор између два генерисана одговора или одлуку о томе да ли је један одговор поткрепљен наведеном референцом или је тачан према њој. Аутори су генеративним судијама намерно дали исти ограничени формат пресуде и вероватноће као Jev-у, без образложења. Поређење се зато односи на пресуде под тим условима, а не на то који судија може човеку да објасни своје резоновање.
Усмеравање према поузданости функционише када се грешке разликују
Каскада користи јефтинијег првог судију и неке случајеве шаље скупљем резервном моделу. У првој студији правило је прихватало Jev-ову пресуду када је највећа вероватноћа ознаке била најмање 0,9, док је случајеве са мањом поузданошћу прослеђивало даље. На 1.610 издвојених парова преференција, каскада са два редоследа ескалирала је 31,5% случајева, остварила 93,4% наспрам 92,5% за GPT-6 и коштала 41% GPT-6 накнаде. У унапред одређеном тесту уживо са 570 издвојених парова из два нова задатка објективне тачности, сам Jev је заостао 14 поена за GPT-6; каскада је достигла исту тачност као GPT-6, ескалирала 74% случајева и уштедела око четвртину његове накнаде.
Тај резултат зависи од конкретног услова: случајеви у које Jev није сигуран морају да садрже грешке које резервни модел може да исправи. Аутори су утврдили да усмеравање према поузданости слабије ради на паровима са стилски осмишљеним замкама и да не успева на прози без референце, где су сви тестирани судије били близу насумичног успеха, али често самоуверени. Студија је такође утврдила да је просечно одлучивање у оба редоследа одговора смањило утицај позиције. Прагови су изабрани на основу локалних означених примера, а рад препоручује приступ са доњом границом поузданости и проверу на издвојеном скупу.
Одвојена студија о рубрици тестира оцењивање по критеријуму на девет панела из седам бенчмарк-а, укупно 5.003 пара ставка–критеријум. Два панела била су бинарна, а седам је користило уређене скале оцењивања. Сва четири судије добила су исти текст критеријума, а аутори су утврдили рубрике пре евалуације. У осам од 27 упарених поређења интервал поузданости од 95% искључивао је одсуство разлике; четири су остала таква и после корекције за вишеструка поређења. Нека друга поређења била су унутар границе еквивалентности коју је рад одредио, док су многа била превише непрецизна да би показала разлику или еквивалентност. Jev је у поређењу с другима био најбољи на бинарним критеријумима. На панелима са оценама по скали никада није био најбољи упоредиви судија, а сви судије су углавном давали ниже оцене од људских процењивача.
У том поставу уштеде у цени и времену биле су велике. Jev је за свих девет панела коштао око шест центи; три судије засноване на језичким моделима биле су 29 до 325 пута скупље и требало им је 30 до 220 пута више времена. Ипак, Jev-ова поузданост није омогућила добру каскаду. На већини панела поузданост је добро рангирала његове грешке, али су резервни модели поновили готово све Jev-ове најсамоувереније грешке. Уз прагове добијене унакрсним уклапањем, каскада је у просеку побољшала резултат за највише 1,5 процентних поена у односу на најбољег појединачног судију; на шест од девет панела била је лошија од њега. У овој поновној анализи коришћене су забележене пресуде, а не проспективна примена уживо.
Разлика између ова два рада је поучна. У поређењу одговора у паровима, прва студија је нашла корисну поделу између Jev-ових грешака са ниском поузданошћу и способности јачег резервног модела. Код оцењивања по критеријумима резервни модел је често правио исте грешке, па је прослеђивање додавало трошак уз мало исправки. Сам сигнал поузданости модела не говори тиму да ли ће се други модел продуктивно не сложити.
Медицински резултати питања са више понуђених одговора зависе од тежине задатка
Медицински рад процењује Jev на четири постојећа скупа података: 1.373 испитна питања MetaMedQA, 500 PubMedQA питања одговорених на основу истраживачких сажетака, 915 случајева са више понуђених одговора из DiagnosisArena и 34 NEJM Case Challenge случаја са објављеном коначном дијагнозом. Пореди Jev са GPT-6 Sol и уз средње резоновање и без њега. Забележено је 8.469 захтева моделима, а сваки је вратио исправан структурисани одговор.
На PubMedQA, Jev и GPT-6 Sol са средњим резоновањем постигли су 78,4% и 78,2%. На MetaMedQA Jev је постигао 74,8%, наспрам 82,7%; на DiagnosisArena 59,8% наспрам 82,4%; а на 34 NEJM случаја 61,8% наспрам 82,4%. GPT-6 без резоновања такође је имао више тачкасте процене на два тежа скупа случајева. Процена за 34 NEJM случаја је непрецизна, а главно поређење више није било статистички значајно након корекције за вишеструка поређења. Много већа разлика на DiagnosisArena задржала се и без експлицитног резоновања.
Ово је тест избора међу понуђеним опцијама, а не састављања диференцијалне дијагнозе или лечења пацијената. Рад не наводи да су клиничари процењивали референтне одговоре бенчмарк-а. Наводи да су модели NEJM слике добили у облику описа и да су тешки случајеви DiagnosisArena филтрирани другим језичким моделима. Аутори називају налазе прелиминарним и кажу да тек следе независно понављање, клиничка процена референтних одговора и провера стабилности између покретања. Рад изричито наводи да се резултати не користе за усмеравање клиничке неге.
Вредност прагова вероватноће била је неуједначена. На MetaMedQA је 52,9% Jev-ових избора имало поузданост од најмање 0,9, а 93,4% тих одговора било је тачно. При сличној покривености, GPT-6 је био једнако или више тачан. На DiagnosisArena је рангирање Jev-ових вероватноћа било слабо: при истом прагу од 0,9 прихваћено је само 17,3% ставки, а сваки четврти прихваћени одговор ипак је био погрешан. На сваком бенчмарк-у просечна вероватноћа модела за изабрану опцију премашила је његову тачност. У овом узорку висока оцена није значила извесност.
Шта тимови могу да закључе из студија
Заједно, радови подржавају тестирање Jev-а као евалуатора за одређени задатак, нарочито када се пресуда може прочитати из достављеног текста или проверити према доказима. Не подржавају третирање његовог поља поузданости као универзалног безбедносног прекидача. Резултати су се разликовали према задатку, а студија о рубрици показује зашто резервни модел треба проценити и према независности грешака, а не само према укупној тачности.
Тим који разматра овај образац треба да прикупи репрезентативан, означен узорак из свог задатка. Треба да дефинише шта је исправна одлука, укључи тешке и обмањујуће примере, упореди резултат са људском провером или другим одбрањивим репером, а затим измери и стопу грешака и колико добро поузданост раздваја тачне од нетачних одлука. Код каскаде треба бележити и да ли резервни модел заиста исправља грешке прве фазе, колико се случајева ескалира и колики су трошак и кашњење. Издвојени скуп за тестирање може да покаже да ли се праг преноси и на примере који нису коришћени за његов избор.
Ово су практичне последице студија, а не поступак који је BIG CHANGE тестирао. Нисмо позивали Jev API нити покретали локални бенчмарк. TypeSafe-ова API документација описује структурисане захтеве, дозвољене типове одговора и проналажење модела; она независно не потврђује тачност на задацима неког тима. Приступ производу, цене и модели могу да се промене, па тимови при планирању пробног коришћења треба да провере актуелну документацију.
За сада Jev делује као користан кандидат за првог судију када је задатак узак, ознаке јасне, а локална евалуација покаже да се грешке ефикасно усмеравају према поузданости. Када је за процену потребно дубље резоновање, оцењивање зависи од скривених конвенција процењивача или више модела прави исте грешке, студије дају разлог да се задрже људска провера или друга потврђена контрола.
Велика промена
Нове Jev-ове евалуације померају питање са тога да ли модел за одлучивање може јефтино да изнесе пресуду на то када је та пресуда довољно корисна да се задржи. Одговор зависи од задатка: усмеравање према поузданости побољшало је издвојену каскаду за упарену евалуацију, док је засебна студија о рубрици нашла малу корист због преклапања грешака. И медицински резултати на питањима са више понуђених одговора знатно су се разликовали са тежином задатка. Следећи корак за AI тимове је локални скуп за валидацију који заједно проверава тачност, поузданост и понашање резервног модела.
Извори и додатно читање
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure, Yubo Li, Yidi Miao, Ramayya Krishnan и Rema Padman, верзија 2 од 27. септембра 2026. Препринт који пореди Jev са 16 судија, укључујући слепу људску процену и тестове усмеравања према поузданости на издвојеним подацима.
- Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places, Delip Rao и Chris Callison-Burch, 24. септембар 2026. Препринт који процењује бинарно и степеновано оцењивање по критеријумима на девет бенчмарк панела.
- Jev in Medicine: A Benchmark Evaluation. Preliminary results., Алфредо Мадрид-Гарцíа и Беатриз Мерино-Барбанцхо, 27. септембар 2026. Прелиминарно поређење на четири медицинска скупа са питањима са више понуђених одговора; није клиничка студија.
- TypeSafe API документација, званична референца за Jev-ов структурисани интерфејс захтева и излаза. Документација описује понашање производа, а не независну евалуацију.



