SVET NE STOJI U MESTU.RSS
BIG CHANGE.

Markdown izdanje

AI-translated from English; not yet reviewed by a fluent editor.

# Rezultati AI sudije Jev razlikuju se prema zadatku i rezervnom modelu

> Tri preprinta testiraju Jev kao sudiju AI odgovora. Rezultati se razlikuju za zadatke poređenja odgovora, rubrike i medicinska pitanja, a usmeravanje prema pouzdanosti pomaže samo kada rezervni model ispravi Jevove greške.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tri nova preprinta na različite načine ispituju Jev kao evaluator. Jedan pokazuje da je blizu snažnom sudiji zasnovanom na jezičkom modelu pri poređenju odgovora i proveri činjenica potkrepljenih dokazima, a zatim koristi pouzdanost za usmeravanje neizvesnih slučajeva. Drugi nalazi malu korist od takvog usmeravanja pri ocenjivanju po rubrici, jer rezervni modeli često ponavljaju Jevove samouverene greške. Treći medicinski benchmark beleži sličnu tačnost na pitanjima zasnovanim na sažecima istraživanja i znatne razlike na težim dijagnostičkim slučajevima.

Praktičan zaključak uži je od tvrdnje „AI može da sudi AI-ju“. Jev može biti brz sudija za prvi prolaz kod jasno definisanog zadatka, ali dokazi ne potvrđuju da postoji jedan pouzdan sudija za svaku vrstu odgovora. Pouzdanost može da pomogne u usmeravanju rada tek pošto tim proveri šta model predviđa na sopstvenim primerima.

## Šta znači da model prosuđuje

Evaluator prima jedan ili više izlaza modela i, prema nekom pravilu, vraća ocenu ili zaključak. Sudija može da izabere koji od dva odgovora bolje prati upit, utvrdi da li tvrdnju potkrepljuju dostavljeni dokumenti, oceni odgovor prema rubrici ili izabere tačan odgovor u medicinskom pitanju sa više ponuđenih opcija. Ti zadaci postavljaju različite zahteve pred evaluator.

Jev je TypeSafe-ov hostovani model za donošenje odluka. Njegov API prima strukturisani ulaz i dozvoljenu vrstu odgovora, a zatim vraća izbor ili ocenu sa verovatnoćama za dozvoljene oznake. Interfejs omogućava da se zadatak uklopi u softver koji očekuje ograničen skup rezultata. Međutim, verovatnoća je procena modela; ona nezavisno ne proverava osnovni odgovor. TypeSafe-ova dokumentacija opisuje interfejs, dok istraživačka poređenja u nastavku procenjuju rezultate na konkretnim testovima.

Studija [JEV-as-a-Judge](https://arxiv.org/abs/2609.26550v2), revidirana 27. septembra, poredi Jev 1.13 sa 16 sudija zasnovanih na generativnim i reward modelima. Studija [rubric-judge](https://arxiv.org/abs/2609.29769v1), objavljena 24. septembra, poredi Jev sa tri jeftinija jezička modela. [medicinski benchmark](https://arxiv.org/abs/2609.34024v1), objavljen 27. septembra, poredi Jev 1.13 sa GPT-6 Sol uz dva podešavanja rezonovanja. Sva tri rada su preprinti. Nijedan nije studija kliničke primene niti je prošao stručnu recenziju.

## Blizu u nekim procenama, slabiji u rezonovanju

Prvi rad ocenjuje 5.172 procene iz parova preferencija, činjenične tačnosti zasnovane na dokazima i provera konačnih odgovora, a zatim dodaje naknadne testove i dve studije usmeravanja na izdvojenim podacima. Glavni javni benchmark rezultati za Jev bili su 92,5% na uzorku od 1.500 parova preferencija RewardBench-a, 78,6% na 350 parova JudgeBench-a i 87,3% na 3.000 odgovora HaluEval-a procenjenih prema dokazima. Na tim zadacima, najjači uporedni model GPT-6 Astra postigao je 92,5%, 93,1% i 88,4%. Rad navodi cenu od 0,044 dolara za 1.000 osnovnih procena i medijalno kašnjenje od 0,15 sekundi za Jev; GPT-6 Astra koštao je 12,182 dolara, uz 1,89 sekundi, u uslovima studije.

Ovi proseci prikrivaju granicu koju su autori utvrdili. Jev je bio udaljen oko dva poena od GPT-6 u kvalitetu razgovora, bezbednosnim odbijanjima i činjeničnoj tačnosti zasnovanoj na dokazima. Zaostao je u zadacima koji zahtevaju izvođenje ili proveru rezultata: 14,3 poena u matematici i 12,9 u programiranju, uz razliku od 27,6 poena u logičkim zagonetkama. Na skupu objektivne tačnosti JudgeBench-a, Jev je ostvario 78,6%, a GPT-6 93,1%. U slepoj adjudikaciji spornih slučajeva iz podskupa od 990 stavki, GPT-6 je ocenjen kao bolji u 57 od 69 spornih stavki JudgeBench-a, a Jev u jednoj. Adjudikacija je bila selektivna i ograničena, ali ukazuje na to da razlika nije samo posledica oznaka u benchmarku.

Ovde je „sudija“ značio biranje između dva generisana odgovora ili odlučivanje da li je jedan odgovor potkrepljen navedenim izvorom ili tačan prema njemu. Autori su generativnim sudijama namerno zadali isti ograničeni format izlaza sa zaključkom i verovatnoćom kao Jevu, bez obrazloženja. Zato poređenje meri zaključke u okviru tog ugovora, a ne to koji sudija ume čoveku da objasni svoje rezonovanje.

## Usmeravanje prema pouzdanosti funkcioniše kada se greške razlikuju

Kaskadni sistem koristi jeftinijeg sudiju u prvom prolazu, a neke slučajeve prosleđuje skupljem rezervnom modelu. U prvoj studiji, pravilo je prihvatalo Jevov zaključak kada je njegova najveća verovatnoća za neku oznaku iznosila najmanje 0,9, a slučajeve sa nižom pouzdanošću prosleđivalo dalje. Na 1.610 izdvojenih parova preferencija, kaskada sa dva redosleda prosledila je 31,5% slučajeva, ostvarila 93,4% u poređenju sa 92,5% za GPT-6 i koštala 41% GPT-6 cene. U unapred definisanom testu uživo na 570 izdvojenih parova iz dva nova zadatka provere tačnosti, sam Jev je zaostao 14 poena za GPT-6; kaskada je dostigla GPT-6 tačnost, prosledila 74% slučajeva i uštedela oko četvrtinu njegove cene.

Taj rezultat zavisi od konkretnog uslova: slučajevi u koje Jev nije siguran moraju sadržati greške koje rezervni model može da ispravi. Autori su utvrdili da je usmeravanje prema pouzdanosti slabije na parovima osmišljenim da prevare procenu stila i da ne uspeva kod proze bez referentnog izvora, gde su svi testirani sudije bili blizu slučajnog pogađanja, ali su često bili samouvereni. Studija je takođe pokazala da prosečavanje procena za oba redosleda odgovora smanjuje uticaj redosleda. Pragovi su birani pomoću lokalnih označenih primera, a rad preporučuje pristup zasnovan na donjoj granici pouzdanosti i proveru na izdvojenom skupu.

Odvojena studija rubrika ispituje ocenjivanje po kriterijumu na devet panela iz sedam benchmarka, ukupno 5.003 para stavki i kriterijuma. Dva panela koristila su binarne, a sedam uređene skale ocenjivanja. Sve četiri sudije dobile su isti tekst kriterijuma, a autori su utvrdili rubrike pre evaluacije. Za osam od 27 poređenja uparenih rezultata, interval pouzdanosti od 95% isključivao je nultu razliku u tačnosti; nakon korekcije za višestruka poređenja, ostala su četiri. Neka druga poređenja ispunila su granicu ekvivalentnosti iz rada, dok su mnoga bila previše neprecizna da bi se utvrdila razlika ili ekvivalentnost. Jev je u odnosu na ostale bio najbolji kod binarnih kriterijuma. Na panelima sa ocenama po skali nikada nije bio najbolja uporediva sudija, a sve sudije su imale tendenciju da daju niže ocene od ljudskih ocenjivača.

U tim uslovima uštede u ceni i vremenu bile su velike. Jev je koštao oko šest centi za svih devet panela; tri sudije zasnovane na jezičkim modelima koštale su 29 do 325 puta više i radile 30 do 220 puta duže. Ipak, Jevova pouzdanost nije omogućila snažnu kaskadu. Na većini panela pouzdanost je rangirala njegove greške, ali su rezervni modeli ponavljali skoro sve Jevove najsamouverenije greške. Uz unakrsno podešene pragove, kaskada je u proseku poboljšala rezultat za najviše 1,5 procentnih poena u odnosu na najboljeg pojedinačnog sudiju; na šest od devet panela bila je lošija od njega. Ova ponovljena analiza koristila je zabeležene procene, a ne prospektivnu primenu uživo.

Razlika između ova dva rada je poučna. U poređenju odgovora u parovima, prva studija je našla korisnu podelu između Jevovih grešaka sa niskom pouzdanošću i mogućnosti snažnijeg rezervnog modela. Pri ocenjivanju kriterijuma rezervni model je često pravio iste greške, pa je prosleđivanje povećalo cenu bez značajnijeg ispravljanja. Sam signal pouzdanosti modela ne govori timu da li će se drugi model produktivno ne slagati s njim.

## Rezultati medicinskih pitanja sa više ponuđenih odgovora zavise od težine zadatka

Medicinski rad procenjuje Jev na četiri postojeća skupa podataka: 1.373 ispitna pitanja MetaMedQA, 500 pitanja PubMedQA zasnovanih na sažecima istraživanja, 915 slučajeva sa ponuđenim odgovorima iz DiagnosisArena i 34 NEJM Case Challenges sa objavljenom konačnom dijagnozom. Rad poredi Jev sa GPT-6 Sol, i uz srednji nivo rezonovanja i bez rezonovanja. Modelima je poslato 8.469 zahteva, a svaki je vratio važeći strukturisani odgovor.

Na PubMedQA, Jev i GPT-6 Sol sa srednjim nivoom rezonovanja ostvarili su 78,4% i 78,2%. Na MetaMedQA, Jev je postigao 74,8%, a GPT-6 Sol 82,7%; na DiagnosisArena rezultat je bio 59,8% prema 82,4%, a na 34 slučaja NEJM-a 61,8% prema 82,4%. GPT-6 bez rezonovanja takođe je imao više tačkaste procene na dva teža skupa slučajeva. Procena na 34 NEJM slučaja nije precizna, a glavno poređenje nakon korekcije za višestruka poređenja više nije bilo statistički značajno. Znatno veća razlika za DiagnosisArena opstala je i bez eksplicitnog rezonovanja.

Ovo je test izbora između ponuđenih opcija, a ne formiranja diferencijalne dijagnoze ili lečenja pacijenata. Rad ne navodi adjudikaciju odgovora na benchmarku koju su sproveli kliničari. U njemu piše da su slike iz NEJM-a modelima prikazane kao tekstualni opisi i da su izazovni slučajevi iz DiagnosisArena filtrirani pomoću drugih jezičkih modela. Autori nazivaju nalaze preliminarnim i navode da još predstoje nezavisna replikacija, klinička adjudikacija referentnih odgovora i provere stabilnosti između pokretanja. U radu se izričito kaže da se rezultati ne koriste za usmeravanje kliničke nege.

Pragovi verovatnoće imali su neujednačenu vrednost. Na MetaMedQA, 52,9% Jevovih izbora imalo je pouzdanost od najmanje 0,9, a tačnost tih izbora bila je 93,4%. Pri sličnom obuhvatu, GPT-6 je bio jednako tačan ili tačniji. Na DiagnosisArena, Jevovo rangiranje po verovatnoći bilo je slabo: uz isti prag od 0,9 prihvaćeno je samo 17,3% stavki, a jedan od četiri prihvaćena odgovora i dalje je bio pogrešan. Na svakom benchmarku, prosečna verovatnoća koju su modeli dodelili izabranoj opciji bila je veća od njihove tačnosti. U ovom uzorku, visoka ocena nije značila izvesnost.

## Šta timovi mogu da zaključe iz studija

Zajedno, ovi radovi podržavaju testiranje Jeva kao evaluatora za konkretan zadatak, naročito kada se zaključak može pročitati iz dostavljenog teksta ili proveriti prema dokazima. Ne podržavaju tretiranje polja pouzdanosti kao univerzalnog bezbednosnog prekidača. Rezultati su se razlikovali među zadacima, a studija rubrika pokazuje zašto rezervni model treba procenjivati i prema nezavisnosti grešaka, a ne samo prema sirovoj tačnosti.

Timu koji razmatra ovakav pristup potreban je reprezentativan, označen uzorak iz sopstvenog zadatka. Treba da definiše šta se smatra tačnim zaključkom, uključi teške i obmanjujuće primere, uporedi rezultate sa ljudskom proverom ili drugim odbranjivim izvorom istine, a zatim izmeri i stopu grešaka i koliko dobro pouzdanost razlikuje tačne od netačnih procena. Kod kaskadnog sistema treba zabeležiti i da li rezervni model zaista ispravlja greške iz prvog prolaza, koliko se slučajeva prosleđuje i koliki su troškovi i kašnjenje. Izdvojeni testni skup može da pokaže da li prag važi i van primera korišćenih za njegovo podešavanje.

Ovo su praktične implikacije studija, a ne postupak koji je BIG CHANGE testirao. Nismo pozivali Jev API niti sprovodili lokalni benchmark. TypeSafe-ova [API dokumentacija](https://api.typesafe.ai/docs) opisuje strukturisane zahteve, dozvoljene vrste odgovora i pronalaženje modela; ona nezavisno ne utvrđuje tačnost na zadacima konkretnog tima. Dostupnost proizvoda, cene i modeli mogu da se promene, zato timovi treba da provere važeću dokumentaciju kada planiraju probu.

Za sada, Jev izgleda kao mogući prvi sudija kada je zadatak uzak, oznake jasne, a lokalna evaluacija pokaže da usmeravanje prema pouzdanosti efikasno razdvaja greške. Kada prosuđivanje zahteva dublje rezonovanje, ocenjivanje zavisi od skrivenih konvencija ocenjivača ili više modela pravi iste greške, ove studije daju timovima razlog da zadrže ljudsku proveru ili drugu validiranu kontrolu u toku rada.

## Suštinska promena

Nove evaluacije Jeva pomeraju pitanje sa toga da li model za odlučivanje može jeftino da vrati zaključak na to kada je taj zaključak dovoljno koristan da se zadrži. Odgovor zavisi od zadatka: usmeravanje prema pouzdanosti poboljšalo je kaskadu za poređenje parova na izdvojenim podacima, dok je odvojena studija rubrika našla malu korist zbog preklapanja grešaka. Rezultati medicinskih pitanja sa više ponuđenih odgovora takođe su se oštro razlikovali prema težini zadatka. Sledeći korak za AI timove je lokalni skup za validaciju koji istovremeno proverava tačnost, pouzdanost i ponašanje rezervnog modela.

## Izvori i dodatna literatura

- [JEV-as-a-Judge: Prihvati kada si siguran, eskaliraj kada nisi](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan i Rema Padman, verzija 2 od 27. septembra 2026. Preprint poredi Jev sa 16 sudija, uz slepu ljudsku adjudikaciju i testove usmeravanja prema pouzdanosti na izdvojenim podacima.
- [Jev u poređenju sa LLM-ovima kao sudija rubrika: jeftiniji, brži i greši na istim mestima](https://arxiv.org/abs/2609.29769v1), Delip Rao i Chris Callison-Burch, 24. septembar 2026. Preprint procenjuje binarno ocenjivanje i ocenjivanje po skali za svaki kriterijum na devet benchmark panela.
- [Jev u medicini: evaluacija benchmarka. Preliminarni rezultati.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García i Beatriz Merino-Barbancho, 27. septembar 2026. Preliminarno poređenje na četiri skupa medicinskih pitanja sa više ponuđenih odgovora; nije klinička studija.
- [TypeSafe API dokumentacija](https://api.typesafe.ai/docs), zvanična referenca za Jevov interfejs strukturisanih zahteva i izlaza. Dokumentacija opisuje ponašanje proizvoda, a ne nezavisnu procenu.

## Sources

- [JEV-as-a-Judge: Prihvati kada si siguran, eskaliraj kada nisi (v2)](https://arxiv.org/abs/2609.26550v2) — Glavni preprint, predat 22. septembra i revidiran 27. septembra. Poredi Jev 1.13 sa 16 sudija u zadacima poređenja preferencija, činjenične tačnosti zasnovane na dokazima i konačnih odgovora; obuhvata selektivnu slepu adjudikaciju, zamrznute vanmrežne analize kaskada i dva unapred određena testa uživo na izdvojenim zadacima. Nije prošao stručnu recenziju niti je studija primene; ograničenja u vezi sa izjednačavanjem računarskih resursa, selektivnom adjudikacijom, širinom zadataka, cenom i vremenom zabeležena su u dokumentu SOURCE-AUDIT.md.
- [Jev u poređenju sa LLM-ovima kao sudija rubrika: jeftiniji, brži i greši na istim mestima (v1)](https://arxiv.org/abs/2609.29769v1) — Glavni preprint poredi Jev sa tri LLM-a flash klase na devet benchmark panela i 5.003 para stavki i kriterijuma. Korišćeni su isti tekstovi kriterijuma; dva panela bila su binarna, a sedam sa ocenama po skali. Prikazuje korelisane samouverene greške i uglavnom ponovnu analizu usmeravanja. Nije prošao stručnu recenziju; mnoga poređenja nisu statistički zaključna, a nalazi su ograničeni izabranim rubrikama, panelima i uslovima pružanja usluge.
- [Jev u medicini: evaluacija benchmarka. Preliminarni rezultati. (v1)](https://arxiv.org/abs/2609.34024v1) — Glavni preliminarni preprint testira Jev 1.13 u poređenju sa GPT-6 Sol na četiri medicinska benchmarka sa više ponuđenih odgovora. Obuhvata tačnost, kalibraciju i selektivno predviđanje, uzdržavanje od odgovora, kašnjenje i cenu. Nema kliničke primene ni adjudikacije kliničara; autori navode da se čekaju nezavisna replikacija i provera rezultata i savetuju da se nalazi ne koriste za kliničku negu.
- [TypeSafe API dokumentacija](https://api.typesafe.ai/docs) — Zvanična OpenAPI dokumentacija pregledana 29. septembra 2026. prikazuje šeme strukturisanih zahteva i odgovora, krajnju tačku system-one i pronalaženje modela. Podržava samo opis interfejsa, a ne tvrdnje o nezavisnim rezultatima. Dostupnost proizvoda i cene mogu se promeniti.
- [Instagram Reel Dd3wdNKxg5J koji je prosledio vlasnik zadatka](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Samo trag za zadatak: Reel nije bilo moguće preuzeti niti transkribovati. Opis i metapodaci nisu korišćeni kao dokazi; nijedna tvrdnja nije pripisana sadržaju snimka.