Drei neue Preprints testen Jev auf unterschiedliche Weise als Evaluator. Einer kommt zu dem Ergebnis, dass Jev bei Antwortpräferenzen und evidenzgestützten Faktenprüfungen einem starken Sprachmodell-Richter nahekommt, und leitet anschließend unsichere Fälle anhand der Konfidenz weiter. Eine zweite Studie findet bei bewerteten Rubriken kaum Nutzen durch diese Weiterleitung, weil die Fallback-Modelle Jevs selbstsichere Fehler häufig wiederholen. Ein dritter medizinischer Benchmark berichtet von ähnlicher Genauigkeit bei Fragen zu Forschungsabstracts und deutlichen Abständen bei schwierigeren Diagnosefällen.
Die praktische Schlussfolgerung ist enger gefasst als „KI kann KI beurteilen“. Jev kann für eine klar definierte Aufgabe als schneller erster Prüfer geeignet sein. Die Belege weisen jedoch keinen verlässlichen Richter für jede Art von Antwort nach. Eine Weiterleitung anhand der Konfidenz hilft nur, wenn ein Team zuvor an eigenen Beispielen geprüft hat, was sie vorhersagt.
Was es bedeutet, ein Modell als Richter einzusetzen
Ein Evaluator erhält eine oder mehrere Modellausgaben und gibt nach einer bestimmten Regel einen Wert oder ein Urteil zurück. Ein Richter kann auswählen, welche von zwei Antworten einer Aufforderung besser folgt, feststellen, ob eine Behauptung durch bereitgestellte Dokumente belegt ist, eine Antwort anhand einer Rubrik bewerten oder bei einem medizinischen Multiple-Choice-Fall die richtige Option auswählen. Diese Aufgaben stellen unterschiedliche Anforderungen an den Evaluator.
Jev ist das gehostete Entscheidungsmodell von TypeSafe. Seine API akzeptiert strukturierte Eingaben und einen zulässigen Antworttyp und gibt dann eine Auswahl oder einen Wert mit Wahrscheinlichkeiten für die erlaubten Kennzeichnungen zurück. Die Schnittstelle kann eine Aufgabe in Software integrieren, die ein begrenztes Ergebnis erwartet. Eine Wahrscheinlichkeit ist jedoch eine Modellschätzung; sie überprüft die zugrunde liegende Antwort nicht unabhängig. Die Dokumentation von TypeSafe beschreibt die Schnittstelle; die folgenden Forschungsarbeiten bewerten die Leistung anhand bestimmter Testsätze.
Die Studie JEV-as-a-Judge, überarbeitet am 27. September, vergleicht Jev 1.13 mit 16 generativen Richtern und Reward-Modell-Richtern. Die Studie zu Rubrik-Richtern, veröffentlicht am 24. September, vergleicht Jev mit drei kostengünstigeren Sprachmodellen. Der medizinische Benchmark, veröffentlicht am 27. September, vergleicht Jev 1.13 mit GPT-6 Sol in zwei Reasoning-Einstellungen. Alle drei Arbeiten sind Preprints. Keine ist eine Studie zum klinischen Einsatz, und keine wurde begutachtet.
Bei manchen Urteilen nah dran, beim Schlussfolgern schwächer
Die erste Arbeit wertet 5.172 Urteile zu Präferenzpaaren, evidenzgestützter Faktentreue und Prüfungen von Endantworten aus und ergänzt anschließend Folgetests sowie zwei zurückgehaltene Weiterleitungstests. Jevs wichtigste Ergebnisse im öffentlich verfügbaren Benchmark lagen bei 92,5 Prozent für eine Stichprobe von 1.500 RewardBench-Präferenzpaaren, 78,6 Prozent für 350 JudgeBench-Paare und 87,3 Prozent für 3.000 anhand von Belegen geprüfte HaluEval-Antworten. Bei diesen Aufgaben erzielte der stärkste Vergleich, GPT-6 Astra, jeweils 92,5, 93,1 und 88,4 Prozent. Laut dem Kostenvergleich der Studie kostete Jev 0,044 US-Dollar pro 1.000 Basisurteile; die mediane Latenz lag bei 0,15 Sekunden. Für GPT-6 Astra wurden unter den Bedingungen der Studie 12,182 US-Dollar und 1,89 Sekunden ausgewiesen.
Diese Durchschnittswerte verdecken die von den Autoren festgestellte Grenze. Bei Chatqualität, Sicherheitsverweigerungen und evidenzgestützter Faktentreue lag Jev höchstens rund zwei Prozentpunkte hinter GPT-6. Bei Aufgaben, die das Herleiten oder Überprüfen eines Ergebnisses erforderten, fiel Jev zurück: um 14,3 Punkte bei Mathematik und 12,9 bei Programmieraufgaben; bei Logikrätseln betrug der Abstand 27,6 Punkte. Im JudgeBench-Test zur objektiven Richtigkeit erzielte Jev 78,6 Prozent gegenüber 93,1 Prozent für GPT-6. Bei einer verblindeten Beurteilung strittiger Fälle aus einer Teilstichprobe von 990 Aufgaben sprachen sich die Prüfer bei 57 von 69 umstrittenen JudgeBench-Fällen für GPT-6 und bei einem für Jev aus. Die Beurteilung war selektiv und begrenzt, deutet aber darauf hin, dass der Abstand nicht allein an den Benchmark-Kennzeichnungen lag.
Mit „Richter“ war hier gemeint, zwischen zwei generierten Antworten auszuwählen oder anhand einer angegebenen Referenz zu beurteilen, ob eine einzelne Antwort belegt oder richtig war. Die Autoren gaben den generativen Richtern bewusst dasselbe eingeschränkte Ausgabeformat für Urteil und Wahrscheinlichkeit wie Jev vor und verlangten keine Begründungen. Der Vergleich bezieht sich daher auf Urteile unter diesen Vorgaben, nicht darauf, welcher Richter einem Menschen sein Schlussfolgern erklären kann.
Weiterleitung anhand der Konfidenz hilft, wenn sich Fehler unterscheiden
Eine Kaskade nutzt zunächst einen günstigeren Richter und leitet ausgewählte Fälle an ein teureres Fallback-Modell weiter. In der ersten Studie akzeptierte die Regel Jevs Urteil, wenn die höchste Wahrscheinlichkeit einer Kennzeichnung mindestens 0,9 betrug; Fälle mit niedrigerer Konfidenz wurden weitergeleitet. Bei 1.610 zurückgehaltenen Präferenzpaaren leitete die Kaskade mit zwei möglichen Reihenfolgen 31,5 Prozent der Fälle weiter, erzielte 93,4 Prozent gegenüber 92,5 Prozent für GPT-6 und kostete 41 Prozent von GPT-6s Gebühr. Bei einem vorab festgelegten Praxistest mit 570 zurückgehaltenen Paaren aus zwei neuen Aufgabenbereichen zur Richtigkeitsprüfung lag Jev allein 14 Punkte hinter GPT-6; die Kaskade erreichte dieselbe Genauigkeit wie GPT-6, leitete 74 Prozent weiter und sparte rund ein Viertel der Gebühr.
Dieses Ergebnis setzt voraus, dass die Fälle, bei denen Jev unsicher ist, Fehler enthalten, die das Fallback korrigieren kann. Die Autoren stellten fest, dass die Weiterleitung anhand der Konfidenz bei stilistisch adversarialen Paaren schwächer wurde und bei Prosa ohne Referenz scheiterte. Dort lagen alle getesteten Richter nahe an Zufallsergebnissen, traten aber häufig selbstsicher auf. Die Studie ergab außerdem, dass die Mittelung der Entscheidungen in beiden Reihenfolgen der Antworten Positionseffekte verringerte. Schwellenwerte wurden anhand lokaler gekennzeichneter Beispiele festgelegt; die Arbeit empfiehlt einen Ansatz mit unterer Konfidenzgrenze und eine Prüfung an zurückgehaltenen Daten.
Die separate Rubrik-Studie testet Bewertungen für einzelne Kriterien auf neun Panels aus sieben Benchmarks, insgesamt 5.003 Kombinationen aus Aufgabe und Kriterium. Zwei Panels waren binär; sieben verwendeten abgestufte Bewertungsskalen. Alle vier Richter erhielten denselben Kriterientext, und die Autoren legten die Rubriken vor der Auswertung fest. Bei acht von 27 paarweisen Vergleichen zeigte das 95-Prozent-Konfidenzintervall einen Genauigkeitsunterschied an; nach Korrektur für Mehrfachvergleiche blieben vier übrig. Einige weitere Vergleiche lagen innerhalb der Äquivalenzspanne der Studie, während viele zu ungenau waren, um entweder einen Unterschied oder Gleichwertigkeit nachzuweisen. Jev schnitt im Verhältnis zu den anderen bei binären Kriterien am besten ab. Bei Panels mit abgestuften Bewertungen war Jev nie der beste Vergleichsrichter, und alle Richter vergaben tendenziell niedrigere Werte als menschliche Bewerter.
In diesem Versuchsaufbau waren die Einsparungen bei Preis und Geschwindigkeit groß. Jev kostete für alle neun Panels etwa sechs Cent; die drei Sprachmodell-Richter waren 29- bis 325-mal teurer und benötigten 30- bis 220-mal so lange. Jevs Konfidenz ergab jedoch keine starke Kaskade. Auf den meisten Panels ordnete die Konfidenz seine Fehler zwar ein, doch die Fallback-Modelle wiederholten fast alle selbstsicheren Fehler von Jev. Mit kreuzvalidierten Schwellenwerten verbesserte eine Kaskade die Genauigkeit im Schnitt um höchstens 1,5 Prozentpunkte gegenüber dem besten Einzelrichter; auf sechs von neun Panels schnitt sie schlechter ab als dieser. In dieser erneuten Auswertung wurden aufgezeichnete Urteile wiederverwendet, statt einen künftigen Live-Einsatz zu testen.
Der Gegensatz zwischen den beiden Arbeiten ist aufschlussreich. Bei paarweisen Antwortvergleichen fand die erste Studie eine nützliche Aufteilung zwischen Jevs Fehlern mit niedriger Konfidenz und den Fähigkeiten eines stärkeren Fallback-Modells. Bei der Bewertung nach Kriterien machte das Fallback häufig dieselben Fehler; die Weiterleitung verursachte daher zusätzliche Kosten, ohne viele davon zu korrigieren. Das Konfidenzsignal des Modells allein zeigt einem Team nicht, ob ein anderes Modell sinnvoll abweichende Urteile liefern wird.
Ergebnisse bei medizinischen Multiple-Choice-Fragen hängen vom Schwierigkeitsgrad ab
Die medizinische Arbeit bewertet Jev anhand von vier bestehenden Datensätzen: 1.373 Prüfungsfragen aus MetaMedQA, 500 PubMedQA-Fragen, die anhand von Forschungsabstracts beantwortet wurden, 915 Multiple-Choice-Fälle aus DiagnosisArena und 34 NEJM Case Challenges mit veröffentlichter Enddiagnose. Verglichen wurde Jev mit GPT-6 Sol mit mittlerem Reasoning und ohne Reasoning. Insgesamt wurden 8.469 Modellanfragen gestellt, und jede Anfrage lieferte eine gültige strukturierte Antwort.
Bei PubMedQA erzielten Jev und GPT-6 Sol mit mittlerem Reasoning 78,4 beziehungsweise 78,2 Prozent. Bei MetaMedQA erreichte Jev 74,8 Prozent gegenüber 82,7; bei DiagnosisArena 59,8 gegenüber 82,4 und bei den 34 NEJM-Fällen 61,8 gegenüber 82,4 Prozent. Auch GPT-6 ohne Reasoning hatte bei den beiden schwierigeren Fallsammlungen höhere Punktschätzungen. Die Schätzung für die 34 NEJM-Fälle ist ungenau; der Hauptvergleich blieb nach Korrektur für Mehrfachvergleiche nicht statistisch signifikant. Der deutlich größere Abstand bei DiagnosisArena blieb auch ohne explizites Reasoning bestehen.
Hier wurde aus vorgegebenen Antwortmöglichkeiten ausgewählt; es ging weder darum, eine Differenzialdiagnose zu erstellen, noch Patienten zu behandeln. Die Arbeit berichtet von keiner klinischen Beurteilung der Benchmark-Antworten durch Ärzte. Den Autoren zufolge wurden die NEJM-Bilder den Modellen als Bildunterschriften vorgelegt, und die schwierigen DiagnosisArena-Fälle wurden anhand anderer Sprachmodelle gefiltert. Die Autoren bezeichnen die Ergebnisse als vorläufig und erklären, dass eine unabhängige Replikation, eine klinische Beurteilung der Referenzantworten und Prüfungen der Stabilität zwischen Durchläufen noch ausstehen. Die Arbeit rät ausdrücklich davon ab, die Ergebnisse zur Steuerung der klinischen Versorgung zu verwenden.
Wahrscheinlichkeitsschwellen hatten einen uneinheitlichen Nutzen. Bei MetaMedQA lag die Konfidenz für 52,9 Prozent von Jevs Antworten bei mindestens 0,9; diese Antworten waren zu 93,4 Prozent korrekt. Bei einer ähnlichen Abdeckung war GPT-6 genauso genau oder genauer. Bei DiagnosisArena war Jevs Wahrscheinlichkeitsrangfolge schwach: Mit derselben Schwelle von 0,9 wurden nur 17,3 Prozent der Aufgaben angenommen, und jede vierte angenommene Antwort war dennoch falsch. In jedem Benchmark lag die durchschnittliche Wahrscheinlichkeit der ausgewählten Option über der Genauigkeit. In dieser Stichprobe bedeutete ein hoher Wert keine Gewissheit.
Was Teams aus den Studien mitnehmen können
Zusammengenommen sprechen die Arbeiten dafür, Jev als aufgabenspezifischen Evaluator zu testen, insbesondere wenn sich ein Urteil aus bereitgestelltem Text ableiten oder anhand von Belegen überprüfen lässt. Sie rechtfertigen nicht, das Konfidenzfeld als universellen Sicherheitsschalter zu behandeln. Die Ergebnisse unterschieden sich je nach Aufgabenbereich; die Rubrik-Studie zeigt, warum ein Fallback-Modell auch hinsichtlich der Unabhängigkeit seiner Fehler und nicht nur seiner Rohgenauigkeit bewertet werden muss.
Ein Team, das dieses Muster erwägt, braucht eine repräsentative, gekennzeichnete Stichprobe aus den eigenen Aufgaben. Es sollte festlegen, was als richtiges Urteil gilt, schwierige und irreführende Beispiele einbeziehen, den Vergleich mit menschlicher Prüfung oder einer anderen vertretbaren Referenz durchführen und anschließend sowohl Fehlerraten als auch die Trennschärfe der Konfidenz zwischen richtigen und falschen Urteilen messen. Für eine Kaskade sollte es außerdem festhalten, ob das Fallback die Fehler der ersten Stufe tatsächlich behebt, wie viele Fälle weitergeleitet werden und welche Kosten und Verzögerungen entstehen. Ein zurückgehaltener Testsatz kann zeigen, ob der Schwellenwert auch außerhalb der zu seiner Auswahl genutzten Beispiele funktioniert.
Dies sind praktische Schlussfolgerungen aus den Studien, kein von BIG CHANGE getestetes Verfahren. Wir haben die Jev-API nicht aufgerufen und keinen lokalen Benchmark ausgeführt. Die API-Dokumentation von TypeSafe beschreibt strukturierte Anfragen, zulässige Antworttypen und die Modellsuche; sie belegt nicht unabhängig die Genauigkeit bei den Aufgaben eines Teams. Produktzugang, Preise und Modelle können sich ändern. Teams sollten deshalb für die Planung eines Tests die aktuelle Dokumentation prüfen.
Derzeit erscheint Jev als möglicher erster Richter sinnvoll, wenn eine Aufgabe eng umrissen ist, die Kennzeichnungen klar sind und eine lokale Auswertung zeigt, dass die Konfidenz Fehler wirksam weiterleitet. Wenn ein Urteil tiefes Schlussfolgern erfordert, Bewertungen von nicht offengelegten Maßstäben der Bewerter abhängen oder mehrere Modelle dieselben Fehler machen, sprechen die Studien dafür, menschliche Prüfung oder eine andere validierte Kontrolle beizubehalten.
Die große Änderung
Jevs neue Auswertungen verschieben die Frage: Nicht mehr nur, ob ein Entscheidungsmodell günstig ein Urteil abgeben kann, sondern wann dieses Urteil nützlich genug ist, um es zu übernehmen. Die Antwort hängt von der Aufgabe ab: Eine Weiterleitung nach Konfidenz verbesserte eine zurückgehaltene Kaskade für paarweise Evaluierungen; eine separate Rubrik-Studie fand dagegen kaum Zugewinne, weil sich die Fehler überschnitten. Auch bei medizinischen Multiple-Choice-Fragen unterschieden sich die Ergebnisse je nach Schwierigkeit deutlich. Für KI-Teams besteht der nächste Schritt darin, einen lokalen Validierungssatz zu erstellen, der Richtigkeit, Konfidenz und Verhalten des Fallbacks gemeinsam prüft.
Quellen und weiterführende Informationen
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure, Yubo Li, Yidi Miao, Ramayya Krishnan und Rema Padman, Version 2 vom 27. September 2026. Preprint mit einem Vergleich von Jev und 16 Richtern, einschließlich verblindeter menschlicher Beurteilung und zurückgehaltener Tests zur Weiterleitung anhand der Konfidenz.
- Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places, Delip Rao und Chris Callison-Burch, 24. September 2026. Preprint zur Bewertung binärer und abgestufter Rubrikurteile pro Kriterium auf neun Benchmark-Panels.
- Jev in Medicine: A Benchmark Evaluation. Preliminary results., Alfredo Madrid-García und Beatriz Merino-Barbancho, 27. September 2026. Vorläufiger Benchmark-Vergleich anhand von vier medizinischen Multiple-Choice-Datensätzen; keine klinische Studie.
- TypeSafe-API-Dokumentation, offizielle Referenz für Jevs strukturierte Anfrage- und Ausgabeschnittstelle. Die Dokumentation beschreibt das Produktverhalten, keine unabhängige Auswertung.



