МИР НЕ СТОИТ НА МЕСТЕ.RSS
BIG CHANGE.

Версия Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Результаты Jev в роли ИИ-судьи зависят от задачи и резервной модели

> В трех препринтах Jev оценивается как судья ответов ИИ. Результаты различаются в задачах на сравнение предпочтений, оценивание по рубрикам и медицину; маршрутизация по уверенности помогает только тогда, когда резервная модель исправляет ошибки Jev.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

В трех новых препринтах Jev оценивается по-разному. В одном исследовании он почти не уступает сильной языковой модели в выборе предпочтительного ответа и проверке фактов по источникам, после чего авторы используют показатель уверенности для маршрутизации сомнительных случаев. Во втором исследовании такая маршрутизация почти не помогает при оценивании по рубрикам, поскольку резервные модели часто повторяют уверенные ошибки Jev. В третьем медицинском бенчмарке точность на вопросах по научным аннотациям оказалась сопоставимой, а на более сложных диагностических случаях обнаружились значительные разрывы.

Практический вывод уже, чем утверждение «ИИ может оценивать ИИ». Jev может быть быстрым предварительным судьей для четко определенной задачи, но имеющиеся данные не подтверждают существование одного надежного судьи для ответов любого типа. Маршрутизация по уверенности помогает только после того, как команда проверит ее прогнозы на собственных примерах.

## Что значит, что модель выступает судьей

Оценщик получает один или несколько ответов модели и выдает оценку или вердикт по заданному правилу. Например, судья может выбрать, какой из двух ответов лучше следует запросу, определить, подтверждается ли утверждение предоставленными документами, оценить ответ по рубрике или выбрать правильный вариант медицинского теста. Для каждого из этих заданий оценщику нужны разные способности.

Jev — размещенная в облаке модель принятия решений компании TypeSafe. Ее API принимает структурированный ввод и допустимый тип ответа, а затем возвращает выбор или оценку с вероятностями для разрешенных меток. Такой интерфейс позволяет встроить задачу в программное обеспечение, которому нужен результат из ограниченного набора вариантов. Однако вероятность — это оценка самой модели, а не независимая проверка исходного ответа. Документация TypeSafe описывает интерфейс, тогда как приведенные ниже исследования сравнивают качество на конкретных тестовых наборах.

Исследование [JEV-as-a-Judge](https://arxiv.org/abs/2609.26550v2), обновленное 27 сентября, сравнивает Jev 1.13 с 16 судьями на основе генеративных моделей и моделей вознаграждения. В [исследовании судей по рубрикам](https://arxiv.org/abs/2609.29769v1), опубликованном 24 сентября, Jev сравнивается с тремя недорогими языковыми моделями. В [медицинском бенчмарке](https://arxiv.org/abs/2609.34024v1), опубликованном 27 сентября, Jev 1.13 сравнивается с GPT-6 Sol в двух режимах рассуждения. Все три работы — препринты. Ни одна не является исследованием клинического применения или не проходила рецензирование.

## Близкие результаты в некоторых задачах, слабее в рассуждениях

В первой статье оцениваются 5 172 вердикта для парных сравнений предпочтений, проверки фактов с опорой на источники и проверки итоговых ответов; затем следуют дополнительные тесты и два отложенных исследования маршрутизации. Основные опубликованные результаты Jev составили 92,5% на выборке из 1 500 пар предпочтений RewardBench, 78,6% на 350 парах JudgeBench и 87,3% на 3 000 ответах HaluEval, проверенных по источникам. В тех же заданиях самый сильный сопоставляемый вариант GPT-6 Astra набрал соответственно 92,5%, 93,1% и 88,4%. По расчетам авторов, Jev стоил 0,044 доллара за 1 000 базовых оценок, а медианная задержка на их временной диаграмме составляла 0,15 секунды; для GPT-6 Astra в условиях исследования указаны 12,182 доллара и 1,89 секунды.

За средними показателями скрывается выявленная авторами граница. В оценке качества диалога, отказов по безопасности и проверке фактов с опорой на источники Jev отставал от GPT-6 примерно не более чем на два процентных пункта. Он заметнее уступал в заданиях, где нужно было получить или проверить результат: на 14,3 пункта в математике и на 12,9 в программировании; разрыв в логических задачах составил 27,6 пункта. В наборе JudgeBench для объективной проверки правильности Jev набрал 78,6% против 93,1% у GPT-6. При слепой оценке спорных случаев в подвыборке из 990 заданий GPT-6 признали правым в 57 из 69 спорных заданий JudgeBench, а Jev — в одном. Такая оценка охватывала лишь выборочные случаи и была ограниченной, но дает основания считать, что разрыв объясняется не только метками бенчмарка.

Здесь под «судьей» подразумевается выбор между двумя сгенерированными ответами или проверка того, подтверждается ли единственный ответ указанным эталоном либо является ли он правильным. Авторы намеренно ограничили для генеративных судей формат вывода теми же вердиктами и вероятностями, что и для Jev, не запрашивая обоснования. Поэтому сравниваются вердикты в рамках этого контракта, а не способность судей объяснить человеку свои рассуждения.

## Маршрутизация по уверенности работает, когда ошибки различаются

Каскад использует сначала более дешевого судью, а часть случаев передает более дорогой резервной модели. В первом исследовании каскад принимал вердикт Jev, если вероятность наиболее вероятной метки была не ниже 0,9, а случаи с меньшей уверенностью передавал дальше. На 1 610 отложенных парах предпочтений каскад с проверкой в обоих порядках ответов передавал дальше 31,5% случаев, набрал 93,4% против 92,5% у GPT-6 и стоил 41% от его цены. В заранее запланированном реальном тесте на 570 отложенных парах из двух новых задач на проверку правильности Jev без каскада уступал GPT-6 на 14 пунктов; каскад сравнялся с GPT-6 по точности, передавал дальше 74% случаев и сокращал расходы примерно на четверть.

Этот результат возможен лишь при определенном условии: в неуверенных случаях Jev должны быть ошибки, которые резервная модель способна исправить. Авторы обнаружили, что маршрутизация по уверенности давала меньше пользы на парах, специально подобранных для обмана стилистическими приемами, и не работала для прозы без эталонного ответа: все проверенные судьи там показывали результаты около случайного уровня, но часто выдавали уверенные ответы. В исследовании также выяснилось, что учет вердиктов в обоих порядках ответов снижал эффект позиции. Пороги выбирали на собственных размеченных примерах; авторы рекомендуют использовать нижнюю границу доверительного интервала и проверять результат на отложенной выборке.

В отдельном исследовании оценивание по рубрикам проверяется на девяти наборах из семи бенчмарков — всего 5 003 пары «пример — критерий». Два набора использовали бинарную оценку, семь — упорядоченные рейтинговые шкалы. Все четыре судьи получали один и тот же текст критериев, а авторы зафиксировали рубрики до начала оценки. В 8 из 27 парных сравнений 95-процентный доверительный интервал исключал отсутствие разницы; после поправки на множественные сравнения таких сравнений осталось четыре. Некоторые другие результаты укладывались в заданную авторами границу эквивалентности, а для многих точности не хватало, чтобы установить наличие разницы или эквивалентность. Относительно остальных моделей Jev лучше всего показал себя на бинарных критериях. На наборах с рейтинговыми шкалами он ни разу не стал лучшим сопоставляемым судьей; все судьи обычно выставляли более низкие оценки, чем люди.

В этих условиях экономия денег и времени была большой. Оценка Jev всех девяти наборов стоила около шести центов; три языковые модели обходились в 29–325 раз дороже и работали в 30–220 раз дольше. Однако уверенность Jev не обеспечила эффективный каскад. На большинстве наборов она помогала ранжировать его ошибки, но резервные модели повторяли почти все самые уверенные ошибки Jev. При порогах, выбранных методом перекрестной подгонки, средняя точность каскада превышала результат лучшего отдельного судьи не более чем на 1,5 процентного пункта; на шести из девяти наборов каскад уступал ему. В этом повторном анализе использовались записанные вердикты, а не перспективное испытание в реальном процессе.

Сопоставление этих двух статей показательно. В попарном сравнении ответов первое исследование выявило полезное разделение: Jev ошибался при низкой уверенности там, где более сильная резервная модель могла исправить его результат. При оценке по критериям резервная модель часто допускала те же ошибки, поэтому передача случаев дальше увеличивала затраты, но мало помогала их исправлять. Одного сигнала уверенности недостаточно, чтобы понять, даст ли другая модель полезно отличающийся ответ.

## Результаты медицинских тестов зависят от сложности задачи

В медицинской статье Jev оценивается на четырех существующих наборах данных: 1 373 экзаменационных вопросах MetaMedQA, 500 вопросах PubMedQA, на которые отвечают по научным аннотациям, 915 тестовых диагностических случаях DiagnosisArena и 34 клинических задачах NEJM Case Challenges с опубликованным итоговым диагнозом. Jev сравнивали с GPT-6 Sol как в режиме среднего уровня рассуждения, так и без рассуждения. Было выполнено 8 469 запросов к моделям, каждый из которых вернул допустимый структурированный ответ.

В PubMedQA Jev и GPT-6 Sol с рассуждением среднего уровня набрали 78,4% и 78,2%. В MetaMedQA результат Jev составил 74,8% против 82,7%; в DiagnosisArena — 59,8% против 82,4%; на 34 случаях NEJM — 61,8% против 82,4%. У GPT-6 без рассуждения также были выше точечные оценки на двух более сложных наборах случаев. Оценка для 34 случаев NEJM неточна, а основное сравнение перестало быть статистически значимым после поправки на множественные сравнения. Гораздо больший разрыв в DiagnosisArena сохранился и без явного режима рассуждения.

Это тест выбора среди предложенных вариантов, а не постановки дифференциального диагноза или лечения пациентов. В статье не сообщается о проверке правильности ответов бенчмарка клиницистами. Авторы отмечают, что изображения NEJM предоставлялись моделям в виде подписей, а сложные случаи DiagnosisArena отбирались с помощью других языковых моделей. Авторы считают результаты предварительными и указывают, что независимое воспроизведение, клиническая проверка эталонных ответов и проверка стабильности между запусками еще не проведены. В статье прямо сказано, что результаты нельзя использовать для принятия клинических решений.

Пороговые значения вероятности приносили неодинаковую пользу. В MetaMedQA уверенность Jev в 52,9% ответов была не ниже 0,9; точность этих ответов составляла 93,4%. При сопоставимом охвате GPT-6 показывал такую же или более высокую точность. В DiagnosisArena ранжирование вероятностей Jev было слабым: при том же пороге 0,9 принимались лишь 17,3% заданий, и каждый четвертый принятый ответ был неверным. Во всех бенчмарках средняя вероятность выбранного моделью варианта превышала ее точность. В этой выборке высокий показатель не означал уверенности.

## Что команды могут взять из этих исследований

В совокупности статьи обосновывают проверку Jev как оценщика для конкретной задачи, особенно если вердикт можно вывести из предоставленного текста или сверить с источниками. Они не подтверждают, что поле уверенности — универсальный механизм безопасности. Результаты различались в зависимости от задачи, а исследование рубрик показывает, почему резервную модель нужно оценивать не только по общей точности, но и по независимости ее ошибок.

Команде, рассматривающей такой подход, нужна репрезентативная размеченная выборка собственных задач. Следует определить, что считается правильным решением, добавить сложные и вводящие в заблуждение примеры, сравнить результаты с проверкой человеком или другим обоснованным эталоном, а затем измерить частоту ошибок и то, насколько хорошо уверенность отличает правильные решения от ошибочных. Для каскада также нужно фиксировать, исправляет ли резервная модель ошибки первого этапа, сколько случаев передается дальше и каковы итоговые затраты и задержка. Отложенная тестовая выборка покажет, применим ли выбранный порог за пределами примеров, использованных для его настройки.

Это практические выводы из исследований, а не проверенная процедура BIG CHANGE. Мы не обращались к API Jev и не запускали локальный бенчмарк. В [документации API TypeSafe](https://api.typesafe.ai/docs) описаны структурированные запросы, допустимые типы ответов и поиск моделей; она сама по себе не доказывает точность на задачах конкретной команды. Доступность продуктов, цены и перечень моделей могут меняться, поэтому при планировании испытания командам следует проверять актуальную документацию.

Пока Jev выглядит возможным кандидатом на роль первого судьи, если задача узкая, метки однозначны, а локальная оценка показывает, что маршрутизация по уверенности эффективно направляет случаи с ошибками. Если для оценки нужны глубокие рассуждения, результаты по рубрикам зависят от неявных правил оценщиков или несколько моделей допускают одинаковые ошибки, эти исследования дают командам основания сохранить проверку человеком или другой подтвержденный контрольный этап.

## Главное изменение

Новые оценки Jev смещают вопрос с того, может ли модель принятия решений дешево выдавать вердикт, на вопрос о том, когда этот вердикт достаточно полезен. Ответ зависит от задачи: маршрутизация по уверенности улучшила каскад при попарной оценке на отложенной выборке, а отдельное исследование оценивания по рубрикам выявило небольшой выигрыш из-за совпадающих ошибок. Результаты медицинских тестов также заметно менялись в зависимости от сложности задач. Следующий шаг для команд, работающих с ИИ, — локальная проверочная выборка, которая одновременно оценивает правильность, уверенность и работу резервной модели.

## Источники и дополнительная литература

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan и Rema Padman, версия 2 от 27 сентября 2026 года. Препринт сравнивает Jev с 16 судьями, включает слепую оценку людьми и отложенные тесты маршрутизации по уверенности.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places](https://arxiv.org/abs/2609.29769v1), Delip Rao и Chris Callison-Burch, 24 сентября 2026 года. Препринт оценивает бинарные и рейтинговые вердикты по отдельным критериям на девяти наборах бенчмарков.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García и Beatriz Merino-Barbancho, 27 сентября 2026 года. Предварительное сравнение на четырех медицинских наборах вопросов с выбором ответа; это не клиническое исследование.
- [Документация API TypeSafe](https://api.typesafe.ai/docs), официальный справочник по структурированному формату запросов и ответов Jev. Документация описывает работу продукта, а не независимую оценку.

## Sources

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure (v2)](https://arxiv.org/abs/2609.26550v2) — Основной препринт, представлен 22 сентября и обновлен 27 сентября. Jev 1.13 сравнивается с 16 судьями в задачах на предпочтения, проверку фактов по источникам и итоговых ответов; приводятся выборочная слепая оценка, зафиксированный офлайн-анализ каскада и два заранее запланированных испытания на новых отложенных наборах в реальных условиях. Рецензирование не проводилось; это не исследование внедрения. Ограничения сопоставления вычислительных ресурсов, выборочной оценки, широты задач, стоимости и времени зафиксированы в SOURCE-AUDIT.md.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places (v1)](https://arxiv.org/abs/2609.29769v1) — Основной препринт сравнивает Jev с тремя быстрыми LLM на девяти наборах бенчмарков и 5 003 парах «пример — критерий». Текст критериев одинаковый; два набора бинарные, семь с рейтинговыми шкалами. Выявляет коррелирующие уверенные ошибки; анализ маршрутизации в основном основан на повторном воспроизведении записанных данных. Рецензирование не проводилось; многие сравнения статистически неубедительны, выводы ограничены выбранными рубриками, наборами и условиями обслуживания моделей.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results. (v1)](https://arxiv.org/abs/2609.34024v1) — Основной предварительный препринт сравнивает Jev 1.13 с GPT-6 Sol на четырех медицинских бенчмарках с выбором ответа. Включает точность, калибровку/селективное предсказание, отказ от ответа, задержку и стоимость. Клинического внедрения и оценки клиницистами не было; авторы сообщают, что независимое воспроизведение и проверка результатов еще предстоят, и не рекомендуют использовать результаты в клинической помощи.
- [Документация API TypeSafe](https://api.typesafe.ai/docs) — Официальная документация OpenAPI, проверенная 29 сентября 2026 года: схемы структурированных запросов и ответов, конечная точка system-one и поиск моделей. Подтверждает описание интерфейса, но не независимые утверждения о качестве. Доступность продукта и цены могут измениться.
- [Instagram Reel о передаче владения Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Только источник, указанный в задании: ролик не удалось получить или расшифровать. Подпись и метаданные не используются как доказательства; видеоряду не приписываются никакие утверждения.