AI-translated from English; not yet reviewed by a fluent editor.

# Los resultados de Jev como juez de IA varían según la tarea y el modelo de respaldo

> Tres prepublicaciones evalúan Jev como juez de respuestas de IA. Los resultados varían entre tareas de preferencia, rúbricas y medicina; el enrutamiento por confianza solo ayuda cuando el modelo de respaldo corrige los errores de Jev.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tres prepublicaciones nuevas evalúan Jev como juez con distintos enfoques. Una concluye que sus resultados se acercan a los de un juez sólido basado en un modelo de lenguaje al comparar preferencias entre respuestas y verificar afirmaciones factuales con evidencia; después usa la confianza para derivar los casos inciertos. Un segundo estudio encuentra poco beneficio de ese enrutamiento en rúbricas con puntuación por niveles, porque los modelos de respaldo suelen repetir los errores que Jev comete con alta confianza. Un tercer benchmark médico informa de una precisión similar en preguntas basadas en resúmenes de investigación y de brechas considerables en casos de diagnóstico más difíciles.

La conclusión práctica es más acotada que «la IA puede juzgar a la IA». Jev podría servir como juez rápido de primera instancia en una tarea bien definida, pero los datos no demuestran que exista un único juez fiable para cualquier tipo de respuesta. El uso de la confianza para derivar casos solo puede ayudar después de que el equipo haya comprobado qué predice con sus propios ejemplos.

## Qué significa que un modelo juzgue

Un evaluador recibe una o varias respuestas de modelos y devuelve una puntuación o un veredicto conforme a una regla. Puede elegir cuál de dos respuestas sigue mejor una instrucción, decidir si una afirmación está respaldada por los documentos proporcionados, puntuar una respuesta con una rúbrica o seleccionar la opción correcta en un caso médico de respuesta múltiple. Estas tareas exigen cosas distintas al evaluador.

Jev es el modelo de decisión alojado de TypeSafe. Su API acepta una entrada estructurada y un tipo de respuesta permitido, y devuelve una opción o puntuación con probabilidades para las etiquetas admitidas. Esa interfaz permite integrar una tarea en un software que espera un resultado acotado. Sin embargo, una probabilidad es una estimación del modelo; no verifica por sí sola la respuesta subyacente. La documentación de TypeSafe describe la interfaz, mientras que las comparaciones de investigación que siguen evalúan el rendimiento en conjuntos de prueba concretos.

El [estudio JEV-as-a-Judge](https://arxiv.org/abs/2609.26550v2), revisado el 27 de septiembre, compara Jev 1.13 con 16 jueces generativos y de modelos de recompensa. El [estudio sobre jueces de rúbricas](https://arxiv.org/abs/2609.29769v1), publicado el 24 de septiembre, compara Jev con tres modelos de lenguaje de menor costo. El [benchmark médico](https://arxiv.org/abs/2609.34024v1), publicado el 27 de septiembre, compara Jev 1.13 con GPT-6 Sol en dos configuraciones de razonamiento. Los tres son prepublicaciones. Ninguno es un estudio de implementación clínica ni ha pasado revisión por pares.

## Resultados similares en algunos veredictos, más débiles al razonar

El primer estudio evalúa 5.172 veredictos en pares de preferencia, verificaciones de hechos basadas en evidencia y comprobaciones de respuestas finales; luego añade pruebas de seguimiento y dos estudios de enrutamiento con datos reservados. Las principales puntuaciones públicas de Jev en el benchmark fueron del 92,5 % en una muestra de 1.500 pares de preferencias de RewardBench, del 78,6 % en 350 pares de JudgeBench y del 87,3 % en 3.000 respuestas de HaluEval evaluadas frente a evidencia. En esas tareas, el comparador GPT-6 Astra más potente obtuvo, respectivamente, un 92,5 %, un 93,1 % y un 88,4 %. El artículo sitúa a Jev en 0,044 dólares por cada 1.000 veredictos básicos y una latencia mediana de 0,15 segundos en su panel de tiempos; GPT-6 Astra costó 12,182 dólares y tardó 1,89 segundos en las condiciones del estudio.

Estos promedios ocultan los límites identificados por los autores. En calidad de chat, rechazos de seguridad y verificación factual basada en evidencia, Jev quedó a unos dos puntos de GPT-6. Se quedó atrás en tareas que exigían deducir o comprobar un resultado: 14,3 puntos en matemáticas y 12,9 en código, con una brecha de 27,6 puntos en acertijos lógicos. En el conjunto de JudgeBench de respuestas objetivamente correctas, Jev obtuvo un 78,6 %, frente al 93,1 % de GPT-6. La revisión a ciegas de casos disputados en un subconjunto de 990 elementos favoreció a GPT-6 en 57 de los 69 casos disputados de JudgeBench y a Jev en uno. Esta revisión fue selectiva y limitada, pero sugiere que la brecha no se debía únicamente a las etiquetas del benchmark.

En este caso, «juez» significaba elegir entre dos respuestas generadas o decidir si una respuesta única estaba respaldada o era correcta según una referencia explícita. Los autores dieron deliberadamente a los jueces generativos el mismo formato restringido de veredicto y probabilidad que a Jev, sin explicaciones. Por tanto, la comparación se refiere a los veredictos bajo esas condiciones, no a qué juez puede explicar mejor su razonamiento a una persona.

## El enrutamiento por confianza funciona cuando los errores no coinciden

Una cascada utiliza primero un juez menos costoso y deriva algunos casos a otro más caro. En el primer estudio, la regla aceptaba el veredicto de Jev si la probabilidad máxima de una etiqueta era al menos 0,9 y derivaba los casos con menor confianza. En 1.610 pares de preferencias reservados, la cascada en dos órdenes derivó el 31,5 % de los casos, obtuvo un 93,4 % frente al 92,5 % de GPT-6 y costó el 41 % de la tarifa de GPT-6. En una prueba en vivo preespecificada con 570 pares reservados de dos nuevas tareas de corrección, Jev por sí solo quedó 14 puntos por debajo de GPT-6; la cascada igualó la precisión de GPT-6, derivó el 74 % y ahorró alrededor de una cuarta parte de su tarifa.

Ese resultado depende de una condición concreta: los casos sobre los que Jev duda deben contener errores que el modelo de respaldo pueda corregir. Los autores observaron que el enrutamiento por confianza se debilitaba con pares adversarios de estilo y fallaba con prosa sin referencia, tareas en las que todos los jueces probados acertaban casi al azar y, aun así, a menudo expresaban mucha confianza. El estudio también encontró que promediar las decisiones en ambos órdenes de respuesta reducía los efectos de posición. Los umbrales se eligieron con ejemplos locales etiquetados; el artículo recomienda un enfoque basado en el límite inferior de confianza y una comprobación con datos reservados.

El estudio independiente sobre rúbricas evalúa la puntuación por criterio en nueve paneles extraídos de siete benchmarks, con 5.003 pares de elemento y criterio en total. Dos paneles eran binarios y siete usaban escalas de valoración ordenadas. Los cuatro jueces recibieron el mismo texto para cada criterio y los autores fijaron las rúbricas antes de la evaluación. Ocho de 27 comparaciones pareadas tuvieron un intervalo de confianza del 95 % que excluía la ausencia de diferencia; tras corregir las comparaciones múltiples, quedaron cuatro. Otras comparaciones cumplieron el margen de equivalencia del artículo, mientras que muchas tenían una precisión insuficiente para demostrar diferencias o equivalencia. Jev obtuvo sus mejores resultados relativos en criterios binarios. En los paneles con puntuación graduada nunca fue el juez emparejado con mejor resultado, y todos los jueces tendieron a puntuar por debajo de los evaluadores humanos.

En esa configuración, el ahorro de dinero y tiempo fue considerable. Jev costó unos seis centavos por los nueve paneles; los tres jueces basados en modelos de lenguaje costaron entre 29 y 325 veces más y tardaron entre 30 y 220 veces más. Aun así, la confianza de Jev no bastó para crear una cascada eficaz. En la mayoría de los paneles, permitía ordenar sus errores por nivel de confianza, pero los modelos de respaldo repetían casi todos los errores que Jev había emitido con mayor confianza. Con umbrales ajustados mediante validación cruzada, la cascada mejoró como máximo 1,5 puntos porcentuales de media frente al mejor juez individual; rindió peor que ese juez en seis de los nueve paneles. Esta repetición se basó en veredictos registrados, no en una implementación prospectiva en vivo.

El contraste entre ambos artículos es revelador. En las comparaciones por pares de respuestas, el primer estudio encontró una división útil entre los errores de baja confianza de Jev y las capacidades de un modelo de respaldo más potente. Al puntuar criterios, el modelo de respaldo solía cometer los mismos errores, así que derivar los casos añadía costo sin corregir muchos. La señal de confianza del modelo, por sí sola, no indica al equipo si otro modelo discrepará de forma útil.

## Los resultados médicos de respuesta múltiple dependen de la dificultad

El artículo médico evalúa Jev con cuatro conjuntos de datos existentes: 1.373 preguntas de examen de MetaMedQA, 500 preguntas de PubMedQA respondidas a partir de resúmenes de investigación, 915 casos de respuesta múltiple de DiagnosisArena y 34 NEJM Case Challenges con un diagnóstico final publicado. Lo compara con GPT-6 Sol con razonamiento medio y sin razonamiento. Se realizaron 8.469 solicitudes a los modelos y todas devolvieron una respuesta estructurada válida.

En PubMedQA, Jev y GPT-6 Sol con razonamiento medio obtuvieron un 78,4 % y un 78,2 %. En MetaMedQA, Jev logró un 74,8 %, frente al 82,7 %; en DiagnosisArena, un 59,8 %, frente al 82,4 %; y en los 34 casos de NEJM, un 61,8 %, frente al 82,4 %. GPT-6 sin razonamiento también tuvo estimaciones puntuales más altas en los dos conjuntos de casos difíciles. La estimación de los 34 casos de NEJM es imprecisa y su comparación principal dejó de ser estadísticamente significativa tras corregir las comparaciones múltiples. La brecha mucho mayor de DiagnosisArena persistió sin razonamiento explícito.

Esto evalúa la selección entre opciones proporcionadas, no la elaboración de un diagnóstico diferencial ni el tratamiento de pacientes. El artículo no informa de una adjudicación clínica de las respuestas del benchmark. Señala que las imágenes de NEJM se proporcionaron a los modelos como pies de foto y que los casos difíciles de DiagnosisArena se filtraron con otros modelos de lenguaje. Los autores califican los resultados de preliminares y dicen que aún faltan la replicación independiente, la adjudicación clínica de las respuestas de referencia y las comprobaciones de estabilidad entre ejecuciones. El artículo indica expresamente que estos resultados no deben utilizarse para orientar la atención clínica.

El valor de los umbrales de probabilidad fue desigual. En MetaMedQA, el 52,9 % de las respuestas de Jev tuvo una confianza de al menos 0,9, y su precisión en ese grupo fue del 93,4 %. Con una cobertura similar, GPT-6 fue igual de preciso o más. En DiagnosisArena, la clasificación por probabilidad de Jev fue débil: con el mismo umbral de 0,9, solo se aceptó el 17,3 % de los elementos y una de cada cuatro respuestas aceptadas seguía siendo incorrecta. En todos los benchmarks, la probabilidad media que los modelos asignaron a la opción elegida superó su precisión. En esta muestra, una puntuación alta no equivalía a certeza.

## Qué pueden aprender los equipos de estos estudios

En conjunto, los artículos respaldan probar Jev como evaluador para tareas específicas, sobre todo cuando se puede extraer un veredicto del texto proporcionado o contrastarlo con pruebas. No respaldan tratar su campo de confianza como un interruptor de seguridad universal. Los resultados cambiaron según la carga de trabajo, y el estudio de rúbricas muestra por qué hay que evaluar la independencia de los errores del modelo de respaldo, además de su precisión general.

Un equipo que considere este patrón necesita una muestra representativa y etiquetada de su propia tarea. Debe definir qué cuenta como una decisión correcta, incluir ejemplos difíciles y engañosos, comparar los resultados con una revisión humana u otra referencia defendible y medir tanto las tasas de error como la capacidad de la confianza para distinguir las decisiones correctas de las incorrectas. Si utiliza una cascada, también debería registrar si el modelo de respaldo corrige realmente los errores de la primera etapa, cuántos casos se derivan y el costo y la demora resultantes. Un conjunto de prueba reservado puede revelar si el umbral funciona también fuera de los ejemplos usados para elegirlo.

Estas son implicaciones prácticas de los estudios, no un procedimiento de BIG CHANGE sometido a prueba. No llamamos a la API de Jev ni ejecutamos un benchmark local. La [documentación de la API](https://api.typesafe.ai/docs) describe las solicitudes estructuradas, los tipos de respuesta permitidos y la búsqueda de modelos; no demuestra de forma independiente la precisión en la carga de trabajo de un equipo. El acceso al producto, los precios y los modelos pueden cambiar, así que los equipos deberían consultar la documentación vigente al planificar una prueba.

Por ahora, Jev parece una opción prometedora como juez inicial cuando la tarea es acotada, las etiquetas son claras y una evaluación local demuestra que la confianza deriva los errores de forma eficaz. Si el juicio exige razonamiento más profundo, la calificación depende de convenciones ocultas de los evaluadores o varios modelos cometen los mismos errores, los estudios dan motivos para mantener la revisión humana u otra comprobación validada.

## El gran cambio

Las nuevas evaluaciones de Jev desplazan la pregunta: ya no se trata solo de si un modelo de decisión puede emitir un veredicto barato, sino de cuándo ese veredicto resulta suficientemente útil como para aceptarlo. La respuesta depende de la tarea: el enrutamiento por confianza mejoró una cascada de evaluación por pares con datos reservados, mientras que un estudio distinto sobre rúbricas apenas encontró mejoras porque los errores se solapaban. Los resultados médicos de respuesta múltiple también variaron mucho según la dificultad. Para los equipos de IA, el siguiente paso es crear un conjunto de validación local que compruebe conjuntamente la corrección, la confianza y el comportamiento del modelo de respaldo.

## Fuentes y lecturas adicionales

- [JEV-as-a-Judge: aceptar cuando hay confianza, derivar cuando hay dudas](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan y Rema Padman, versión 2 del 27 de septiembre de 2026. Prepublicación que compara Jev con 16 jueces e incluye adjudicación humana a ciegas y pruebas reservadas de enrutamiento por confianza.
- [Jev frente a los modelos de lenguaje como jueces de rúbricas: más barato, más rápido y equivocado en los mismos casos](https://arxiv.org/abs/2609.29769v1), Delip Rao y Chris Callison-Burch, 24 de septiembre de 2026. Prepublicación que evalúa juicios binarios y graduados por criterio en nueve paneles de benchmarks.
- [Jev en medicina: evaluación con benchmarks. Resultados preliminares.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García y Beatriz Merino-Barbancho, 27 de septiembre de 2026. Comparación preliminar en cuatro conjuntos médicos de respuesta múltiple; no es un estudio clínico.
- [Documentación de la API de TypeSafe](https://api.typesafe.ai/docs), referencia oficial sobre la interfaz estructurada de solicitudes y respuestas de Jev. Describe el comportamiento del producto, no una evaluación independiente.

## Sources

- [JEV-as-a-Judge: aceptar cuando hay confianza, derivar cuando hay dudas (v2)](https://arxiv.org/abs/2609.26550v2) — Prepublicación primaria, enviada el 22 de septiembre y revisada el 27. Compara Jev 1.13 con 16 jueces en tareas de preferencia, verificación factual basada en evidencia y comprobación de respuestas finales; incluye revisión selectiva a ciegas, análisis fuera de línea con cascadas congeladas y dos pruebas en vivo preespecificadas con cargas de trabajo reservadas. No ha pasado revisión por pares ni es un estudio de implementación; SOURCE-AUDIT.md registra las limitaciones sobre la equiparación de cómputo, la selección de casos revisados, la amplitud de las cargas de trabajo, el costo y los tiempos.
- [Jev frente a los modelos de lenguaje como jueces de rúbricas: más barato, más rápido y equivocado en los mismos casos (v1)](https://arxiv.org/abs/2609.29769v1) — Prepublicación primaria que compara Jev con tres modelos de lenguaje de nivel flash en nueve paneles de benchmarks y 5.003 pares de elementos y criterios de rúbrica. Usa los mismos textos de criterios; dos paneles son binarios y siete graduados. Muestra errores correlacionados expresados con confianza y un análisis de enrutamiento basado principalmente en la repetición de veredictos. No ha pasado revisión por pares; muchas comparaciones no son concluyentes desde el punto de vista estadístico y los resultados se limitan a las rúbricas, los paneles y las condiciones de servicio elegidos.
- [Jev en medicina: evaluación con benchmarks. Resultados preliminares. (v1)](https://arxiv.org/abs/2609.34024v1) — Prepublicación preliminar primaria que evalúa Jev 1.13 frente a GPT-6 Sol en cuatro benchmarks médicos de respuesta múltiple. Incluye precisión, calibración y predicción selectiva, abstenciones, latencia y costo. No es una implementación clínica ni incluye revisión por profesionales clínicos; los autores indican que aún faltan una réplica independiente y la verificación de resultados, y desaconsejan su uso en la atención clínica.
- [Documentación de la API de TypeSafe](https://api.typesafe.ai/docs) — Documentación oficial de OpenAPI consultada el 29 de septiembre de 2026, con los esquemas estructurados de solicitud y respuesta, el endpoint system-one y la búsqueda de modelos. Solo respalda la descripción de la interfaz, no las afirmaciones sobre el rendimiento independiente. La disponibilidad del producto y los precios pueden cambiar.
- [Reel de Instagram que originó la asignación: Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Solo fue una pista para la asignación: no se pudo recuperar ni transcribir el Reel. El pie de foto y los metadatos no se utilizaron como pruebas; no se atribuyen afirmaciones a las imágenes.
