O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição em Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Resultados do juiz de IA Jev variam conforme a tarefa e o modelo de contingência

> Três preprints avaliam o Jev como juiz de respostas de IA. Os resultados variam entre tarefas de preferência, avaliação por critérios e tarefas médicas; o encaminhamento baseado em confiança só ajuda quando o modelo de contingência corrige os erros do Jev.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Três novos preprints avaliam o Jev como avaliador de maneiras diferentes. Um o considera próximo de um juiz forte baseado em modelo de linguagem em tarefas de preferência entre respostas e verificação factual baseada em evidências; em seguida, usa a confiança para encaminhar casos incertos. Um segundo encontra pouco benefício nesse encaminhamento em rubricas com notas graduadas, pois os modelos de contingência frequentemente repetem os erros confiantes do Jev. Um terceiro benchmark médico relata acurácia semelhante em perguntas sobre resumos de pesquisa e diferenças consideráveis em casos de diagnóstico mais difíceis.

A resposta prática é mais restrita do que “a IA pode avaliar a IA”. O Jev pode ser um juiz rápido de primeira etapa para uma tarefa bem definida, mas as evidências não estabelecem um juiz confiável para todos os tipos de resposta. O encaminhamento baseado em confiança só pode ajudar depois que uma equipe verifica, com exemplos próprios, o que essa confiança prevê.

## O que significa um modelo atuar como juiz

Um avaliador recebe uma ou mais respostas de modelos e retorna uma pontuação ou decisão segundo alguma regra. Um juiz pode escolher qual de duas respostas segue melhor uma instrução, decidir se uma afirmação é sustentada pelos documentos fornecidos, avaliar uma resposta com base em uma rubrica ou selecionar a opção correta em um caso médico de múltipla escolha. Essas tarefas impõem exigências diferentes ao avaliador.

O Jev é o modelo de decisão hospedado da TypeSafe. Sua API aceita entradas estruturadas e um tipo de resposta permitido, depois retorna uma escolha ou pontuação com probabilidades para os rótulos aceitos. A interface pode integrar uma tarefa a um software que espera um resultado limitado a opções predefinidas. No entanto, uma probabilidade é uma estimativa do modelo; não verifica por conta própria se a resposta subjacente está correta. A documentação da TypeSafe descreve a interface, enquanto as comparações de pesquisa abaixo avaliam o desempenho em conjuntos de teste específicos.

O [estudo JEV-as-a-Judge](https://arxiv.org/abs/2609.26550v2), revisado em 27 de setembro, compara o Jev 1.13 com 16 juízes generativos e modelos de recompensa. O [estudo de juiz por rubrica](https://arxiv.org/abs/2609.29769v1), publicado em 24 de setembro, compara o Jev com três modelos de linguagem mais baratos. O [benchmark médico](https://arxiv.org/abs/2609.34024v1), publicado em 27 de setembro, compara o Jev 1.13 com o GPT-6 Sol em duas configurações de raciocínio. Os três são preprints. Nenhum é um estudo de implantação clínica, e nenhum passou por revisão por pares.

## Próximo em alguns vereditos, mais fraco em raciocínio

O primeiro artigo avalia 5.172 julgamentos em pares de preferência, factualidade fundamentada em evidências e verificações de resposta final; depois, acrescenta testes complementares e dois estudos de encaminhamento com dados reservados. As principais pontuações públicas do Jev foram 92,5% em uma amostra de 1.500 pares de preferência do RewardBench, 78,6% em 350 pares do JudgeBench e 87,3% em 3.000 respostas do HaluEval avaliadas com base em evidências. Nessas tarefas, o comparador GPT-6 Astra mais forte obteve, respectivamente, 92,5%, 93,1% e 88,4%. O artigo informa custo de US$ 0,044 por mil julgamentos básicos e latência mediana de 0,15 segundo para o Jev em seu painel de medição; sob as condições do estudo, o GPT-6 Astra custou US$ 12,182 e levou 1,89 segundo.

Essas médias ocultam o limite encontrado pelos autores. O Jev ficou a cerca de dois pontos do GPT-6 em qualidade de conversa, recusas de segurança e factualidade fundamentada em evidências. Ficou atrás em tarefas que exigiam derivar ou verificar um resultado: 14,3 pontos em matemática e 12,9 em programação, com uma diferença de 27,6 pontos em problemas de lógica. No conjunto de correção objetiva do JudgeBench, o Jev marcou 78,6%, contra 93,1% do GPT-6. Na adjudicação às cegas de casos contestados em um subconjunto de 990 itens, os avaliadores humanos concordaram com o GPT-6 em 57 dos 69 itens contestados do JudgeBench e com o Jev em um. A adjudicação foi seletiva e limitada, mas sugere que a diferença não se devia apenas aos rótulos do benchmark.

Nesse estudo, “juiz” significava escolher entre duas respostas geradas ou decidir se uma única resposta era sustentada ou correta diante de uma referência declarada. Os autores deram deliberadamente aos juízes generativos o mesmo formato restrito de decisão e probabilidade usado pelo Jev, sem justificativas. Portanto, a comparação trata dos vereditos dentro dessas regras, não de qual juiz consegue explicar seu raciocínio a uma pessoa.

## O encaminhamento por confiança funciona quando os erros diferem

Uma cascata usa um juiz inicial mais barato e envia alguns casos a um modelo de contingência mais caro. No primeiro estudo, a regra aceitava o veredito do Jev quando a probabilidade máxima para um rótulo era de pelo menos 0,9 e encaminhava os casos com confiança menor. Em 1.610 pares de preferência reservados, a cascata, considerando as duas ordens de apresentação das respostas, encaminhou 31,5% dos casos, marcou 93,4% contra 92,5% do GPT-6 e custou 41% do valor cobrado pelo GPT-6. Em um teste ao vivo predefinido com 570 pares reservados de duas novas tarefas de correção, o Jev sozinho ficou 14 pontos atrás do GPT-6; a cascata igualou a acurácia do GPT-6, encaminhando 74% dos casos e economizando cerca de um quarto do custo.

Esse resultado depende de uma condição específica: os casos que deixam o Jev em dúvida precisam conter erros que o modelo de contingência consiga corrigir. Os autores descobriram que o encaminhamento por confiança perdeu eficácia em pares adversariais de estilo e falhou em textos sem referência, nos quais todos os juízes testados ficaram perto do acaso, embora muitas vezes demonstrassem confiança. O estudo também constatou que calcular a média das decisões nos dois ordenamentos das respostas reduziu efeitos de posição. Os limiares foram escolhidos com exemplos locais rotulados; o artigo recomenda usar um limite inferior de confiança e fazer uma verificação com dados reservados.

O estudo separado sobre rubricas avalia pontuações por critério em nove painéis derivados de sete benchmarks, totalizando 5.003 pares de item e critério. Dois painéis eram binários; sete usavam escalas ordenadas de notas. Os quatro juízes receberam o mesmo texto para cada critério, e os autores fixaram as rubricas antes da avaliação. Em oito das 27 comparações pareadas, o intervalo de confiança de 95% excluiu a ausência de diferença na acurácia; após a correção para comparações múltiplas, restaram quatro. Algumas outras comparações atenderam à margem de equivalência do artigo, enquanto muitas eram imprecisas demais para demonstrar diferença ou equivalência. O Jev se saiu melhor em relação aos demais nos critérios binários. Nos painéis graduados, nunca foi o melhor juiz comparável, e todos os juízes tenderam a dar notas mais baixas do que os avaliadores humanos.

Nesse contexto, as economias de custo e tempo foram grandes. O Jev custou cerca de seis centavos nos nove painéis; os três juízes baseados em modelos de linguagem custaram de 29 a 325 vezes mais e levaram de 30 a 220 vezes mais tempo. Ainda assim, a confiança do Jev não produziu uma cascata robusta. Na maioria dos painéis, a confiança ajudou a ordenar os erros, mas os modelos de contingência repetiram quase todos os erros mais confiantes do Jev. Com limiares ajustados por validação cruzada, a cascata melhorou em no máximo 1,5 ponto percentual, em média, em relação ao melhor juiz individual; teve desempenho inferior ao desse juiz em seis dos nove painéis. Essa reprodução usou vereditos registrados, não uma implantação prospectiva ao vivo.

O contraste entre os dois artigos é instrutivo. Em comparações pareadas de respostas, o primeiro estudo encontrou uma divisão útil entre erros do Jev com baixa confiança e os recursos de um modelo de contingência mais forte. Na avaliação por critérios, o modelo de contingência frequentemente cometia os mesmos erros, de modo que o encaminhamento aumentava o custo sem corrigi-los muito. O sinal de confiança do modelo, por si só, não diz à equipe se outro modelo vai oferecer uma discordância produtiva.

## Resultados médicos de múltipla escolha dependem da dificuldade da tarefa

O artigo médico avalia o Jev em quatro conjuntos de dados existentes: 1.373 questões de prova do MetaMedQA, 500 perguntas do PubMedQA respondidas com base em resumos de pesquisa, 915 casos de múltipla escolha do DiagnosisArena e 34 desafios clínicos do NEJM com diagnóstico final publicado. A comparação foi com o GPT-6 Sol, tanto com raciocínio médio quanto sem raciocínio. Houve 8.469 solicitações aos modelos, e todas retornaram uma resposta estruturada válida.

No PubMedQA, o Jev e o GPT-6 Sol com raciocínio médio marcaram 78,4% e 78,2%. No MetaMedQA, o Jev marcou 74,8%, contra 82,7%; no DiagnosisArena, 59,8%, contra 82,4%; e nos 34 casos do NEJM, 61,8%, contra 82,4%. O GPT-6 sem raciocínio também apresentou estimativas pontuais maiores nos dois conjuntos de casos mais difíceis. A estimativa baseada nos 34 casos do NEJM é imprecisa, e sua comparação principal deixou de ser estatisticamente significativa após a correção para comparações múltiplas. A diferença bem maior no DiagnosisArena permaneceu sem raciocínio explícito.

Esse teste avalia a escolha entre opções fornecidas, não a elaboração de um diagnóstico diferencial nem o tratamento de pacientes. O artigo não relata adjudicação das respostas do benchmark por médicos. Informa que as imagens do NEJM foram apresentadas aos modelos como legendas e que os casos desafiadores do DiagnosisArena foram filtrados usando outros modelos de linguagem. Os autores consideram os resultados preliminares e dizem que ainda faltam replicação independente, adjudicação clínica das respostas de referência e verificações de estabilidade entre execuções. O artigo afirma explicitamente que os resultados não devem orientar cuidados clínicos.

Os limiares de probabilidade tiveram valor desigual. No MetaMedQA, 52,9% das escolhas do Jev tiveram confiança de pelo menos 0,9, e a acurácia dessas escolhas foi de 93,4%. Com cobertura semelhante, o GPT-6 foi tão preciso quanto ou mais preciso. No DiagnosisArena, a ordenação das probabilidades do Jev foi fraca: com o mesmo limiar de 0,9, apenas 17,3% dos itens foram aceitos, e uma em cada quatro respostas aceitas continuou errada. Em todos os benchmarks, a probabilidade média atribuída pelos modelos à opção escolhida foi maior que a acurácia. Nesta amostra, uma pontuação alta não significava certeza.

## O que as equipes podem concluir dos estudos

Em conjunto, os artigos justificam testar o Jev como avaliador específico para uma tarefa, sobretudo quando um veredito pode ser obtido do texto fornecido ou conferido com base em evidências. Eles não justificam tratar o campo de confiança como um interruptor de segurança universal. Os resultados variaram entre as tarefas, e o estudo de rubricas mostra por que é preciso avaliar se os erros do modelo de contingência são independentes, além de comparar sua acurácia bruta.

Uma equipe que considere esse padrão precisa de uma amostra representativa e rotulada de suas próprias tarefas. Deve definir o que conta como decisão correta, incluir exemplos difíceis e enganosos, comparar os resultados com revisão humana ou outra referência defensável e, depois, medir as taxas de erro e o quanto a confiança distingue decisões corretas de incorretas. Em uma cascata, também deve registrar se o modelo de contingência realmente corrige os erros da primeira etapa, quantos casos são encaminhados e qual é o custo e a demora resultantes. Um conjunto de teste separado pode mostrar se o limiar se aplica além dos exemplos usados para escolhê-lo.

Essas são implicações práticas dos estudos, não um processo testado pela BIG CHANGE. Não chamamos a API do Jev nem executamos um benchmark local. A [documentação da API](https://api.typesafe.ai/docs) da TypeSafe descreve solicitações estruturadas, tipos de resposta permitidos e a descoberta de modelos; não comprova de forma independente a acurácia nas tarefas de uma equipe. O acesso ao produto, os preços e os modelos podem mudar; por isso, as equipes devem consultar a documentação atual ao planejar um teste.

Por enquanto, o Jev parece ser um candidato a juiz inicial quando a tarefa é restrita, os rótulos são claros e uma avaliação local mostra que o encaminhamento por confiança direciona os erros de forma eficaz. Quando o julgamento exige raciocínio mais profundo, a avaliação depende de convenções ocultas dos avaliadores ou vários modelos cometem os mesmos erros, os estudos dão às equipes motivos para manter a revisão humana ou outra verificação validada no processo.

## A grande mudança

As novas avaliações do Jev deslocam a pergunta: em vez de saber se um modelo de decisão consegue dar um veredito barato, é preciso saber quando esse veredito é útil o suficiente para ser mantido. A resposta depende da tarefa: o encaminhamento por confiança melhorou uma cascata de avaliação pareada com dados reservados, enquanto um estudo separado de rubricas encontrou pouco ganho porque os erros se sobrepunham. Os resultados médicos de múltipla escolha também variaram bastante conforme a dificuldade da tarefa. Para equipes de IA, o próximo passo é criar um conjunto de validação local que verifique em conjunto a correção, a confiança e o comportamento do modelo de contingência.

## Fontes e leituras complementares

- [JEV-as-a-Judge: Aceitar quando houver confiança, encaminhar quando houver dúvida](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan e Rema Padman, versão 2 datada de 27 de setembro de 2026. Preprint que compara o Jev com 16 juízes, inclui adjudicação humana às cegas e testes de encaminhamento por confiança com dados reservados.
- [Jev vs. modelos de linguagem como juízes de rubrica: mais barato, mais rápido e errado nos mesmos casos](https://arxiv.org/abs/2609.29769v1), Delip Rao e Chris Callison-Burch, 24 de setembro de 2026. Preprint que avalia julgamentos binários e graduados por critério em nove painéis de benchmark.
- [Jev na medicina: uma avaliação de benchmark. Resultados preliminares.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García e Beatriz Merino-Barbancho, 27 de setembro de 2026. Comparação preliminar em quatro conjuntos de dados médicos de múltipla escolha; não é um estudo clínico.
- [Documentação da API TypeSafe](https://api.typesafe.ai/docs), referência oficial da interface estruturada de solicitação e resposta do Jev. A documentação descreve o comportamento do produto, não uma avaliação independente.

## Sources

- [JEV-as-a-Judge: Aceitar quando houver confiança, encaminhar quando houver dúvida (v2)](https://arxiv.org/abs/2609.26550v2) — Preprint principal, enviado em 22 de setembro e revisado em 27 de setembro. Comparou o Jev 1.13 com 16 juízes em tarefas de preferência, factualidade fundamentada em evidências e respostas finais; inclui adjudicação seletiva às cegas, análises offline congeladas de cascatas e dois testes ao vivo predefinidos de tarefas reservadas. Não é revisado por pares nem um estudo de implantação; as limitações de equivalência computacional, adjudicação seletiva, abrangência das tarefas, custo e tempo estão registradas em SOURCE-AUDIT.md.
- [Jev vs. modelos de linguagem como juízes de rubrica: mais barato, mais rápido e errado nos mesmos casos (v1)](https://arxiv.org/abs/2609.29769v1) — Preprint principal que compara o Jev com três modelos de linguagem da categoria flash em nove painéis de benchmark e 5.003 pares de itens e critérios. Os textos dos critérios são iguais; dois painéis são binários e sete usam notas graduadas. Mostra erros confiantes correlacionados e análises de encaminhamento baseadas principalmente na reprodução dos resultados. Não é revisado por pares; muitas comparações são estatisticamente inconclusivas, e os resultados se limitam às rubricas, aos painéis e às condições de serviço escolhidos.
- [Jev na medicina: uma avaliação de benchmark. Resultados preliminares. (v1)](https://arxiv.org/abs/2609.34024v1) — Preprint preliminar que compara o Jev 1.13 com o GPT-6 Sol em quatro benchmarks médicos de múltipla escolha. Inclui acurácia, calibração e predição seletiva, abstenção, latência e custo. Não há implantação clínica nem adjudicação por médicos; os autores afirmam que a replicação independente e a verificação dos resultados estão pendentes e desaconselham o uso em cuidados clínicos.
- [Documentação da API TypeSafe](https://api.typesafe.ai/docs) — Documentação oficial da OpenAPI consultada em 29 de setembro de 2026; mostra os esquemas estruturados de solicitação e resposta, o endpoint system-one e a descoberta de modelos. Dá suporte somente à descrição da interface, não a alegações independentes de desempenho. A disponibilidade do produto e os preços podem mudar.
- [Vídeo do Instagram Dd3wdNKxg5J encaminhado pelo responsável](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Usado apenas como pista para a pauta: não foi possível recuperar nem transcrever o vídeo. A legenda e os metadados não são usados como evidência; nenhuma afirmação é atribuída às imagens.