O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Resultados do avaliador de IA Jev variam conforme a tarefa e o modelo de contingência

> Três pré-publicações avaliam o Jev como avaliador de respostas de IA. Os resultados variam entre tarefas de preferência, avaliação por rubricas e tarefas médicas; o encaminhamento com base na confiança só ajuda quando o modelo de contingência corrige os erros do Jev.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Três novas pré-publicações avaliam o Jev de formas diferentes. Um estudo conclui que se aproxima de um avaliador robusto baseado num modelo de linguagem em tarefas de preferência entre respostas e verificação factual baseada em evidências; depois, usa a confiança para encaminhar os casos incertos. Um segundo estudo encontra poucos benefícios desse encaminhamento em rubricas com classificações graduadas, pois os modelos de contingência repetem frequentemente os erros confiantes do Jev. Um terceiro benchmark médico indica exatidão semelhante em perguntas sobre resumos de investigação e diferenças consideráveis nos casos de diagnóstico mais difíceis.

A conclusão prática é mais limitada do que «a IA pode avaliar a IA». O Jev poderá ser um avaliador rápido de primeira passagem numa tarefa bem definida, mas as evidências não estabelecem um avaliador fiável para todos os tipos de resposta. O encaminhamento com base na confiança só ajuda depois de uma equipa verificar, com exemplos próprios, o que essa confiança permite prever.

## O que significa um modelo atuar como juiz

Um avaliador recebe uma ou mais saídas de modelos e devolve uma pontuação ou decisão segundo determinada regra. Pode escolher qual de duas respostas segue melhor uma instrução, decidir se uma afirmação é sustentada pelos documentos fornecidos, avaliar uma resposta com base numa rubrica ou selecionar a opção correta num caso médico de escolha múltipla. Estas tarefas impõem exigências diferentes ao avaliador.

O Jev é o modelo de decisão alojado da TypeSafe. A sua API aceita entradas estruturadas e um tipo de resposta permitido, e depois devolve uma escolha ou pontuação com probabilidades para os rótulos permitidos. A interface permite integrar uma tarefa num software que espera um resultado dentro de um conjunto limitado de opções. No entanto, uma probabilidade é uma estimativa do modelo; não verifica, por si só, a resposta subjacente. A documentação da TypeSafe descreve a interface, enquanto as comparações de investigação abaixo avaliam o desempenho em conjuntos de teste específicos.

O [estudo JEV-as-a-Judge](https://arxiv.org/abs/2609.26550v2), revisto a 27 de setembro, compara o Jev 1.13 com 16 avaliadores generativos e modelos de recompensa. O [estudo de avaliação por rubricas](https://arxiv.org/abs/2609.29769v1), publicado a 24 de setembro, compara o Jev com três modelos de linguagem de menor custo. O [benchmark médico](https://arxiv.org/abs/2609.34024v1), publicado a 27 de setembro, compara o Jev 1.13 com o GPT-6 Sol em duas configurações de raciocínio. Os três são pré-publicações. Nenhum é um estudo de implantação clínica e nenhum foi revisto por pares.

## Próximo em alguns veredictos, mas mais fraco no raciocínio

O primeiro artigo avalia 5 172 decisões em pares de preferência, factualidade fundamentada em evidências e verificações da resposta final; depois, acrescenta testes de seguimento e dois estudos de encaminhamento com dados reservados. As principais pontuações públicas do Jev foram 92,5% numa amostra de 1 500 pares de preferência do RewardBench, 78,6% em 350 pares do JudgeBench e 87,3% em 3 000 respostas do HaluEval avaliadas com base em evidências. Nessas tarefas, o comparador GPT-6 Astra mais forte obteve, respetivamente, 92,5%, 93,1% e 88,4%. O artigo indica um custo de 0,044 USD por 1 000 avaliações básicas e uma latência mediana de 0,15 segundos para o Jev no painel de medição; nas condições do estudo, o GPT-6 Astra custou 12,182 USD e teve uma latência de 1,89 segundos.

Estas médias ocultam o limite identificado pelos autores. O Jev ficou a cerca de dois pontos do GPT-6 em qualidade de conversa, recusas por motivos de segurança e factualidade fundamentada em evidências. Ficou atrás em tarefas que exigiam derivar ou verificar um resultado: 14,3 pontos em matemática e 12,9 em programação, com uma diferença de 27,6 pontos em problemas de lógica. No conjunto de correção objetiva do JudgeBench, o Jev obteve 78,6%, contra 93,1% do GPT-6. Numa adjudicação cega de casos contestados num subconjunto de 990 itens, os avaliadores humanos concordaram com o GPT-6 em 57 dos 69 itens contestados do JudgeBench e com o Jev em apenas um. A adjudicação foi seletiva e limitada, mas sugere que a diferença não se devia apenas aos rótulos do benchmark.

Neste estudo, «avaliador» significava escolher entre duas respostas geradas ou decidir se uma única resposta era sustentada ou correta perante uma referência declarada. Os autores deram deliberadamente aos avaliadores generativos o mesmo formato restrito de decisão e probabilidade usado pelo Jev, sem justificações. Portanto, a comparação incide nos veredictos segundo essas regras, não em qual avaliador consegue explicar o seu raciocínio a uma pessoa.

## O encaminhamento com base na confiança funciona quando os erros diferem

Uma cascata utiliza primeiro um avaliador mais barato e envia alguns casos para um modelo de contingência mais caro. No primeiro estudo, a regra aceitava o veredicto do Jev quando a probabilidade máxima atribuída a um rótulo era de pelo menos 0,9 e encaminhava os casos com confiança inferior. Em 1 610 pares de preferência reservados, a cascata, que testou as duas ordens de apresentação das respostas, encaminhou 31,5% dos casos, obteve 93,4% contra 92,5% do GPT-6 e custou 41% do valor cobrado pelo GPT-6. Num teste ao vivo predefinido com 570 pares reservados de duas novas tarefas de correção, o Jev sozinho ficou 14 pontos atrás do GPT-6; a cascata igualou a exatidão do GPT-6, encaminhando 74% dos casos e poupando cerca de um quarto do custo.

Este resultado depende de uma condição específica: os casos que deixam o Jev em dúvida têm de conter erros que o modelo de contingência consiga corrigir. Os autores concluíram que o encaminhamento com base na confiança perdeu eficácia em pares adversariais de estilo e falhou em textos sem referência, nos quais todos os avaliadores testados tiveram resultados próximos do acaso, embora muitas vezes apresentassem elevada confiança. O estudo também concluiu que calcular a média das decisões para as duas ordens de apresentação reduziu os efeitos de posição. Os limiares foram escolhidos com exemplos locais rotulados; o artigo recomenda definir o limiar de confiança com dados locais e verificá-lo num conjunto de dados reservado.

O estudo separado sobre rubricas avalia pontuações por critério em nove painéis derivados de sete benchmarks, num total de 5 003 pares de itens e critérios. Dois painéis eram binários; sete usavam escalas ordenadas de classificação. Os quatro avaliadores receberam o mesmo texto para cada critério, e os autores fixaram as rubricas antes da avaliação. Em oito das 27 comparações aos pares, o intervalo de confiança de 95% excluiu a ausência de diferença na exatidão; após a correção para comparações múltiplas, restaram quatro. Algumas outras comparações cumpriram a margem de equivalência definida no artigo, enquanto muitas eram demasiado imprecisas para demonstrar diferença ou equivalência. O Jev teve melhor desempenho relativo nos critérios binários. Nos painéis com classificação graduada, nunca foi o melhor avaliador comparável, e todos os avaliadores tenderam a atribuir notas inferiores às dos avaliadores humanos.

As poupanças de custo e tempo foram grandes neste estudo. O Jev custou cerca de seis cêntimos nos nove painéis; os três avaliadores baseados em modelos de linguagem custaram entre 29 e 325 vezes mais e demoraram entre 30 e 220 vezes mais. Ainda assim, a confiança do Jev não produziu uma cascata robusta. Na maioria dos painéis, a confiança ajudou a ordenar os erros, mas os modelos de contingência repetiram quase todos os erros em que o Jev estava mais confiante. Com limiares ajustados por validação cruzada, a cascata melhorou, em média, no máximo 1,5 pontos percentuais face ao melhor avaliador individual; teve desempenho inferior ao desse avaliador em seis dos nove painéis. Esta reprodução utilizou veredictos registados, não uma implantação prospetiva ao vivo.

O contraste entre os dois artigos é instrutivo. Em comparações entre pares de respostas, o primeiro estudo encontrou uma divisão útil entre os erros do Jev com baixa confiança e as capacidades de um modelo de contingência mais forte. Na avaliação por critérios, o modelo de contingência cometia frequentemente os mesmos erros, pelo que o encaminhamento aumentava o custo sem os corrigir significativamente. Por si só, o sinal de confiança do modelo não diz à equipa se outro modelo irá apresentar uma discordância útil.

## Os resultados médicos de escolha múltipla dependem da dificuldade da tarefa

O artigo médico avalia o Jev em quatro conjuntos de dados existentes: 1 373 questões de exame do MetaMedQA, 500 perguntas do PubMedQA respondidas com base em resumos de investigação, 915 casos de escolha múltipla do DiagnosisArena e 34 desafios clínicos do NEJM com diagnóstico final publicado. A comparação foi feita com o GPT-6 Sol, com raciocínio médio e sem raciocínio. Foram enviados 8 469 pedidos aos modelos, e todos devolveram uma resposta estruturada válida.

No PubMedQA, o Jev e o GPT-6 Sol com raciocínio médio obtiveram 78,4% e 78,2%. No MetaMedQA, o Jev obteve 74,8%, contra 82,7%; no DiagnosisArena, 59,8%, contra 82,4%; e nos 34 casos do NEJM, 61,8%, contra 82,4%. O GPT-6 sem raciocínio também apresentou estimativas pontuais mais elevadas nos dois conjuntos de casos mais difíceis. A estimativa baseada nos 34 casos do NEJM é imprecisa, e a comparação principal deixou de ser estatisticamente significativa após a correção para comparações múltiplas. A diferença muito maior no DiagnosisArena manteve-se sem raciocínio explícito.

Este teste avalia a escolha entre opções fornecidas, não a elaboração de um diagnóstico diferencial nem o tratamento de doentes. O artigo não relata a adjudicação das respostas do benchmark por médicos. Indica que as imagens do NEJM foram apresentadas aos modelos como legendas e que os casos mais difíceis do DiagnosisArena foram filtrados com outros modelos de linguagem. Os autores consideram os resultados preliminares e afirmam que ainda faltam replicação independente, adjudicação clínica das respostas de referência e verificações de estabilidade entre execuções. O artigo afirma explicitamente que os resultados não devem orientar cuidados clínicos.

Os limiares de probabilidade tiveram valor desigual. No MetaMedQA, 52,9% das escolhas do Jev tiveram uma confiança de pelo menos 0,9, e a exatidão dessas escolhas foi de 93,4%. Com uma cobertura semelhante, o GPT-6 foi tão ou mais exato. No DiagnosisArena, a ordenação das probabilidades do Jev foi fraca: com o mesmo limiar de 0,9, foram aceites apenas 17,3% dos itens, e uma em cada quatro respostas aceites continuou errada. Em todos os benchmarks, a probabilidade média atribuída pelos modelos à opção escolhida foi superior à respetiva exatidão. Nesta amostra, uma pontuação elevada não significava certeza.

## O que as equipas podem concluir dos estudos

Em conjunto, os artigos justificam testar o Jev como avaliador específico para uma tarefa, sobretudo quando o veredicto pode ser obtido do texto fornecido ou verificado com base em evidências. Não justificam tratar o campo de confiança como um interruptor de segurança universal. Os resultados variaram entre tarefas, e o estudo de rubricas mostra por que é preciso avaliar se os erros do modelo de contingência são independentes, além de comparar a sua exatidão bruta.

Uma equipa que considere este método precisa de uma amostra representativa e rotulada das suas próprias tarefas. Deve definir o que conta como decisão correta, incluir exemplos difíceis e enganadores, comparar os resultados com uma revisão humana ou outra referência defensável e, em seguida, medir as taxas de erro e até que ponto a confiança distingue decisões corretas das incorretas. Numa cascata, deve também registar se o modelo de contingência corrige efetivamente os erros da primeira etapa, quantos casos são encaminhados e qual é o custo e o atraso resultantes. Um conjunto de teste reservado pode revelar se o limiar se mantém para além dos exemplos usados para o escolher.

Estas são implicações práticas dos estudos, não um processo testado pela BIG CHANGE. Não chamámos a API do Jev nem executámos um benchmark local. A [documentação da API](https://api.typesafe.ai/docs) da TypeSafe descreve pedidos estruturados, tipos de resposta permitidos e a descoberta de modelos; não comprova de forma independente a exatidão nas tarefas de uma equipa. O acesso ao produto, os preços e os modelos podem mudar; por isso, as equipas devem consultar a documentação atual quando planearem um teste.

Por enquanto, o Jev parece ser um candidato a avaliador inicial quando a tarefa é restrita, os rótulos são claros e uma avaliação local mostra que o encaminhamento com base na confiança encaminha eficazmente os erros. Quando a avaliação exige raciocínio mais profundo, depende de convenções ocultas dos avaliadores ou vários modelos cometem os mesmos erros, os estudos dão às equipas motivos para manter a revisão humana ou outra verificação validada no processo.

## A grande mudança

As novas avaliações do Jev mudam a pergunta: em vez de saber se um modelo de decisão consegue produzir um veredicto barato, importa saber em que situações esse veredicto é suficientemente útil para ser aceite. A resposta depende da tarefa: o encaminhamento com base na confiança melhorou uma cascata de avaliação por pares com dados reservados, enquanto um estudo separado de rubricas encontrou poucos ganhos devido à sobreposição de erros. Os resultados médicos de escolha múltipla também variaram significativamente com a dificuldade da tarefa. Para as equipas de IA, o próximo passo é criar um conjunto de validação local que verifique em simultâneo a exatidão, a confiança e o comportamento do modelo de contingência.

## Fontes e leituras adicionais

- [JEV-as-a-Judge: Aceitar quando houver confiança, encaminhar quando houver dúvida](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan e Rema Padman, versão 2, datada de 27 de setembro de 2026. Pré-publicação que compara o Jev com 16 avaliadores, inclui adjudicação humana às cegas e testes de encaminhamento com base na confiança em dados reservados.
- [Jev vs. modelos de linguagem como avaliadores de rubricas: mais barato, mais rápido e errado nos mesmos casos](https://arxiv.org/abs/2609.29769v1), Delip Rao e Chris Callison-Burch, 24 de setembro de 2026. Pré-publicação que avalia decisões binárias e classificações graduadas por critério em nove painéis de benchmark.
- [Jev na medicina: uma avaliação de benchmark. Resultados preliminares.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García e Beatriz Merino-Barbancho, 27 de setembro de 2026. Comparação preliminar em quatro conjuntos de dados médicos de escolha múltipla; não é um estudo clínico.
- [Documentação da API da TypeSafe](https://api.typesafe.ai/docs), referência oficial à interface estruturada de pedidos e respostas do Jev. A documentação descreve o comportamento do produto, não uma avaliação independente.

## Sources

- [JEV-as-a-Judge: Aceitar quando houver confiança, encaminhar quando houver dúvida (v2)](https://arxiv.org/abs/2609.26550v2) — Pré-publicação principal, submetida em 22 de setembro e revista em 27 de setembro. Comparou o Jev 1.13 com 16 avaliadores em tarefas de preferência, factualidade fundamentada em evidências e respostas finais; inclui adjudicação seletiva às cegas, análises offline congeladas de cascatas e dois testes ao vivo predefinidos com tarefas reservadas. Não foi revista por pares nem é um estudo de implantação; as limitações de equivalência computacional, adjudicação seletiva, abrangência das tarefas, custo e tempo estão registadas em SOURCE-AUDIT.md.
- [Jev vs. modelos de linguagem como avaliadores de rubricas: mais barato, mais rápido e errado nos mesmos casos (v1)](https://arxiv.org/abs/2609.29769v1) — Pré-publicação principal que compara o Jev com três modelos de linguagem da categoria flash em nove painéis de benchmark e 5 003 pares de itens e critérios. Os textos dos critérios são iguais; dois painéis são binários e sete usam classificações graduadas. Identifica erros confiantes correlacionados e análises de encaminhamento baseadas sobretudo na reprodução dos resultados. Não foi revista por pares; muitas comparações são estatisticamente inconclusivas, e os resultados limitam-se às rubricas, aos painéis e às condições de serviço escolhidos.
- [Jev na medicina: uma avaliação de benchmark. Resultados preliminares. (v1)](https://arxiv.org/abs/2609.34024v1) — Pré-publicação preliminar que compara o Jev 1.13 com o GPT-6 Sol em quatro benchmarks médicos de escolha múltipla. Inclui exatidão, calibração e previsão seletiva, abstenção, latência e custo. Não houve implantação clínica nem adjudicação por médicos; os autores afirmam que a replicação independente e a verificação dos resultados estão pendentes e desaconselham a utilização em cuidados clínicos.
- [Documentação da API da TypeSafe](https://api.typesafe.ai/docs) — Documentação oficial da OpenAPI consultada a 29 de setembro de 2026. Apresenta esquemas estruturados de pedidos e respostas, o endpoint system-one e a descoberta de modelos. Sustenta apenas a descrição da interface, não alegações independentes de desempenho. A disponibilidade do produto e os preços podem mudar.
- [Vídeo do Instagram Dd3wdNKxg5J encaminhado pelo responsável](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Usado apenas como pista para a pauta: não foi possível obter nem transcrever o vídeo. A legenda e os metadados não são usados como evidência; nenhuma afirmação é atribuída às imagens.