Três novos preprints avaliam o Jev como avaliador de maneiras diferentes. Um o considera próximo de um juiz forte baseado em modelo de linguagem em tarefas de preferência entre respostas e verificação factual baseada em evidências; em seguida, usa a confiança para encaminhar casos incertos. Um segundo encontra pouco benefício nesse encaminhamento em rubricas com notas graduadas, pois os modelos de contingência frequentemente repetem os erros confiantes do Jev. Um terceiro benchmark médico relata acurácia semelhante em perguntas sobre resumos de pesquisa e diferenças consideráveis em casos de diagnóstico mais difíceis.

A resposta prática é mais restrita do que “a IA pode avaliar a IA”. O Jev pode ser um juiz rápido de primeira etapa para uma tarefa bem definida, mas as evidências não estabelecem um juiz confiável para todos os tipos de resposta. O encaminhamento baseado em confiança só pode ajudar depois que uma equipe verifica, com exemplos próprios, o que essa confiança prevê.

O que significa um modelo atuar como juiz

Um avaliador recebe uma ou mais respostas de modelos e retorna uma pontuação ou decisão segundo alguma regra. Um juiz pode escolher qual de duas respostas segue melhor uma instrução, decidir se uma afirmação é sustentada pelos documentos fornecidos, avaliar uma resposta com base em uma rubrica ou selecionar a opção correta em um caso médico de múltipla escolha. Essas tarefas impõem exigências diferentes ao avaliador.

O Jev é o modelo de decisão hospedado da TypeSafe. Sua API aceita entradas estruturadas e um tipo de resposta permitido, depois retorna uma escolha ou pontuação com probabilidades para os rótulos aceitos. A interface pode integrar uma tarefa a um software que espera um resultado limitado a opções predefinidas. No entanto, uma probabilidade é uma estimativa do modelo; não verifica por conta própria se a resposta subjacente está correta. A documentação da TypeSafe descreve a interface, enquanto as comparações de pesquisa abaixo avaliam o desempenho em conjuntos de teste específicos.

O estudo JEV-as-a-Judge, revisado em 27 de setembro, compara o Jev 1.13 com 16 juízes generativos e modelos de recompensa. O estudo de juiz por rubrica, publicado em 24 de setembro, compara o Jev com três modelos de linguagem mais baratos. O benchmark médico, publicado em 27 de setembro, compara o Jev 1.13 com o GPT-6 Sol em duas configurações de raciocínio. Os três são preprints. Nenhum é um estudo de implantação clínica, e nenhum passou por revisão por pares.

Próximo em alguns vereditos, mais fraco em raciocínio

O primeiro artigo avalia 5.172 julgamentos em pares de preferência, factualidade fundamentada em evidências e verificações de resposta final; depois, acrescenta testes complementares e dois estudos de encaminhamento com dados reservados. As principais pontuações públicas do Jev foram 92,5% em uma amostra de 1.500 pares de preferência do RewardBench, 78,6% em 350 pares do JudgeBench e 87,3% em 3.000 respostas do HaluEval avaliadas com base em evidências. Nessas tarefas, o comparador GPT-6 Astra mais forte obteve, respectivamente, 92,5%, 93,1% e 88,4%. O artigo informa custo de US$ 0,044 por mil julgamentos básicos e latência mediana de 0,15 segundo para o Jev em seu painel de medição; sob as condições do estudo, o GPT-6 Astra custou US$ 12,182 e levou 1,89 segundo.

Essas médias ocultam o limite encontrado pelos autores. O Jev ficou a cerca de dois pontos do GPT-6 em qualidade de conversa, recusas de segurança e factualidade fundamentada em evidências. Ficou atrás em tarefas que exigiam derivar ou verificar um resultado: 14,3 pontos em matemática e 12,9 em programação, com uma diferença de 27,6 pontos em problemas de lógica. No conjunto de correção objetiva do JudgeBench, o Jev marcou 78,6%, contra 93,1% do GPT-6. Na adjudicação às cegas de casos contestados em um subconjunto de 990 itens, os avaliadores humanos concordaram com o GPT-6 em 57 dos 69 itens contestados do JudgeBench e com o Jev em um. A adjudicação foi seletiva e limitada, mas sugere que a diferença não se devia apenas aos rótulos do benchmark.

Nesse estudo, “juiz” significava escolher entre duas respostas geradas ou decidir se uma única resposta era sustentada ou correta diante de uma referência declarada. Os autores deram deliberadamente aos juízes generativos o mesmo formato restrito de decisão e probabilidade usado pelo Jev, sem justificativas. Portanto, a comparação trata dos vereditos dentro dessas regras, não de qual juiz consegue explicar seu raciocínio a uma pessoa.

O encaminhamento por confiança funciona quando os erros diferem

Uma cascata usa um juiz inicial mais barato e envia alguns casos a um modelo de contingência mais caro. No primeiro estudo, a regra aceitava o veredito do Jev quando a probabilidade máxima para um rótulo era de pelo menos 0,9 e encaminhava os casos com confiança menor. Em 1.610 pares de preferência reservados, a cascata, considerando as duas ordens de apresentação das respostas, encaminhou 31,5% dos casos, marcou 93,4% contra 92,5% do GPT-6 e custou 41% do valor cobrado pelo GPT-6. Em um teste ao vivo predefinido com 570 pares reservados de duas novas tarefas de correção, o Jev sozinho ficou 14 pontos atrás do GPT-6; a cascata igualou a acurácia do GPT-6, encaminhando 74% dos casos e economizando cerca de um quarto do custo.

Esse resultado depende de uma condição específica: os casos que deixam o Jev em dúvida precisam conter erros que o modelo de contingência consiga corrigir. Os autores descobriram que o encaminhamento por confiança perdeu eficácia em pares adversariais de estilo e falhou em textos sem referência, nos quais todos os juízes testados ficaram perto do acaso, embora muitas vezes demonstrassem confiança. O estudo também constatou que calcular a média das decisões nos dois ordenamentos das respostas reduziu efeitos de posição. Os limiares foram escolhidos com exemplos locais rotulados; o artigo recomenda usar um limite inferior de confiança e fazer uma verificação com dados reservados.

O estudo separado sobre rubricas avalia pontuações por critério em nove painéis derivados de sete benchmarks, totalizando 5.003 pares de item e critério. Dois painéis eram binários; sete usavam escalas ordenadas de notas. Os quatro juízes receberam o mesmo texto para cada critério, e os autores fixaram as rubricas antes da avaliação. Em oito das 27 comparações pareadas, o intervalo de confiança de 95% excluiu a ausência de diferença na acurácia; após a correção para comparações múltiplas, restaram quatro. Algumas outras comparações atenderam à margem de equivalência do artigo, enquanto muitas eram imprecisas demais para demonstrar diferença ou equivalência. O Jev se saiu melhor em relação aos demais nos critérios binários. Nos painéis graduados, nunca foi o melhor juiz comparável, e todos os juízes tenderam a dar notas mais baixas do que os avaliadores humanos.

Nesse contexto, as economias de custo e tempo foram grandes. O Jev custou cerca de seis centavos nos nove painéis; os três juízes baseados em modelos de linguagem custaram de 29 a 325 vezes mais e levaram de 30 a 220 vezes mais tempo. Ainda assim, a confiança do Jev não produziu uma cascata robusta. Na maioria dos painéis, a confiança ajudou a ordenar os erros, mas os modelos de contingência repetiram quase todos os erros mais confiantes do Jev. Com limiares ajustados por validação cruzada, a cascata melhorou em no máximo 1,5 ponto percentual, em média, em relação ao melhor juiz individual; teve desempenho inferior ao desse juiz em seis dos nove painéis. Essa reprodução usou vereditos registrados, não uma implantação prospectiva ao vivo.

O contraste entre os dois artigos é instrutivo. Em comparações pareadas de respostas, o primeiro estudo encontrou uma divisão útil entre erros do Jev com baixa confiança e os recursos de um modelo de contingência mais forte. Na avaliação por critérios, o modelo de contingência frequentemente cometia os mesmos erros, de modo que o encaminhamento aumentava o custo sem corrigi-los muito. O sinal de confiança do modelo, por si só, não diz à equipe se outro modelo vai oferecer uma discordância produtiva.

Resultados médicos de múltipla escolha dependem da dificuldade da tarefa

O artigo médico avalia o Jev em quatro conjuntos de dados existentes: 1.373 questões de prova do MetaMedQA, 500 perguntas do PubMedQA respondidas com base em resumos de pesquisa, 915 casos de múltipla escolha do DiagnosisArena e 34 desafios clínicos do NEJM com diagnóstico final publicado. A comparação foi com o GPT-6 Sol, tanto com raciocínio médio quanto sem raciocínio. Houve 8.469 solicitações aos modelos, e todas retornaram uma resposta estruturada válida.

No PubMedQA, o Jev e o GPT-6 Sol com raciocínio médio marcaram 78,4% e 78,2%. No MetaMedQA, o Jev marcou 74,8%, contra 82,7%; no DiagnosisArena, 59,8%, contra 82,4%; e nos 34 casos do NEJM, 61,8%, contra 82,4%. O GPT-6 sem raciocínio também apresentou estimativas pontuais maiores nos dois conjuntos de casos mais difíceis. A estimativa baseada nos 34 casos do NEJM é imprecisa, e sua comparação principal deixou de ser estatisticamente significativa após a correção para comparações múltiplas. A diferença bem maior no DiagnosisArena permaneceu sem raciocínio explícito.

Esse teste avalia a escolha entre opções fornecidas, não a elaboração de um diagnóstico diferencial nem o tratamento de pacientes. O artigo não relata adjudicação das respostas do benchmark por médicos. Informa que as imagens do NEJM foram apresentadas aos modelos como legendas e que os casos desafiadores do DiagnosisArena foram filtrados usando outros modelos de linguagem. Os autores consideram os resultados preliminares e dizem que ainda faltam replicação independente, adjudicação clínica das respostas de referência e verificações de estabilidade entre execuções. O artigo afirma explicitamente que os resultados não devem orientar cuidados clínicos.

Os limiares de probabilidade tiveram valor desigual. No MetaMedQA, 52,9% das escolhas do Jev tiveram confiança de pelo menos 0,9, e a acurácia dessas escolhas foi de 93,4%. Com cobertura semelhante, o GPT-6 foi tão preciso quanto ou mais preciso. No DiagnosisArena, a ordenação das probabilidades do Jev foi fraca: com o mesmo limiar de 0,9, apenas 17,3% dos itens foram aceitos, e uma em cada quatro respostas aceitas continuou errada. Em todos os benchmarks, a probabilidade média atribuída pelos modelos à opção escolhida foi maior que a acurácia. Nesta amostra, uma pontuação alta não significava certeza.

O que as equipes podem concluir dos estudos

Em conjunto, os artigos justificam testar o Jev como avaliador específico para uma tarefa, sobretudo quando um veredito pode ser obtido do texto fornecido ou conferido com base em evidências. Eles não justificam tratar o campo de confiança como um interruptor de segurança universal. Os resultados variaram entre as tarefas, e o estudo de rubricas mostra por que é preciso avaliar se os erros do modelo de contingência são independentes, além de comparar sua acurácia bruta.

Uma equipe que considere esse padrão precisa de uma amostra representativa e rotulada de suas próprias tarefas. Deve definir o que conta como decisão correta, incluir exemplos difíceis e enganosos, comparar os resultados com revisão humana ou outra referência defensável e, depois, medir as taxas de erro e o quanto a confiança distingue decisões corretas de incorretas. Em uma cascata, também deve registrar se o modelo de contingência realmente corrige os erros da primeira etapa, quantos casos são encaminhados e qual é o custo e a demora resultantes. Um conjunto de teste separado pode mostrar se o limiar se aplica além dos exemplos usados para escolhê-lo.

Essas são implicações práticas dos estudos, não um processo testado pela BIG CHANGE. Não chamamos a API do Jev nem executamos um benchmark local. A documentação da API da TypeSafe descreve solicitações estruturadas, tipos de resposta permitidos e a descoberta de modelos; não comprova de forma independente a acurácia nas tarefas de uma equipe. O acesso ao produto, os preços e os modelos podem mudar; por isso, as equipes devem consultar a documentação atual ao planejar um teste.

Por enquanto, o Jev parece ser um candidato a juiz inicial quando a tarefa é restrita, os rótulos são claros e uma avaliação local mostra que o encaminhamento por confiança direciona os erros de forma eficaz. Quando o julgamento exige raciocínio mais profundo, a avaliação depende de convenções ocultas dos avaliadores ou vários modelos cometem os mesmos erros, os estudos dão às equipes motivos para manter a revisão humana ou outra verificação validada no processo.

A grande mudança

As novas avaliações do Jev deslocam a pergunta: em vez de saber se um modelo de decisão consegue dar um veredito barato, é preciso saber quando esse veredito é útil o suficiente para ser mantido. A resposta depende da tarefa: o encaminhamento por confiança melhorou uma cascata de avaliação pareada com dados reservados, enquanto um estudo separado de rubricas encontrou pouco ganho porque os erros se sobrepunham. Os resultados médicos de múltipla escolha também variaram bastante conforme a dificuldade da tarefa. Para equipes de IA, o próximo passo é criar um conjunto de validação local que verifique em conjunto a correção, a confiança e o comportamento do modelo de contingência.

Fontes e leituras complementares