Trois nouvelles prépublications évaluent Jev dans des tâches de jugement différentes. L’une constate que ses résultats se rapprochent de ceux d’un puissant modèle de langage utilisé comme juge pour comparer des réponses et vérifier la factualité à partir de preuves, puis utilise son niveau de confiance pour orienter les cas incertains. Une deuxième conclut que ce routage apporte peu pour les grilles de notation, car les modèles de repli répètent souvent les erreurs commises avec assurance par Jev. Une troisième étude comparative en médecine relève une précision similaire sur des questions fondées sur des résumés de recherche, mais des écarts importants pour les cas diagnostiques plus difficiles.

La conclusion pratique est plus limitée que « l’IA peut juger l’IA ». Jev peut servir de juge de premier niveau rapide pour une tâche bien définie, mais les données ne permettent pas d’établir qu’il existe un arbitre fiable pour tous les types de réponses. Le niveau de confiance peut aider à orienter le travail, mais seulement après que l’équipe a vérifié ce qu’il prédit sur ses propres exemples.

Ce que signifie « juger » pour un modèle

Un évaluateur reçoit une ou plusieurs sorties de modèles et renvoie une note ou un verdict selon une règle donnée. Il peut choisir laquelle de deux réponses respecte le mieux une consigne, déterminer si une affirmation est étayée par des documents fournis, noter une réponse à l’aide d’une grille ou sélectionner la bonne option dans un questionnaire médical à choix multiples. Ces tâches imposent des exigences différentes à l’évaluateur.

Jev est le modèle de décision hébergé de TypeSafe. Son API accepte une entrée structurée et un type de réponse autorisé, puis renvoie un choix ou une note accompagnée de probabilités pour les étiquettes permises. Cette interface permet d’intégrer une tâche à un logiciel qui attend un résultat limité à des choix prédéfinis. Une probabilité reste toutefois une estimation du modèle : elle ne vérifie pas indépendamment la réponse sous-jacente. La documentation de TypeSafe décrit l’interface ; les comparaisons de recherche ci-dessous évaluent les performances sur des jeux de test précis.

L’étude JEV-as-a-Judge, révisée le 27 septembre, compare Jev 1.13 à 16 arbitres génératifs et modèles de récompense. L’étude Jev vs. LLMs as Rubric Judges, publiée le 24 septembre, compare Jev à trois modèles de langage moins coûteux. Le test comparatif médical, publié le 27 septembre, compare Jev 1.13 à GPT-6 Sol avec deux réglages de raisonnement. Les trois travaux sont des prépublications. Aucun ne porte sur un déploiement clinique et aucun n’a été évalué par les pairs.

Proche sur certains verdicts, moins bon en raisonnement

Le premier article évalue 5 172 jugements sur des paires de réponses à comparer, la factualité étayée par des preuves et la vérification de réponses finales, puis ajoute des tests de suivi et deux études de routage sur des données mises de côté. Les principaux résultats publics de Jev sont de 92,5 % sur un échantillon de 1 500 paires de préférence de RewardBench, de 78,6 % sur 350 paires de JudgeBench et de 87,3 % sur 3 000 réponses de HaluEval évaluées au regard des preuves. Sur ces tâches, le meilleur comparateur, GPT-6 Astra, obtient respectivement 92,5 %, 93,1 % et 88,4 %. L’article chiffre Jev à 0,044 $ pour 1 000 jugements de base et à 0,15 seconde de latence médiane dans son tableau de mesures ; GPT-6 Astra coûte 12,182 $ et affiche 1,89 seconde dans les conditions de l’étude.

Ces moyennes masquent la limite relevée par les auteurs. Jev se situe à environ deux points de GPT-6 pour la qualité conversationnelle, les refus de sécurité et la factualité étayée par des preuves. Il est moins performant sur les tâches qui exigent de déduire ou de vérifier un résultat : écart de 14,3 points en mathématiques, de 12,9 points en programmation et de 27,6 points sur les énigmes logiques. Sur le jeu JudgeBench consacré à l’exactitude objective, Jev obtient 78,6 %, contre 93,1 % pour GPT-6. Lors d’une adjudication à l’aveugle des cas contestés dans un sous-ensemble de 990 éléments, GPT-6 est préféré pour 57 des 69 éléments JudgeBench contestés, contre un seul pour Jev. Cette adjudication reste sélective et limitée, mais elle suggère que l’écart ne tient pas uniquement aux étiquettes du jeu de référence.

Ici, « juge » désigne le choix entre deux réponses générées ou la décision de déterminer si une réponse unique est étayée ou correcte au regard d’une référence donnée. Les auteurs ont délibérément imposé aux juges génératifs le même format contraint de verdict et de probabilité que celui de Jev, sans justification. La comparaison porte donc sur les verdicts rendus dans ce cadre, et non sur la capacité des juges à expliquer leur raisonnement à une personne.

Le routage par niveau de confiance fonctionne quand les erreurs diffèrent

Une cascade fait appel à un premier juge moins coûteux, puis transmet certains cas à un modèle de repli plus cher. Dans la première étude, la règle acceptait le verdict de Jev lorsque la probabilité maximale associée à une étiquette atteignait au moins 0,9 ; les cas moins certains étaient transmis. Sur 1 610 paires de préférence mises de côté, la cascade testée dans les deux ordres a transmis 31,5 % des cas, obtenu 93,4 % contre 92,5 % pour GPT-6 et coûté 41 % du tarif de GPT-6. Lors d’un test en conditions réelles préspécifié sur 570 paires mises de côté et issues de deux nouvelles tâches d’exactitude, Jev seul avait 14 points de retard sur GPT-6 ; la cascade a atteint la même précision que GPT-6 en transmettant 74 % des cas et en économisant environ un quart de son coût.

Ce résultat dépend d’une condition précise : les cas qui mettent Jev en doute doivent contenir des erreurs que le modèle de repli peut corriger. Les auteurs ont constaté que le routage par confiance était moins efficace sur des paires adversariales fondées sur le style et échouait sur de la prose sans référence, où tous les juges testés obtenaient des résultats proches du hasard tout en se montrant souvent sûrs d’eux. L’étude a également montré que la moyenne des décisions prises dans les deux ordres de présentation des réponses réduisait les effets de position. Les seuils ont été choisis à partir d’exemples étiquetés localement ; l’article recommande une approche fondée sur la borne inférieure de confiance et une vérification sur un jeu tenu à l’écart.

L’étude distincte sur les grilles évalue la notation de chaque critère sur neuf volets issus de sept jeux de référence, soit 5 003 paires élément-critère au total. Deux volets utilisaient des réponses binaires ; sept reposaient sur des échelles de notation ordonnées. Les quatre juges recevaient le même texte pour chaque critère, et les auteurs ont figé les grilles avant l’évaluation. Huit des 27 comparaisons par paires présentaient un intervalle de confiance à 95 % excluant l’absence de différence de précision ; il en restait quatre après correction pour comparaisons multiples. D’autres comparaisons respectaient la marge d’équivalence définie dans l’article, tandis que nombre d’entre elles étaient trop imprécises pour établir une différence ou une équivalence. Jev obtenait les meilleurs résultats relatifs sur les critères binaires. Sur les volets notés par échelle, il n’était jamais le meilleur juge parmi ceux comparés ; tous les juges avaient tendance à attribuer des notes inférieures à celles des évaluateurs humains.

Dans ce dispositif, les gains de coût et de vitesse étaient importants. Jev a coûté environ six centimes pour les neuf volets ; les trois juges fondés sur des modèles de langage coûtaient de 29 à 325 fois plus et prenaient de 30 à 220 fois plus de temps. Pourtant, le niveau de confiance de Jev ne permettait pas de construire une cascade efficace. Sur la plupart des volets, il permettait de classer les erreurs de Jev selon leur niveau de confiance, mais les modèles de repli répétaient presque toutes celles commises avec le plus d’assurance. Avec des seuils déterminés par validation croisée, une cascade ne dépassait en moyenne le meilleur juge seul que de 1,5 point de pourcentage au maximum ; elle faisait moins bien que ce juge sur six volets sur neuf. Cette réanalyse utilisait des verdicts enregistrés, et non un déploiement prospectif en conditions réelles.

Le contraste entre les deux articles est instructif. Pour comparer des réponses deux à deux, la première étude a trouvé une séparation utile entre les erreurs de Jev à faible niveau de confiance et les capacités d’un modèle de repli plus fort. Pour noter des critères, le modèle de repli partageait souvent les mêmes erreurs ; le transfert des cas ajoutait donc des coûts sans apporter beaucoup de corrections. À elle seule, la confiance du modèle ne permet pas de savoir si le désaccord d’un autre modèle aidera réellement à corriger les erreurs.

Les résultats médicaux à choix multiples varient selon la difficulté

L’article médical évalue Jev sur quatre jeux de données existants : 1 373 questions d’examen MetaMedQA, 500 questions PubMedQA auxquelles il faut répondre à partir de résumés de recherche, 915 cas à choix multiples de DiagnosisArena et 34 études de cas NEJM avec diagnostic final publié. Il compare Jev à GPT-6 Sol avec raisonnement moyen et sans raisonnement. Les modèles ont effectué 8 469 requêtes, et chacune a renvoyé une réponse structurée valide.

Sur PubMedQA, Jev et GPT-6 Sol avec raisonnement moyen obtiennent respectivement 78,4 % et 78,2 %. Sur MetaMedQA, Jev obtient 74,8 %, contre 82,7 % ; sur DiagnosisArena, 59,8 %, contre 82,4 % ; et sur les 34 cas NEJM, 61,8 %, contre 82,4 %. Sans raisonnement, GPT-6 affiche également de meilleures estimations ponctuelles sur les deux jeux de cas les plus difficiles. L’estimation sur les 34 cas NEJM manque de précision, et la comparaison principale n’est plus statistiquement significative après correction pour comparaisons multiples. L’écart bien plus important sur DiagnosisArena persiste sans raisonnement explicite.

Il s’agit de choisir parmi des options proposées, et non d’établir un diagnostic différentiel ou de soigner des patients. L’article ne rapporte aucune adjudication des réponses de référence par des cliniciens. Il précise que les images NEJM ont été fournies aux modèles sous forme de légendes, et que les cas difficiles de DiagnosisArena ont été filtrés à l’aide d’autres modèles de langage. Les auteurs qualifient les résultats de préliminaires et indiquent qu’une réplication indépendante, l’adjudication clinique des réponses de référence et des vérifications de stabilité d’une exécution à l’autre restent à faire. L’article précise explicitement que ces résultats ne doivent pas servir à guider les soins cliniques.

Les seuils de probabilité n’ont pas été également utiles partout. Sur MetaMedQA, 52,9 % des choix de Jev avaient un niveau de confiance d’au moins 0,9, et leur précision était de 93,4 %. À une couverture similaire, GPT-6 était au moins aussi précis. Sur DiagnosisArena, le classement des probabilités de Jev était peu fiable : au même seuil de 0,9, seuls 17,3 % des éléments étaient acceptés, et une réponse acceptée sur quatre restait fausse. Dans tous les jeux de référence, la probabilité moyenne associée à l’option choisie par les modèles dépassait leur précision. Dans cet échantillon, une note élevée ne signifiait pas la certitude.

Ce que les équipes peuvent retenir de ces études

Ensemble, les articles justifient d’évaluer Jev comme évaluateur pour une tâche précise, surtout lorsqu’un verdict peut être lu dans le texte fourni ou vérifié à l’aide de preuves. Ils ne justifient pas de traiter son indicateur de confiance comme un mécanisme universel de sécurité. Les résultats varient selon les tâches ; l’étude sur les grilles montre aussi pourquoi il faut évaluer l’indépendance des erreurs du modèle de repli, en plus de sa précision brute.

Une équipe qui envisage cette approche a besoin d’un échantillon représentatif et étiqueté de sa propre tâche. Elle doit définir ce qui constitue une décision correcte, inclure des exemples difficiles et trompeurs, comparer les résultats à une évaluation humaine ou à une autre référence défendable, puis mesurer les taux d’erreur et la capacité du niveau de confiance à distinguer les décisions correctes des incorrectes. Pour une cascade, elle doit aussi noter si le modèle de repli corrige réellement les erreurs du premier niveau, le nombre de cas transmis, ainsi que le coût et le délai qui en résultent. Un jeu de test réservé permet de vérifier si le seuil fonctionne au-delà des exemples qui ont servi à le choisir.

Ce sont des implications pratiques des études, et non une procédure testée de BIG CHANGE. Nous n’avons pas appelé l’API de Jev ni exécuté de test local. La documentation de l’API décrit les requêtes structurées, les types de réponse autorisés et la découverte de modèles ; elle n’établit pas indépendamment la précision du système sur les tâches d’une équipe. L’accès aux produits, les prix et les modèles peuvent évoluer ; les équipes devraient donc consulter la documentation à jour avant de planifier un essai.

Pour l’instant, Jev semble pouvoir servir de premier juge lorsque la tâche est étroite, les étiquettes sont claires et une évaluation locale montre que son niveau de confiance oriente efficacement les erreurs. Lorsque l’évaluation exige un raisonnement plus approfondi, que la notation dépend de conventions implicites des évaluateurs ou que plusieurs modèles commettent les mêmes erreurs, les études incitent les équipes à conserver une vérification humaine ou un autre contrôle validé.

Le grand changement

Les nouvelles évaluations de Jev déplacent la question : il ne s’agit plus de savoir si un modèle de décision peut rendre un verdict à bas coût, mais dans quels cas ce verdict est assez utile pour être conservé. La réponse dépend de la tâche : le routage par confiance a amélioré une cascade d’évaluation de paires testée sur des données mises de côté, tandis qu’une étude distincte sur les grilles n’a trouvé que peu de gains en raison du chevauchement des erreurs. Les résultats médicaux à choix multiples variaient eux aussi fortement selon la difficulté. Pour les équipes d’IA, l’étape suivante consiste à constituer un jeu de validation local qui évalue ensemble l’exactitude, le niveau de confiance et le comportement du modèle de repli.

Sources et lectures complémentaires