AI-translated from English; not yet reviewed by a fluent editor.

# 为代码仓库设置 Codex Cloud 环境

> 三篇预印本测试 Jev 作为 AI 答案评审器的表现。结果因偏好比较、评分量规和医疗任务而异；只有后备模型纠正 Jev 错误时，置信度路由才有帮助。

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

三篇新预印本以不同方式测试 Jev 作为评估器的表现。一篇发现，在答案偏好比较和基于证据的事实核查中，Jev 接近强大的语言模型评审器，随后用置信度将不确定案例转交处理。第二篇发现，在按评分量规打分时，这种路由几乎没有好处，因为后备模型经常重复 Jev 自信地犯下的错误。第三篇医疗基准测试报告称，在研究摘要问题上准确率相近，但在更难的诊断案例上差距明显。

实际结论比“AI 可以评判 AI”更有限。对于定义明确的任务，Jev 可能适合快速初筛，但现有证据并不能证明它能可靠评判所有类型的答案。只有团队先在自己的案例上核实置信度预测效果后，置信度才有助于分流工作。

## 模型评审意味着什么

评估器接收一个或多个模型输出，并按照某种规则给出分数或判断。评审器可以选择两个回答中哪个更符合提示词，判断某项说法是否得到所提供文档的支持，按评分量规给答案打分，或在医疗多选病例中选出正确选项。这些任务对评估器的要求各不相同。

Jev 是 TypeSafe 托管的决策模型。它的 API 接受结构化输入和允许的响应类型，然后返回一个选项或分数，以及各个许可标签对应的概率。这个接口适合需要有界结果的软件任务。不过，概率只是模型估计值，并不会独立核实底层答案。TypeSafe 的文档介绍了接口，下文的研究比较则评估了它在特定测试集上的表现。

《[JEV-as-a-Judge 研究](https://arxiv.org/abs/2609.26550v2)》，9 月 27 日修订，比较 Jev 1.13 与 16 个生成式模型及奖励模型评审器。《[评分量规评审研究](https://arxiv.org/abs/2609.29769v1)》，9 月 24 日发布，比较 Jev 与三个低成本语言模型。《[医疗基准测试](https://arxiv.org/abs/2609.34024v1)》，9 月 27 日发布，比较 Jev 1.13 与两种推理设置下的 GPT-6 Sol。三篇都是预印本，均非临床部署研究，也都未经同行评审。

## 部分判断接近，推理任务表现较弱

第一篇论文评估了 5,172 次判断，涵盖偏好比较、基于证据的事实性判断和最终答案核查，随后还进行了后续测试和两项留出路由研究。在主要公开基准中，Jev 在抽样的 1,500 个 RewardBench 偏好对上得分为 92.5%，在 350 个 JudgeBench 答案对上为 78.6%，在依据证据评估的 3,000 个 HaluEval 答案上为 87.3%。在这些任务中，最强的 GPT-6 Astra 对照模型分别得分 92.5%、93.1% 和 88.4%。论文报告，Jev 每 1,000 次基础判断收费 0.044 美元，计时面板显示其中位延迟为 0.15 秒；在该研究条件下，GPT-6 Astra 的费用为 12.182 美元，延迟为 1.89 秒。

这些平均值掩盖了作者发现的能力边界。在聊天质量、安全拒答和基于证据的事实性任务上，Jev 与 GPT-6 的差距约在 2 个百分点以内；在需要推导或核查结果的任务上，Jev 则落后 14.3 个百分点（数学）、12.9 个百分点（代码），逻辑谜题上的差距达到 27.6 个百分点。在 JudgeBench 的客观正确性子集中，Jev 得分为 78.6%，GPT-6 为 93.1%。研究者对 990 项子集中存在争议的案例进行盲法裁定，在 69 个有争议的 JudgeBench 项目中，57 项支持 GPT-6，仅 1 项支持 Jev。裁定范围有限且经过筛选，但这表明差距不只是基准标签的问题。

在这篇研究中，“评审”指的是在两个生成答案之间作出选择，或根据明确给出的参考资料判断单个答案是否有依据或正确。作者刻意让生成式评审器和 Jev 使用相同的受限格式输出判断及概率，不提供理由。因此，比较的是这种输出约定下的判断结果，而不是哪个评审器更能向人解释推理过程。

## 错误有差异时，置信度路由才有效

级联方案先使用成本较低的评审器，再把部分案例交给成本较高的后备模型处理。在第一项研究中，如果 Jev 最高标签概率至少为 0.9，系统就接受它的判断；置信度更低的案例则继续升级处理。在 1,610 个留出的偏好对上，双顺序级联升级了 31.5% 的案例，得分为 93.4%，高于 GPT-6 的 92.5%，费用为 GPT-6 的 41%。在一项预先设定的实时测试中，研究者使用了两个新的正确性任务中的 570 个留出案例：Jev 单独使用时落后 GPT-6 14 个百分点；级联方案的准确率与 GPT-6 相当，同时升级了 74% 的案例，费用节省约四分之一。

这个结果有一个具体前提：Jev 不确定的案例中必须存在后备模型能够纠正的错误。作者发现，在风格对抗性答案对上，置信度路由效果减弱；在没有参考资料的散文任务上则失效，因为所有受测评审器的表现都接近随机猜测，却经常显得很有把握。研究还发现，按两种答案顺序分别判断并对结果取平均，可以降低位置效应。阈值依据本地标注案例选取；论文建议使用置信度下界方法，并在留出数据上核验。

另一项评分量规研究考察了七个基准中抽取的九组面板，共计 5,003 个“项目—评分标准”组合。其中两组使用二元评分，七组使用有序等级量表。四个评审器看到相同的评分标准，作者在评估前固定了量规。27 组配对比较中，8 组的 95% 置信区间排除了准确率无差异；对多重比较进行校正后仅剩 4 组。其他一些比较符合论文设定的等效界限，但许多比较精度不足，无法确认存在差异或等效。与其他评审器相比，Jev 在二元标准上的表现最好；在等级评分面板中，它从未成为配对比较中的最佳评审器，而且所有评审器给出的分数普遍低于人工评分者。

在该设置中，价格和速度优势很大。Jev 完成九组面板的费用约为 6 美分；三个语言模型评审器的费用高出 29 至 325 倍，耗时则长 30 至 220 倍。然而，Jev 的置信度并未带来强有力的级联方案。在大多数面板上，置信度确实能把错误排出先后，但后备模型几乎重复了 Jev 最有把握时犯下的所有错误。使用交叉拟合阈值后，级联方案平均最多比最佳单一评审器提高 1.5 个百分点；在九组面板中的六组上，表现还不如该评审器。此项回放分析使用的是已记录的判断结果，而不是前瞻性的实时部署。

两篇论文的对照颇有启发。在成对答案比较中，第一项研究发现，Jev 的低置信度错误与更强后备模型的能力之间形成了有用的分工。在评分标准任务中，后备模型经常犯同样的错误，因此升级处理增加了成本，却很少纠正错误。仅凭模型的置信度信号，团队无法判断另一个模型能否提供有价值的不同意见。

## 医疗多选题结果取决于任务难度

医疗论文在四个现有数据集上评估 Jev：1,373 道 MetaMedQA 考试题、500 道依据研究摘要作答的 PubMedQA 题目、915 个 DiagnosisArena 多选病例，以及 34 个附有已发表最终诊断的 NEJM Case Challenges。论文将 Jev 与 GPT-6 Sol 进行比较，后者分别采用中等推理和不启用推理两种设置。模型共收到 8,469 次请求，每次都返回了有效的结构化答案。

在 PubMedQA 上，Jev 和启用中等推理的 GPT-6 Sol 得分分别为 78.4% 和 78.2%。在 MetaMedQA 上，Jev 得分为 74.8%，GPT-6 Sol 为 82.7%；在 DiagnosisArena 上分别为 59.8% 和 82.4%；在 34 个 NEJM 病例上分别为 61.8% 和 82.4%。在两个较难的病例数据集上，不启用推理的 GPT-6 点估计准确率也更高。NEJM 的 34 例估计精度不足；进行多重比较校正后，其主要比较不再具有统计显著性。DiagnosisArena 上大得多的差距则在未显式启用推理时仍然存在。

这项测试考查的是从给定选项中作答，而非提出鉴别诊断或治疗患者。论文没有报告由临床医生裁定基准答案的情况。作者指出，提供给模型的 NEJM 图像以文字说明代替，具有挑战性的 DiagnosisArena 病例则经过其他语言模型筛选。作者称这些发现是初步结果，并表示独立复现、由临床人员裁定参考答案以及检查多次运行的稳定性仍待完成。论文明确指出，不应将这些结果用于指导临床护理。

概率阈值的价值并不一致。在 MetaMedQA 上，Jev 有 52.9% 的选择置信度至少为 0.9，这些选择的准确率为 93.4%。在相近的覆盖率下，GPT-6 的准确率相同或更高。在 DiagnosisArena 上，Jev 的概率排序能力较弱：采用同样的 0.9 阈值时，仅接受了 17.3% 的项目，而每四个被接受的答案中仍有一个是错的。在每个基准中，模型所选选项的平均概率都高于实际准确率。在这组样本中，高分并不等于确定无误。

## 团队可以从这些研究中得到什么

综合来看，这些论文支持将 Jev 作为特定任务的评估器进行测试，尤其适用于可以从给定文本中作出判断，或可根据证据核查的任务。研究并不支持把其置信度字段当作通用安全开关。不同工作负载产生了不同结果，而评分量规研究说明，除了原始准确率，还必须评估后备模型的错误是否独立。

考虑采用这种模式的团队需要从自己的任务中抽取有代表性且带标签的样本。团队应明确何为正确判断，纳入困难和具有误导性的案例，将结果与人工审核或其他可靠参照进行比较，然后同时测量错误率以及置信度区分正确与错误判断的能力。对于级联方案，还应记录后备模型是否确实修正了第一阶段的错误、升级了多少案例，以及最终成本和延迟。保留的测试集可以检验阈值能否适用于选取阈值时未用过的案例。

这些是从研究中得出的实践启示，并非 BIG CHANGE 测试过的流程。我们没有调用 Jev API，也没有运行本地基准测试。TypeSafe 的[API 文档](https://api.typesafe.ai/docs)介绍了结构化请求、允许的答案类型和模型发现功能；它无法独立证明 Jev 在某个团队工作负载上的准确率。产品访问权限、价格和模型可能发生变化，团队规划试用时应查看当前文档。

目前，如果任务范围明确、标签清晰，并且本地评估显示置信度能有效分流错误，Jev 看起来适合作为候选的第一阶段评审器。如果判断需要更深入的推理、评分依赖不透明的评分者惯例，或者多个模型会犯相同错误，这些研究提示团队应保留人工审核或其他经过验证的检查环节。

## 重大变化

Jev 的新评估将问题从决策模型能否低成本给出判断，推进到何时值得采纳该判断。答案取决于任务：一项研究中的置信度路由提升了留出的成对评估级联效果，而另一项评分量规研究发现提升有限，因为错误彼此重叠。医疗多选题结果也随任务难度大幅变化。对于 AI 团队，下一步应建立本地验证集，同时检查正确性、置信度和后备模型的表现。

## 来源与延伸阅读

- [JEV-as-a-Judge：有把握时接受，不确定时升级](https://arxiv.org/abs/2609.26550v2)，Yubo Li、Yidi Miao、Ramayya Krishnan 和 Rema Padman 著，第二版，日期为 2026 年 9 月 27 日。预印本将 Jev 与 16 个评审器进行比较，包括盲法人工裁定和留出的置信度路由测试。
- [Jev 与 LLM 评分量规评审器对比：更便宜、更快，却在同样的地方出错](https://arxiv.org/abs/2609.29769v1)，Delip Rao 和 Chris Callison-Burch 著，2026 年 9 月 24 日。预印本在九组基准面板上评估逐项二元评分和等级评分量规判断。
- [Jev 医疗评估：一项基准测试（初步结果）](https://arxiv.org/abs/2609.34024v1)，Alfredo Madrid-García 和 Beatriz Merino-Barbancho 著，2026 年 9 月 27 日。对四个医疗多选题数据集进行的初步基准比较，并非临床研究。
- [TypeSafe API 文档](https://api.typesafe.ai/docs)，Jev 结构化请求和输出接口的官方参考资料。文档说明产品行为，不是独立评估。

## Sources

- [JEV-as-a-Judge：有把握时接受，不确定时升级（v2）](https://arxiv.org/abs/2609.26550v2) — 主要预印本，9 月 22 日提交并于 9 月 27 日修订。将 Jev 1.13 与 16 个评审器在偏好、基于证据的事实性及最终答案任务上进行比较；包含选择性盲法裁定、冻结的离线级联分析，以及两项预先设定的实时留出工作负载测试。未经同行评审，也不是部署研究；计算资源匹配、经筛选的裁定、工作负载范围、费用和计时方面的限制记录在 SOURCE-AUDIT.md。
- [Jev 与 LLM 评分量规评审器对比：更便宜、更快，却在同样的地方出错（v1）](https://arxiv.org/abs/2609.29769v1) — 主要预印本，将 Jev 与三个 Flash 级 LLM 在九组基准面板和 5,003 个评分量规项目对上进行比较。使用相同的评分标准文本，包含两组二元面板和七组等级面板。显示了相关的自信错误，并主要基于回放分析路由。未经同行评审；许多比较在统计上无法下结论，发现仅适用于所选量规、面板和服务条件。
- [Jev 医疗评估：一项基准测试（初步结果）（v1）](https://arxiv.org/abs/2609.34024v1) — 主要初步预印本，在四个医疗多选基准上比较 Jev 1.13 与 GPT-6 Sol。包含准确率、校准、选择性预测、弃答、延迟和费用。非临床部署研究，也没有临床医生裁定；作者表示独立复现和结果核验尚待进行，并建议不要用于临床护理。
- [TypeSafe API 文档](https://api.typesafe.ai/docs) — 2026 年 9 月 29 日查阅的官方 OpenAPI 文档，展示了结构化请求/响应架构、system-one 端点和模型发现功能。仅支持对接口的描述，不支持独立性能主张。产品可用性和价格可能变化。
- [Instagram Reel Dd3wdNKxg5J（任务交接线索）](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — 仅作任务线索：无法检索或转录该 Reel。未将说明文字和元数据用作证据，也没有将任何主张归因于视频画面。
