AI-translated from English; not yet reviewed by a fluent editor.

# Jev 的 AI 評審結果因任務和後備模型而異

> 三篇預印本以偏好比較、評分規準和醫療任務測試 Jev 作為 AI 答案評審器的表現。結果各不相同；只有後備模型能修正 Jev 的錯誤時，依信心程度分流才有幫助。

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

三篇新預印本以不同方式測試 Jev 作為評估器的表現。一篇發現，在答案偏好比較和依證據查核事實時，Jev 的表現接近強大的語言模型評審器，並利用信心程度將不確定的案例轉交其他模型處理。第二篇發現，在依評分規準評分時，這種分流幾乎沒有幫助，因為後備模型經常重複 Jev 很有把握卻判錯的案例。第三篇醫療基準研究發現，兩者回答研究摘要問題的準確率相近，但在較難的診斷案例上差距很大。

實際結論比「AI 可以評判 AI」更有限。若任務定義明確，Jev 可能適合作為快速初步評審器，但現有證據無法證明它能可靠評判各種答案。團隊必須先用自己的案例檢驗信心值能否預測錯誤，之後才能據此分流工作。

## 模型評審的意義

評估器會接收一個或多個模型輸出，並依某項規則給出分數或判定。評審器可能要從兩個回答中選出較符合提示的一個、判斷某項說法是否獲提供的文件支持、依評分規準評分，或在醫療選擇題中選出正確選項。這些任務對評估器的要求各不相同。

Jev 是 TypeSafe 託管的決策模型。它的 API 接收結構化輸入和允許的回覆類型，再從限定的標籤中回傳一個選項或分數，以及各標籤對應的機率。這種介面適合需要有限結果的軟體任務。不過，機率只是模型的估計值，不能獨立查證底層答案。TypeSafe 的文件說明介面；下文的研究比較則評估 Jev 在特定測試集上的表現。

《[JEV-as-a-Judge 研究](https://arxiv.org/abs/2609.26550v2)》，於 9 月 27 日修訂，比較 Jev 1.13 與 16 個生成式模型和獎勵模型評審器。《[評分規準評審研究](https://arxiv.org/abs/2609.29769v1)》，9 月 24 日發布，比較 Jev 與三個成本較低的語言模型。《[醫療基準研究](https://arxiv.org/abs/2609.34024v1)》，9 月 27 日發布，比較 Jev 1.13 與兩種推理設定下的 GPT-6 Sol。三篇都是預印本，均非臨床部署研究，也尚未經過同儕審查。

## 部分判定接近，推理任務較弱

第一篇論文評估了 5,172 次判定，涵蓋偏好比較、依證據判斷事實性和核對最終答案，之後還進行追蹤測試及兩項留出資料分流研究。Jev 在主要公開基準的得分為：抽樣 1,500 組 RewardBench 偏好配對中 92.5%；350 組 JudgeBench 配對中 78.6%；以及依證據評估的 3,000 個 HaluEval 答案中 87.3%。在相同任務中，表現最佳的 GPT-6 Astra 對照模型分別得分 92.5%、93.1% 和 88.4%。論文報告，Jev 每 1,000 次基本判定收費 0.044 美元，計時面板上的延遲中位數為 0.15 秒；在該研究條件下，GPT-6 Astra 的費用為 12.182 美元，延遲為 1.89 秒。

這些平均值掩蓋了作者發現的能力界線。在聊天品質、安全拒答和依證據判斷事實性方面，Jev 與 GPT-6 的差距約在 2 個百分點以內；但在需要推導或查核結果的任務中，Jev 分別落後 14.3 個百分點（數學）、12.9 個百分點（程式碼），在邏輯謎題上則差距 27.6 個百分點。在 JudgeBench 的客觀正確性資料集中，Jev 得分 78.6%，GPT-6 為 93.1%。研究者以盲法裁定 990 個子集中的爭議案例；在 69 個有爭議的 JudgeBench 項目中，57 項裁定支持 GPT-6，僅 1 項支持 Jev。裁定範圍有限且經過選擇，但結果顯示，差距不只是基準標籤造成的問題。

這裡的「評審」是指在兩個生成答案中擇一，或依明確提供的參考資料判斷單一答案是否有依據或正確。作者刻意要求生成式評審器和 Jev 使用相同的受限格式，只回覆判定和機率，不附理由。因此，這項比較衡量的是符合該輸出規格時的判斷，而不是哪個評審器較能向人解釋推理過程。

## 只有錯誤不同時，信心分流才有用

級聯系統先使用成本較低的評審器，再把部分案例交給成本較高的後備模型。第一項研究中，若 Jev 的最高標籤機率至少為 0.9，系統便採納其判定；低於此信心門檻的案例才送交後續處理。在 1,610 組留出的偏好配對中，雙順序級聯將 31.5% 的案例送交後備模型，得分為 93.4%，高於 GPT-6 的 92.5%，成本則為 GPT-6 的 41%。研究者也預先設定一項實際測試，使用兩種新正確性任務中的 570 個留出案例：Jev 單獨使用時比 GPT-6 低 14 個百分點；級聯系統的準確率與 GPT-6 相當，將 74% 的案例送交後備模型，成本約節省四分之一。

這項結果有個明確前提：Jev 沒把握的案例必須含有後備模型能修正的錯誤。作者發現，遇到風格對抗的配對答案時，信心分流效果會減弱；在沒有參考資料的文字任務中則失效，因為所有受測評審器的表現都接近隨機猜測，卻往往很有信心。研究也發現，依兩種答案順序各做一次判斷並取平均，可降低位置效應。信心門檻是用本地標註案例選定；論文建議採取信心下界方法，並用留出資料再做查核。

另一項評分規準研究以七個基準中的九組評分面板為對象，共有 5,003 組「項目—評分標準」。其中兩組使用二元評分，七組使用有序等級量表。四個評審器看到相同的評分標準，作者也在評估前固定規準。27 組配對比較中，有 8 組的 95% 信賴區間排除了準確率無差異；對多重比較校正後只剩 4 組。另有一些比較符合論文設定的等效範圍，但許多比較的精確度不足，無法確認有差異或等效。相較其他評審器，Jev 在二元標準上的表現最好；在等級評分面板中，它從未成為配對評審器中的最佳者，而且所有評審器給的分數通常都低於人工評分者。

在那項設定中，Jev 的價格和速度優勢很大。評完九組面板約花 6 美分；三個語言模型評審器的費用高出 29 至 325 倍，耗時則多 30 至 220 倍。不過，Jev 的信心值無法構成有效的級聯系統。在大多數面板中，信心值確實能替錯誤排序，但後備模型幾乎重複了 Jev 最有把握時犯下的所有錯誤。採用交叉擬合的信心門檻後，級聯系統平均最多只比最佳單一評審器高 1.5 個百分點；在九組面板中的六組，表現還不如該評審器。這項重播分析使用既有判定紀錄，並非前瞻性的實際部署。

兩篇論文的對照值得參考。在成對答案比較中，第一項研究發現，Jev 低信心時犯的錯誤與較強後備模型的能力形成有用分工。在評分規準任務中，後備模型卻經常犯相同錯誤，升級處理只增加成本，沒能修正多少判定。光看模型的信心值，團隊無法判斷另一個模型能否提出有用的不同判定。

## 醫療選擇題的結果取決於題目難度

醫療研究在四個既有資料集中評估 Jev：1,373 道 MetaMedQA 考題、500 道依研究摘要作答的 PubMedQA 題目、915 個 DiagnosisArena 選擇題病例，以及 34 個已公布最終診斷的 NEJM Case Challenges。研究將 Jev 與 GPT-6 Sol 比較，後者分別使用中等推理和不啟用推理。模型共收到 8,469 次請求，每次都回傳有效的結構化答案。

在 PubMedQA 上，Jev 和使用中等推理的 GPT-6 Sol 得分分別為 78.4% 和 78.2%。在 MetaMedQA 上，Jev 為 74.8%，GPT-6 Sol 為 82.7%；在 DiagnosisArena 上分別為 59.8% 和 82.4%；在 34 個 NEJM 病例上分別為 61.8% 和 82.4%。在兩個較難的病例資料集上，不啟用推理的 GPT-6 點估計也較高。NEJM 的 34 個病例估計精確度不足；多重比較校正後，主要比較未達統計顯著。DiagnosisArena 上更大的差距則在未明確啟用推理時仍然存在。

這項測試是從給定選項中選答案，並非提出鑑別診斷或治療病患。論文未報告由臨床醫師裁定基準答案。作者指出，提供給模型的 NEJM 圖像是以文字說明呈現；具挑戰性的 DiagnosisArena 病例則經其他語言模型篩選。作者稱結果仍屬初步，獨立重現、由臨床人員裁定參考答案，以及檢查多次執行的穩定性都尚待完成。論文明確指出，不應以這些結果指引臨床照護。

機率門檻的效用不一。在 MetaMedQA 上，Jev 有 52.9% 的選項信心值至少為 0.9，這些選項的準確率為 93.4%。在相近的涵蓋率下，GPT-6 的準確率相同或更高。在 DiagnosisArena 上，Jev 的機率排序能力較弱：採用相同的 0.9 門檻時，只接受 17.3% 的項目，而且每四個接受的答案中仍有一個錯誤。在所有基準中，模型對所選答案給出的平均機率都高於實際準確率。在這個樣本裡，高分不代表確定無誤。

## 團隊可從研究中得到什麼

整體來看，這些論文支持把 Jev 當成特定任務的評估器加以測試，尤其適用於可從提供的文字判定，或能依證據查核的任務。研究並不支持把 Jev 的信心欄位視為通用的安全開關。不同工作負載的結果各異；評分規準研究也說明，除了原始準確率，還必須檢查後備模型的錯誤是否彼此獨立。

考慮這種做法的團隊需要從自身任務抽取具代表性且有標籤的樣本。應明確定義正確判定，納入困難和容易誤導的案例，與人工審查或其他可信參照相比較，再同時衡量錯誤率以及信心值區分正確和錯誤判定的能力。若採用級聯系統，也應記錄後備模型是否修正第一階段的錯誤、升級多少案例，以及最終成本和延遲。保留一組測試資料，可檢驗選定門檻能否適用於挑選門檻時未使用的案例。

這些是根據研究得出的實務建議，並非 BIG CHANGE 測試過的流程。我們沒有呼叫 Jev API，也沒有執行本機基準測試。TypeSafe 的[API 文件](https://api.typesafe.ai/docs)說明結構化請求、允許的答案類型和模型探索功能；但無法獨立證明 Jev 在特定團隊工作負載中的準確率。產品供應情況、價格和模型可能變動，團隊規劃試用時應查閱最新文件。

目前來看，若任務範圍明確、標籤清楚，而且本地評估顯示信心值能有效分流錯誤，Jev 可作為候選的第一階段評審器。若評判需要深入推理、評分仰賴未明示的評分者慣例，或多個模型會犯相同錯誤，這些研究提醒團隊應保留人工審查或其他經驗證的檢查環節。

## 重大變化

Jev 的新評估讓問題不再只是決策模型能否低成本產生判定，而是哪些判定值得採用。答案取決於任務：一項研究中，信心分流改善了留出資料上的成對評估級聯；另一項評分規準研究則發現效益有限，因為各模型的錯誤重疊。醫療選擇題的結果也隨難度明顯改變。AI 團隊接下來應建立本地驗證集，一併檢查正確性、信心值和後備模型的行為。

## 資料與延伸閱讀

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure](https://arxiv.org/abs/2609.26550v2)，Yubo Li、Yidi Miao、Ramayya Krishnan 和 Rema Padman，第二版，2026 年 9 月 27 日。這篇預印本比較 Jev 和 16 個評審器，包含盲法人工裁定與留出資料上的信心分流測試。
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places](https://arxiv.org/abs/2609.29769v1)，Delip Rao 和 Chris Callison-Burch，2026 年 9 月 24 日。這篇預印本在九組基準面板上評估逐項二元評分和等級評分規準。
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results.](https://arxiv.org/abs/2609.34024v1)，Alfredo Madrid-García 和 Beatriz Merino-Barbancho，2026 年 9 月 27 日。這篇初步基準研究比較四個醫療選擇題資料集，並非臨床研究。
- [TypeSafe API 文件](https://api.typesafe.ai/docs)，Jev 結構化請求與輸出介面的官方參考文件。文件說明產品行為，不是獨立評估。

## Sources

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure (v2)](https://arxiv.org/abs/2609.26550v2) — 主要預印本，9 月 22 日提交，9 月 27 日修訂。比較 Jev 1.13 與 16 個評審器在偏好、依證據判斷事實性和最終答案任務上的表現；包含選擇性盲法裁定、固定的離線級聯分析，以及兩項預先指定、使用留出工作負載的實際測試。尚未經同儕審查，也不是部署研究；計算資源匹配、選擇性裁定、工作負載範圍、成本和計時方面的限制記錄於 SOURCE-AUDIT.md。
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places (v1)](https://arxiv.org/abs/2609.29769v1) — 主要預印本，在九組基準面板和 5,003 組規準項目中比較 Jev 與三個 Flash 級語言模型。四個評審器使用相同的評分標準，包含兩組二元面板和七組等級面板。研究顯示模型會犯相關且有信心的錯誤，分流分析主要根據既有結果重播。尚未經同儕審查；許多比較在統計上無法定論，研究結果僅適用於選定的規準、面板和服務條件。
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results. (v1)](https://arxiv.org/abs/2609.34024v1) — 主要初步預印本，在四個醫療選擇題基準上比較 Jev 1.13 和 GPT-6 Sol。評估準確率、校準與選擇性預測、棄答、延遲和成本。並非臨床部署，也沒有臨床醫師裁定；作者表示仍待獨立重現和結果核驗，並建議不要用於臨床照護。
- [TypeSafe API 文件](https://api.typesafe.ai/docs) — 2026 年 9 月 29 日查閱的官方 OpenAPI 文件，列出結構化請求／回應結構、system-one 端點和模型探索功能。內容僅能支持對介面的描述，不能證明獨立效能主張。產品供應情況和價格可能變動。
- [任務交接中的 Instagram Reel Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — 僅作為指派線索：無法取得或轉錄該 Reel。未將說明文字或中繼資料用作證據，也未把任何主張歸因於其畫面。
