三篇新預印本以不同方式測試 Jev 作為評估器的表現。一篇發現,在答案偏好比較和依證據查核事實時,Jev 的表現接近強大的語言模型評審器,並利用信心程度將不確定的案例轉交其他模型處理。第二篇發現,在依評分規準評分時,這種分流幾乎沒有幫助,因為後備模型經常重複 Jev 很有把握卻判錯的案例。第三篇醫療基準研究發現,兩者回答研究摘要問題的準確率相近,但在較難的診斷案例上差距很大。

實際結論比「AI 可以評判 AI」更有限。若任務定義明確,Jev 可能適合作為快速初步評審器,但現有證據無法證明它能可靠評判各種答案。團隊必須先用自己的案例檢驗信心值能否預測錯誤,之後才能據此分流工作。

模型評審的意義

評估器會接收一個或多個模型輸出,並依某項規則給出分數或判定。評審器可能要從兩個回答中選出較符合提示的一個、判斷某項說法是否獲提供的文件支持、依評分規準評分,或在醫療選擇題中選出正確選項。這些任務對評估器的要求各不相同。

Jev 是 TypeSafe 託管的決策模型。它的 API 接收結構化輸入和允許的回覆類型,再從限定的標籤中回傳一個選項或分數,以及各標籤對應的機率。這種介面適合需要有限結果的軟體任務。不過,機率只是模型的估計值,不能獨立查證底層答案。TypeSafe 的文件說明介面;下文的研究比較則評估 Jev 在特定測試集上的表現。

《JEV-as-a-Judge 研究》,於 9 月 27 日修訂,比較 Jev 1.13 與 16 個生成式模型和獎勵模型評審器。《評分規準評審研究》,9 月 24 日發布,比較 Jev 與三個成本較低的語言模型。《醫療基準研究》,9 月 27 日發布,比較 Jev 1.13 與兩種推理設定下的 GPT-6 Sol。三篇都是預印本,均非臨床部署研究,也尚未經過同儕審查。

部分判定接近,推理任務較弱

第一篇論文評估了 5,172 次判定,涵蓋偏好比較、依證據判斷事實性和核對最終答案,之後還進行追蹤測試及兩項留出資料分流研究。Jev 在主要公開基準的得分為:抽樣 1,500 組 RewardBench 偏好配對中 92.5%;350 組 JudgeBench 配對中 78.6%;以及依證據評估的 3,000 個 HaluEval 答案中 87.3%。在相同任務中,表現最佳的 GPT-6 Astra 對照模型分別得分 92.5%、93.1% 和 88.4%。論文報告,Jev 每 1,000 次基本判定收費 0.044 美元,計時面板上的延遲中位數為 0.15 秒;在該研究條件下,GPT-6 Astra 的費用為 12.182 美元,延遲為 1.89 秒。

這些平均值掩蓋了作者發現的能力界線。在聊天品質、安全拒答和依證據判斷事實性方面,Jev 與 GPT-6 的差距約在 2 個百分點以內;但在需要推導或查核結果的任務中,Jev 分別落後 14.3 個百分點(數學)、12.9 個百分點(程式碼),在邏輯謎題上則差距 27.6 個百分點。在 JudgeBench 的客觀正確性資料集中,Jev 得分 78.6%,GPT-6 為 93.1%。研究者以盲法裁定 990 個子集中的爭議案例;在 69 個有爭議的 JudgeBench 項目中,57 項裁定支持 GPT-6,僅 1 項支持 Jev。裁定範圍有限且經過選擇,但結果顯示,差距不只是基準標籤造成的問題。

這裡的「評審」是指在兩個生成答案中擇一,或依明確提供的參考資料判斷單一答案是否有依據或正確。作者刻意要求生成式評審器和 Jev 使用相同的受限格式,只回覆判定和機率,不附理由。因此,這項比較衡量的是符合該輸出規格時的判斷,而不是哪個評審器較能向人解釋推理過程。

只有錯誤不同時,信心分流才有用

級聯系統先使用成本較低的評審器,再把部分案例交給成本較高的後備模型。第一項研究中,若 Jev 的最高標籤機率至少為 0.9,系統便採納其判定;低於此信心門檻的案例才送交後續處理。在 1,610 組留出的偏好配對中,雙順序級聯將 31.5% 的案例送交後備模型,得分為 93.4%,高於 GPT-6 的 92.5%,成本則為 GPT-6 的 41%。研究者也預先設定一項實際測試,使用兩種新正確性任務中的 570 個留出案例:Jev 單獨使用時比 GPT-6 低 14 個百分點;級聯系統的準確率與 GPT-6 相當,將 74% 的案例送交後備模型,成本約節省四分之一。

這項結果有個明確前提:Jev 沒把握的案例必須含有後備模型能修正的錯誤。作者發現,遇到風格對抗的配對答案時,信心分流效果會減弱;在沒有參考資料的文字任務中則失效,因為所有受測評審器的表現都接近隨機猜測,卻往往很有信心。研究也發現,依兩種答案順序各做一次判斷並取平均,可降低位置效應。信心門檻是用本地標註案例選定;論文建議採取信心下界方法,並用留出資料再做查核。

另一項評分規準研究以七個基準中的九組評分面板為對象,共有 5,003 組「項目—評分標準」。其中兩組使用二元評分,七組使用有序等級量表。四個評審器看到相同的評分標準,作者也在評估前固定規準。27 組配對比較中,有 8 組的 95% 信賴區間排除了準確率無差異;對多重比較校正後只剩 4 組。另有一些比較符合論文設定的等效範圍,但許多比較的精確度不足,無法確認有差異或等效。相較其他評審器,Jev 在二元標準上的表現最好;在等級評分面板中,它從未成為配對評審器中的最佳者,而且所有評審器給的分數通常都低於人工評分者。

在那項設定中,Jev 的價格和速度優勢很大。評完九組面板約花 6 美分;三個語言模型評審器的費用高出 29 至 325 倍,耗時則多 30 至 220 倍。不過,Jev 的信心值無法構成有效的級聯系統。在大多數面板中,信心值確實能替錯誤排序,但後備模型幾乎重複了 Jev 最有把握時犯下的所有錯誤。採用交叉擬合的信心門檻後,級聯系統平均最多只比最佳單一評審器高 1.5 個百分點;在九組面板中的六組,表現還不如該評審器。這項重播分析使用既有判定紀錄,並非前瞻性的實際部署。

兩篇論文的對照值得參考。在成對答案比較中,第一項研究發現,Jev 低信心時犯的錯誤與較強後備模型的能力形成有用分工。在評分規準任務中,後備模型卻經常犯相同錯誤,升級處理只增加成本,沒能修正多少判定。光看模型的信心值,團隊無法判斷另一個模型能否提出有用的不同判定。

醫療選擇題的結果取決於題目難度

醫療研究在四個既有資料集中評估 Jev:1,373 道 MetaMedQA 考題、500 道依研究摘要作答的 PubMedQA 題目、915 個 DiagnosisArena 選擇題病例,以及 34 個已公布最終診斷的 NEJM Case Challenges。研究將 Jev 與 GPT-6 Sol 比較,後者分別使用中等推理和不啟用推理。模型共收到 8,469 次請求,每次都回傳有效的結構化答案。

在 PubMedQA 上,Jev 和使用中等推理的 GPT-6 Sol 得分分別為 78.4% 和 78.2%。在 MetaMedQA 上,Jev 為 74.8%,GPT-6 Sol 為 82.7%;在 DiagnosisArena 上分別為 59.8% 和 82.4%;在 34 個 NEJM 病例上分別為 61.8% 和 82.4%。在兩個較難的病例資料集上,不啟用推理的 GPT-6 點估計也較高。NEJM 的 34 個病例估計精確度不足;多重比較校正後,主要比較未達統計顯著。DiagnosisArena 上更大的差距則在未明確啟用推理時仍然存在。

這項測試是從給定選項中選答案,並非提出鑑別診斷或治療病患。論文未報告由臨床醫師裁定基準答案。作者指出,提供給模型的 NEJM 圖像是以文字說明呈現;具挑戰性的 DiagnosisArena 病例則經其他語言模型篩選。作者稱結果仍屬初步,獨立重現、由臨床人員裁定參考答案,以及檢查多次執行的穩定性都尚待完成。論文明確指出,不應以這些結果指引臨床照護。

機率門檻的效用不一。在 MetaMedQA 上,Jev 有 52.9% 的選項信心值至少為 0.9,這些選項的準確率為 93.4%。在相近的涵蓋率下,GPT-6 的準確率相同或更高。在 DiagnosisArena 上,Jev 的機率排序能力較弱:採用相同的 0.9 門檻時,只接受 17.3% 的項目,而且每四個接受的答案中仍有一個錯誤。在所有基準中,模型對所選答案給出的平均機率都高於實際準確率。在這個樣本裡,高分不代表確定無誤。

團隊可從研究中得到什麼

整體來看,這些論文支持把 Jev 當成特定任務的評估器加以測試,尤其適用於可從提供的文字判定,或能依證據查核的任務。研究並不支持把 Jev 的信心欄位視為通用的安全開關。不同工作負載的結果各異;評分規準研究也說明,除了原始準確率,還必須檢查後備模型的錯誤是否彼此獨立。

考慮這種做法的團隊需要從自身任務抽取具代表性且有標籤的樣本。應明確定義正確判定,納入困難和容易誤導的案例,與人工審查或其他可信參照相比較,再同時衡量錯誤率以及信心值區分正確和錯誤判定的能力。若採用級聯系統,也應記錄後備模型是否修正第一階段的錯誤、升級多少案例,以及最終成本和延遲。保留一組測試資料,可檢驗選定門檻能否適用於挑選門檻時未使用的案例。

這些是根據研究得出的實務建議,並非 BIG CHANGE 測試過的流程。我們沒有呼叫 Jev API,也沒有執行本機基準測試。TypeSafe 的API 文件說明結構化請求、允許的答案類型和模型探索功能;但無法獨立證明 Jev 在特定團隊工作負載中的準確率。產品供應情況、價格和模型可能變動,團隊規劃試用時應查閱最新文件。

目前來看,若任務範圍明確、標籤清楚,而且本地評估顯示信心值能有效分流錯誤,Jev 可作為候選的第一階段評審器。若評判需要深入推理、評分仰賴未明示的評分者慣例,或多個模型會犯相同錯誤,這些研究提醒團隊應保留人工審查或其他經驗證的檢查環節。

重大變化

Jev 的新評估讓問題不再只是決策模型能否低成本產生判定,而是哪些判定值得採用。答案取決於任務:一項研究中,信心分流改善了留出資料上的成對評估級聯;另一項評分規準研究則發現效益有限,因為各模型的錯誤重疊。醫療選擇題的結果也隨難度明顯改變。AI 團隊接下來應建立本地驗證集,一併檢查正確性、信心值和後備模型的行為。

資料與延伸閱讀