새 프리프린트 세 편은 각기 다른 방식으로 Jev를 평가자로 시험했다. 한 연구에서는 답변 선호도와 증거 기반 사실 확인에서 Jev가 강력한 언어 모델 심판에 근접했으며, 확신도를 이용해 불확실한 사례를 라우팅했다. 두 번째 연구에서는 채점형 루브릭에 이런 라우팅을 적용해도 이점이 거의 없었다. 대체 모델이 Jev의 확신에 찬 오류를 자주 되풀이했기 때문이다. 세 번째 의료 벤치마크는 연구 초록 관련 질문에서는 비슷한 정확도를 보였지만, 더 어려운 진단 사례에서는 큰 격차가 났다고 보고했다.

실제적인 결론은 “AI가 AI를 심판할 수 있다”는 말보다 제한적이다. Jev는 잘 정의된 과제에서 빠른 1차 심판으로 쓸 수 있을지 모르지만, 모든 종류의 답변에 통하는 믿을 만한 심판 하나가 입증된 것은 아니다. 확신도는 팀이 자체 사례에서 예측 성능을 확인한 뒤에야 작업 라우팅에 도움이 될 수 있다.

모델이 심판한다는 것의 의미

평가자는 하나 이상의 모델 출력을 받아 규칙에 따라 점수나 판정을 반환한다. 심판은 두 응답 중 프롬프트를 더 잘 따르는 쪽을 고르거나, 주어진 문서가 주장을 뒷받침하는지 판단하거나, 루브릭에 따라 답변을 채점하거나, 의료 객관식 사례에서 정답을 고를 수 있다. 각 과제는 평가자에게 서로 다른 능력을 요구한다.

Jev는 TypeSafe가 호스팅하는 의사결정 모델이다. API는 구조화된 입력과 허용된 응답 유형을 받아, 허용된 레이블별 확률과 함께 선택지나 점수를 반환한다. 이 인터페이스를 사용하면 제한된 결과를 기대하는 소프트웨어에 과제를 맞춰 넣을 수 있다. 다만 확률은 모델의 추정치일 뿐, 그 자체로 답의 근거를 독립적으로 검증하지 않는다. TypeSafe 문서는 인터페이스를 설명하며, 아래 연구 비교는 특정 테스트 세트에서의 성능을 평가한다.

첫 번째 JEV-as-a-Judge 연구 연구는 9월 27일 수정본에서 Jev 1.13을 생성형 심판 및 보상 모델 심판 16개와 비교한다. 루브릭 심판 연구 연구는 9월 24일 게시본에서 Jev를 비용이 더 낮은 언어 모델 세 개와 비교한다. 의료 벤치마크는 9월 27일 게시본에서 두 가지 추론 설정으로 Jev 1.13과 GPT-6 Sol을 비교한다. 세 연구 모두 프리프린트다. 임상 도입 연구는 하나도 없으며, 동료 심사를 받은 연구도 없다.

일부 판정은 비슷했지만 추론에서는 약세

첫 번째 논문은 선호도 쌍, 증거에 기반한 사실성, 최종 답변 검사를 아우르는 5,172건의 판정을 평가한 뒤 후속 테스트와 보류 데이터 라우팅 연구 두 건을 추가했다. Jev의 주요 공개 벤치마크 점수는 표본으로 추린 RewardBench 선호도 쌍 1,500개에서 92.5%, JudgeBench 쌍 350개에서 78.6%, 증거를 기준으로 평가한 HaluEval 답변 3,000개에서 87.3%였다. 같은 과제에서 가장 강한 비교 모델인 GPT-6 Astra는 각각 92.5%, 93.1%, 88.4%를 기록했다. 논문은 기본 판정 1,000건당 Jev 비용을 $0.044, 측정 패널의 중앙값 지연 시간을 0.15초로 보고했다. 연구 조건에서 GPT-6 Astra는 $12.182와 1.89초였다.

이 평균은 저자들이 발견한 성능 한계를 가린다. 대화 품질, 안전 관련 거부, 증거 기반 사실성에서는 Jev와 GPT-6의 차이가 대략 2%포인트 이내였다. 결과를 도출하거나 확인해야 하는 과제에서는 뒤처졌다. 수학에서 14.3%포인트, 코드에서 12.9%포인트 차이가 났고 논리 퍼즐에서는 격차가 27.6%포인트였다. JudgeBench의 객관적 정답성 세트에서 Jev는 78.6%, GPT-6는 93.1%였다. 990개 항목 하위 집합의 논쟁 사례를 눈가림 판정한 결과, 논쟁이 된 JudgeBench 항목 69개 중 57개에서는 GPT-6, 하나에서는 Jev의 편을 들었다. 이 판정은 선택적이고 범위가 제한적이지만, 격차가 벤치마크 레이블 문제만은 아니었음을 시사한다.

여기서 ‘심판’은 두 개의 생성된 답변 중 하나를 고르거나, 명시된 참조 자료에 비추어 단일 답변이 뒷받침되거나 정답인지 판단한다는 뜻이다. 저자들은 생성형 심판에도 Jev와 똑같이 제한된 판정·확률 출력 형식을 적용하고 근거 설명은 요구하지 않았다. 따라서 이 비교는 사람에게 추론을 설명하는 능력이 아니라, 그 형식에 따른 판정을 비교한다.

오류를 가려낼 수 있을 때 확신도 라우팅이 효과적

캐스케이드는 저렴한 1차 심판을 사용하고 일부 사례만 더 비싼 대체 모델로 보낸다. 첫 번째 연구에서는 Jev의 가장 높은 레이블 확률이 0.9 이상일 때 판정을 채택하고, 확신도가 낮은 사례는 다음 단계로 보냈다. 보류된 선호도 쌍 1,610개에서 두 순서를 모두 사용한 캐스케이드는 사례의 31.5%를 상향 전달했고, GPT-6의 92.5%와 비교해 93.4%를 기록했으며 비용은 GPT-6의 41%였다. 두 가지 새로운 정답성 과제에서 사전 지정된 보류 쌍 570개를 대상으로 한 실시간 테스트에서는 Jev 단독 점수가 GPT-6보다 14%포인트 낮았다. 캐스케이드는 74%를 상향 전달하면서 GPT-6의 정확도를 맞췄고 비용은 약 4분의 1 절감했다.

이 결과에는 구체적인 조건이 따른다. Jev가 확신하지 못하는 사례에는 대체 모델이 바로잡을 수 있는 오류가 있어야 한다. 저자들은 문체를 적대적으로 조작한 쌍에서는 확신도 라우팅의 효과가 약해졌고, 참조 자료가 없는 산문에서는 실패했다고 밝혔다. 이 경우 테스트된 모든 심판의 성능은 거의 무작위 수준이었지만, 자주 확신에 차 있었다. 연구에서는 답변 순서를 양쪽으로 바꾼 판정을 평균 내면 위치 효과가 줄어드는 것도 확인했다. 임계값은 현지 레이블 사례를 사용해 정했으며, 논문은 낮은 신뢰 하한을 활용하는 접근과 별도 보류 검증을 권고한다.

별도의 루브릭 연구는 7개 벤치마크에서 추출한 9개 패널, 총 5,003개의 항목-기준 쌍에 대해 기준별 점수 산정을 시험했다. 두 패널은 이진형이고 일곱 패널은 순서형 평가 척도를 사용했다. 네 심판 모두 같은 기준 문구를 받았고, 저자들은 평가 전에 루브릭을 고정했다. 27개 쌍별 비교 중 8개는 95% 신뢰구간에 차이 없음이 포함되지 않았고, 다중 비교를 보정한 뒤에는 네 개가 남았다. 다른 일부 비교는 논문이 정한 동등성 범위에 들었지만, 상당수는 차이나 동등성을 확인하기에 정밀도가 부족했다. 이진형 기준에서는 Jev가 다른 모델에 비해 가장 나은 결과를 냈다. 등급형 패널에서는 비교 대상 중 최상위 심판이 된 적이 없었고, 모든 심판이 인간 평가자보다 낮은 점수를 주는 경향을 보였다.

이 설정에서는 비용과 시간 절감 폭이 컸다. Jev는 아홉 패널 전체에서 약 6센트가 들었다. 언어 모델 심판 세 개는 비용이 29~325배 더 들고 시간도 30~220배 더 걸렸다. 하지만 Jev의 확신도는 강력한 캐스케이드를 만들지 못했다. 대부분의 패널에서 확신도는 Jev의 오류 순위를 매겼지만, 대체 모델은 Jev가 가장 확신한 실수 대부분을 되풀이했다. 교차 적합 임계값을 사용한 캐스케이드의 평균 향상은 단일 최상위 심판보다 최대 1.5%포인트였으며, 아홉 패널 중 여섯 곳에서는 그 심판보다 성능이 낮았다. 이 재생 분석은 전향적 실시간 배포가 아니라 기록된 판정을 사용했다.

두 논문의 차이는 시사하는 바가 있다. 답변 쌍을 비교한 첫 연구에서는 Jev의 확신도가 낮을 때 발생한 오류와 더 강한 대체 모델의 능력이 유용하게 나뉘었다. 기준별 채점에서는 대체 모델이 같은 오류를 공유하는 일이 잦아, 상향 전달이 비용만 늘리고 오류를 거의 바로잡지 못했다. 모델의 확신도 신호만으로는 다른 모델이 유익한 이견을 낼지 알 수 없다.

의료 객관식 결과는 과제 난이도에 따라 달랐다

의료 논문은 기존 데이터 세트 네 개에서 Jev를 평가했다. MetaMedQA 시험 문제 1,373개, 연구 초록을 바탕으로 답하는 PubMedQA 질문 500개, DiagnosisArena 객관식 사례 915개, 공개된 최종 진단이 있는 NEJM Case Challenges 34개다. Jev를 GPT-6 Sol과 비교했으며, GPT-6 Sol은 중간 수준 추론을 사용하거나 추론을 사용하지 않았다. 모델 요청은 8,469건이었고 모든 요청에서 유효한 구조화 답변을 받았다.

PubMedQA에서 Jev와 중간 수준 추론을 사용한 GPT-6 Sol 점수는 각각 78.4%와 78.2%였다. MetaMedQA에서는 Jev가 74.8%, GPT-6 Sol이 82.7%였다. DiagnosisArena에서는 59.8% 대 82.4%, NEJM 사례 34개에서는 61.8% 대 82.4%였다. 추론을 사용하지 않은 GPT-6도 더 어려운 두 사례 세트에서 점 추정치가 높았다. NEJM 34개 사례 추정치는 정밀도가 낮았고, 다중 비교 보정 후에는 주요 비교가 통계적으로 유의하지 않았다. 훨씬 큰 DiagnosisArena 격차는 명시적 추론을 사용하지 않았을 때에도 유지됐다.

이는 제공된 선택지 중 하나를 고르는 시험이지, 감별 진단을 내리거나 환자를 치료하는 시험이 아니다. 논문은 벤치마크 답변을 임상의가 판정했는지 보고하지 않았다. NEJM 이미지는 캡션 형태로 모델에 제공됐으며, 난도가 높은 DiagnosisArena 사례는 다른 언어 모델을 기준으로 선별했다고 밝힌다. 저자들은 결과를 예비적인 것으로 규정하고, 독립적 재현, 참조 답변에 대한 임상 판정, 실행 간 안정성 검사가 아직 남아 있다고 했다. 논문은 이 결과를 임상 진료에 활용하지 말라고 명시한다.

확률 임계값의 효과는 고르지 않았다. MetaMedQA에서 Jev 선택의 52.9%는 확신도가 0.9 이상이었고, 이 답변의 정확도는 93.4%였다. 비슷한 커버리지에서 GPT-6의 정확도는 같거나 더 높았다. DiagnosisArena에서 Jev의 확률 순위는 약했다. 같은 0.9 임계값에서는 항목의 17.3%만 채택됐고 채택된 답변 네 개 중 하나는 여전히 오답이었다. 모든 벤치마크에서 선택한 옵션에 대한 모델의 평균 확률은 실제 정확도보다 높았다. 이 표본에서는 높은 점수가 확실성을 뜻하지 않았다.

팀이 연구에서 얻을 수 있는 점

종합하면 이 논문들은 특히 주어진 텍스트에서 판정을 읽거나 증거로 확인할 수 있는 경우, 과제별 평가자로 Jev를 시험해 볼 근거를 제공한다. 하지만 Jev의 확신도 필드를 보편적인 안전 스위치로 취급할 근거는 되지 않는다. 작업마다 결과가 달랐으며, 루브릭 연구는 대체 모델의 원시 정확도뿐 아니라 오류의 독립성도 평가해야 하는 이유를 보여준다.

이 접근을 고려하는 팀에는 자체 과제를 대표하는 레이블 표본이 필요하다. 무엇을 정답으로 볼지 정하고, 어렵고 오해를 유발하는 사례도 포함해야 한다. 그런 다음 사람의 검토나 타당한 다른 참조 기준과 비교하고, 오류율과 확신도가 정답과 오답을 얼마나 잘 구분하는지를 모두 측정해야 한다. 캐스케이드라면 대체 모델이 1단계 오류를 실제로 고치는지, 몇 건을 상향 전달하는지, 그에 따른 비용과 지연은 얼마인지도 기록해야 한다. 별도로 확보한 테스트 세트는 임계값이 이를 선택하는 데 사용한 사례 밖에서도 적용되는지 보여줄 수 있다.

이는 연구에서 도출한 실무적 시사점이지, BIG CHANGE가 시험한 절차는 아니다. 우리는 Jev API를 호출하거나 로컬 벤치마크를 실행하지 않았다. TypeSafe의 API 문서는 구조화 요청, 허용된 답변 유형, 모델 검색을 설명하지만 특정 팀의 작업에서 정확도를 독립적으로 입증하지는 않는다. 제품 접근 권한, 가격, 모델은 바뀔 수 있으므로 팀은 시험을 계획할 때 최신 문서를 확인해야 한다.

현재로서는 과제가 좁고 레이블이 명확하며, 현지 평가를 통해 확신도 기반 라우팅이 오류를 효과적으로 처리한다고 확인된 경우 Jev를 1차 심판 후보로 볼 수 있다. 더 깊은 추론이 필요하거나, 채점이 평가자의 숨은 관행에 좌우되거나, 여러 모델이 같은 실수를 한다면 사람의 검토나 다른 검증된 확인 절차를 계속 포함해야 한다고 이 연구들은 시사한다.

큰 변화

Jev의 새로운 평가는 의사결정 모델이 저렴한 판정을 내릴 수 있는지에서, 그 판정을 언제 계속 활용할 만큼 유용한지로 질문을 옮긴다. 답은 과제에 달려 있다. 확신도 라우팅은 보류된 쌍별 평가 캐스케이드의 성능을 높였지만, 별도의 루브릭 연구에서는 오류가 겹쳐 개선이 거의 없었다. 의료 객관식 결과도 과제 난도에 따라 크게 달라졌다. AI 팀의 다음 단계는 정답성, 확신도, 대체 모델 동작을 함께 점검하는 현지 검증 세트를 만드는 것이다.

출처 및 추가 자료