DUNIA TERUS BERGERAK.RSS
BIG CHANGE.

Edisi Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Hasil model penilai AI Jev berbeda menurut tugas dan model cadangan

> Tiga pracetak menguji Jev sebagai penilai jawaban AI. Hasilnya berbeda pada tugas preferensi, rubrik, dan medis; perutean berdasarkan keyakinan hanya membantu jika model cadangannya memperbaiki kesalahan Jev.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tiga pracetak baru menguji Jev sebagai evaluator dengan cara berbeda. Satu penelitian menemukan hasil yang mendekati penilai model bahasa yang kuat untuk preferensi jawaban dan pemeriksaan fakta berbasis bukti, lalu menggunakan tingkat keyakinan untuk meneruskan kasus yang tidak pasti. Studi kedua menemukan sedikit manfaat dari perutean itu pada rubrik penilaian karena model cadangan sering mengulangi kesalahan Jev yang disampaikan dengan yakin. Benchmark medis ketiga melaporkan akurasi serupa pada pertanyaan abstrak penelitian dan selisih besar pada kasus diagnosis yang lebih sulit.

Jawaban praktisnya lebih terbatas daripada “AI dapat menilai AI”. Jev mungkin berguna sebagai penilai tahap pertama yang cepat untuk tugas dengan definisi jelas, tetapi bukti tidak menunjukkan satu penilai andal untuk setiap jenis jawaban. Tingkat keyakinan hanya dapat membantu mengarahkan pekerjaan setelah tim memeriksa apa yang diprediksinya pada contoh milik tim sendiri.

## Apa arti sebuah model menilai

Evaluator menerima satu atau beberapa keluaran model lalu memberikan skor atau keputusan berdasarkan suatu aturan. Penilai dapat memilih jawaban mana dari dua jawaban yang lebih sesuai dengan prompt, memutuskan apakah klaim didukung dokumen yang diberikan, menilai jawaban berdasarkan rubrik, atau memilih opsi yang benar pada kasus pilihan ganda medis. Tugas-tugas tersebut menuntut kemampuan yang berbeda dari evaluator.

Jev adalah model keputusan TypeSafe yang dihosting. API-nya menerima input terstruktur dan jenis respons yang diizinkan, lalu mengembalikan pilihan atau skor beserta probabilitas untuk label yang diperbolehkan. Antarmuka ini dapat menyesuaikan tugas ke dalam perangkat lunak yang mengharapkan hasil terbatas. Namun, probabilitas adalah perkiraan model; probabilitas tidak memverifikasi jawaban yang mendasarinya secara independen. Dokumentasi TypeSafe menjelaskan antarmukanya, sedangkan perbandingan penelitian berikut menilai kinerja pada kumpulan pengujian tertentu.

Studi [JEV sebagai Penilai](https://arxiv.org/abs/2609.26550v2), yang direvisi pada 27 September, membandingkan Jev 1.13 dengan 16 penilai generatif dan model reward. Studi [penilai rubrik](https://arxiv.org/abs/2609.29769v1), yang diposting 24 September, membandingkan Jev dengan tiga model bahasa berbiaya lebih rendah. [Benchmark medis](https://arxiv.org/abs/2609.34024v1), yang diposting 27 September, membandingkan Jev 1.13 dengan GPT-6 Sol dalam dua pengaturan penalaran. Ketiganya merupakan pracetak. Tidak satu pun merupakan studi penerapan klinis, dan tidak satu pun telah melalui tinjauan sejawat.

## Mendekati pada beberapa keputusan, lebih lemah dalam penalaran

Makalah pertama mengevaluasi 5.172 penilaian pada pasangan preferensi, faktualitas yang berlandaskan bukti, dan pemeriksaan jawaban akhir, lalu menambahkan pengujian lanjutan serta dua studi perutean dengan data yang disisihkan. Skor benchmark publik utama Jev adalah 92,5% pada sampel 1.500 pasangan preferensi RewardBench, 78,6% pada 350 pasangan JudgeBench, dan 87,3% pada 3.000 jawaban HaluEval yang dinilai berdasarkan bukti. Pada tugas tersebut, pembanding GPT-6 Astra terkuat masing-masing mencetak 92,5%, 93,1%, dan 88,4%. Makalah melaporkan biaya Jev $0,044 per 1.000 penilaian dasar dan latensi median 0,15 detik pada panel waktu; GPT-6 Astra berbiaya $12,182 dengan waktu 1,89 detik dalam kondisi studi itu.

Rata-rata tersebut menyamarkan batas yang ditemukan para penulis. Jev berada dalam jarak kira-kira dua poin dari GPT-6 untuk mutu obrolan, penolakan keselamatan, dan faktualitas berbasis bukti. Jev tertinggal pada tugas yang memerlukan penurunan atau pemeriksaan hasil: selisih 14,3 poin pada matematika dan 12,9 poin pada kode, serta kesenjangan 27,6 poin pada teka-teki logika. Pada kumpulan kebenaran objektif JudgeBench, skor Jev 78,6% dibandingkan 93,1% untuk GPT-6. Dalam adjudikasi tersamar atas sebagian 990 butir yang disengketakan, penilai memihak GPT-6 pada 57 dari 69 butir JudgeBench yang disengketakan dan memihak Jev pada satu butir. Adjudikasi ini terbatas dan hanya mencakup kasus terpilih, tetapi mengisyaratkan bahwa kesenjangan ini bukan sekadar masalah label benchmark.

Dalam konteks ini, “penilai” berarti memilih antara dua jawaban yang dihasilkan atau memutuskan apakah satu jawaban didukung atau benar berdasarkan acuan yang dinyatakan. Para penulis sengaja memberi format keluaran terbatas berupa keputusan dan probabilitas yang sama kepada penilai generatif seperti kepada Jev, tanpa alasan. Karena itu, perbandingan ini menguji keputusannya dalam format tersebut, bukan model mana yang dapat menjelaskan penalarannya kepada manusia.

## Perutean berdasarkan tingkat keyakinan berhasil saat kesalahannya berbeda

Cascade memakai penilai pertama yang lebih murah lalu meneruskan sejumlah kasus ke model cadangan yang lebih mahal. Dalam studi pertama, aturan menerima keputusan Jev jika probabilitas label maksimumnya setidaknya 0,9 dan meneruskan kasus dengan keyakinan lebih rendah. Pada 1.610 pasangan preferensi yang disisihkan, cascade dua urutan meneruskan 31,5% kasus, meraih skor 93,4% dibandingkan 92,5% untuk GPT-6, dan berbiaya 41% dari tarif GPT-6. Dalam pengujian langsung yang telah ditentukan sebelumnya terhadap 570 pasangan yang disisihkan dari dua beban kerja kebenaran baru, Jev sendiri tertinggal 14 poin dari GPT-6; cascade menyamai akurasi GPT-6 sambil meneruskan 74% kasus dan menghemat sekitar seperempat biayanya.

Hasil tersebut memiliki syarat khusus: kasus yang membuat Jev ragu harus memuat kesalahan yang dapat diperbaiki model cadangan. Para penulis menemukan bahwa perutean berbasis keyakinan melemah pada pasangan yang dirancang untuk mengecoh penilaian gaya dan gagal pada prosa tanpa acuan, ketika semua penilai yang diuji memiliki kinerja mendekati tebakan acak tetapi sering tetap yakin. Studi itu juga menemukan bahwa merata-ratakan keputusan pada kedua urutan jawaban mengurangi efek posisi. Ambang dipilih menggunakan contoh berlabel dari lingkungan setempat; makalah menyarankan pendekatan batas bawah keyakinan dan pemeriksaan pada data yang disisihkan.

Studi rubrik terpisah menguji penilaian per kriteria pada sembilan panel yang diambil dari tujuh benchmark, total 5.003 pasangan butir–kriteria. Dua panel memakai penilaian biner; tujuh lainnya memakai skala penilaian berurutan. Keempat penilai menerima teks kriteria yang sama, dan para penulis menetapkan rubrik sebelum evaluasi. Delapan dari 27 perbandingan berpasangan memiliki interval kepercayaan 95% yang tidak mencakup nol selisih akurasi; empat tetap demikian setelah koreksi untuk perbandingan berganda. Sejumlah perbandingan lain memenuhi batas kesetaraan makalah, sedangkan banyak yang terlalu tidak presisi untuk memastikan perbedaan maupun kesetaraan. Jev paling baik relatif terhadap penilai lain pada kriteria biner. Pada panel bertingkat, Jev tidak pernah menjadi penilai pembanding teratas, dan semua penilai cenderung memberi skor lebih rendah daripada penilai manusia.

Penghematan biaya dan kecepatannya besar dalam pengaturan tersebut. Jev menghabiskan sekitar enam sen untuk kesembilan panel; biaya tiga penilai model bahasa 29 hingga 325 kali lebih tinggi dan waktunya 30 hingga 220 kali lebih lama. Namun, keyakinan Jev tidak menghasilkan cascade yang kuat. Pada kebanyakan panel, tingkat keyakinan dapat mengurutkan kesalahannya, tetapi model cadangan mengulangi hampir semua kesalahan Jev yang paling diyakininya. Dengan ambang yang dipasang silang, peningkatan cascade rata-rata paling tinggi 1,5 poin persentase dibandingkan penilai tunggal terbaik; pada enam dari sembilan panel, hasilnya lebih buruk daripada penilai tersebut. Pemutaran ulang ini menggunakan keputusan yang telah direkam, bukan penerapan langsung prospektif.

Perbedaan antara kedua makalah ini memberi pelajaran. Dalam perbandingan jawaban berpasangan, studi pertama menemukan pembagian yang berguna antara kesalahan Jev dengan tingkat keyakinan rendah dan kemampuan model cadangan yang lebih kuat. Dalam penilaian kriteria, model cadangan sering membuat kesalahan yang sama, sehingga eskalasi menambah biaya tanpa banyak memperbaiki hasil. Sinyal tingkat keyakinan model saja tidak memberi tahu tim apakah model lain akan menghasilkan ketidaksetujuan yang bermanfaat.

## Hasil pilihan ganda medis bergantung pada tingkat kesulitan tugas

Makalah medis mengevaluasi Jev pada empat kumpulan data yang sudah ada: 1.373 soal ujian MetaMedQA, 500 pertanyaan PubMedQA yang dijawab berdasarkan abstrak penelitian, 915 kasus pilihan ganda DiagnosisArena, dan 34 NEJM Case Challenges dengan diagnosis akhir yang dipublikasikan. Makalah membandingkan Jev dengan GPT-6 Sol menggunakan penalaran tingkat sedang maupun tanpa penalaran. Ada 8.469 permintaan model dan setiap permintaan mengembalikan jawaban terstruktur yang valid.

Pada PubMedQA, Jev dan GPT-6 Sol dengan penalaran tingkat sedang memperoleh skor 78,4% dan 78,2%. Pada MetaMedQA, skor Jev 74,8% dibandingkan 82,7%; pada DiagnosisArena 59,8% dibandingkan 82,4%; dan pada 34 kasus NEJM 61,8% dibandingkan 82,4%. GPT-6 tanpa penalaran juga memiliki estimasi titik yang lebih tinggi pada dua kumpulan kasus yang lebih sulit. Estimasi dari 34 kasus NEJM kurang presisi, dan perbandingan utamanya tidak lagi signifikan secara statistik setelah koreksi untuk perbandingan berganda. Kesenjangan DiagnosisArena yang jauh lebih besar tetap terlihat tanpa penalaran eksplisit.

Ini adalah pengujian untuk memilih di antara opsi yang diberikan, bukan untuk menghasilkan diagnosis banding atau merawat pasien. Makalah tidak melaporkan adjudikasi jawaban benchmark oleh klinisi. Makalah menyebut gambar NEJM diberikan kepada model sebagai keterangan teks dan kasus DiagnosisArena yang menantang disaring menggunakan model bahasa lain. Para penulis menyebut temuan ini sebagai hasil awal dan mengatakan replikasi independen, adjudikasi klinis atas jawaban acuan, serta pemeriksaan kestabilan antarpercobaan masih tertunda. Makalah secara eksplisit melarang penggunaan hasilnya untuk memandu perawatan klinis.

Ambang probabilitas memberi manfaat yang tidak merata. Pada MetaMedQA, 52,9% pilihan Jev memiliki tingkat keyakinan setidaknya 0,9 dan akurasinya 93,4%. Pada tingkat cakupan serupa, GPT-6 sama akuratnya atau lebih akurat. Pada DiagnosisArena, peringkat probabilitas Jev lemah: dengan ambang 0,9 yang sama, hanya 17,3% butir yang diterima, dan satu dari empat jawaban yang diterima tetap salah. Pada setiap benchmark, rata-rata probabilitas opsi yang dipilih model melampaui akurasinya. Dalam sampel ini, skor tinggi tidak berarti kepastian.

## Apa yang dapat dipelajari tim dari studi ini

Secara bersama-sama, makalah-makalah ini mendukung pengujian Jev sebagai evaluator yang spesifik untuk suatu tugas, terutama ketika keputusan dapat dibaca dari teks yang diberikan atau diperiksa berdasarkan bukti. Makalah-makalah tersebut tidak mendukung penggunaan kolom keyakinannya sebagai sakelar keselamatan universal. Beban kerja yang berbeda menghasilkan hasil yang berbeda, dan studi rubrik menunjukkan mengapa model cadangan perlu dinilai berdasarkan independensi kesalahannya, selain akurasi mentah.

Tim yang mempertimbangkan pola ini memerlukan sampel berlabel yang representatif dari tugasnya sendiri. Tim perlu menetapkan definisi keputusan yang benar, memasukkan contoh sulit dan menyesatkan, membandingkan hasil dengan tinjauan manusia atau acuan lain yang dapat dipertanggungjawabkan, lalu mengukur tingkat kesalahan sekaligus kemampuan tingkat keyakinan membedakan keputusan yang benar dan salah. Untuk cascade, tim juga perlu mencatat apakah model cadangan benar-benar memperbaiki kesalahan tahap pertama, berapa banyak kasus yang diteruskan, serta biaya dan waktu tunda yang dihasilkan. Kumpulan pengujian terpisah dapat menunjukkan apakah ambang tersebut berlaku di luar contoh yang digunakan untuk memilihnya.

Ini adalah implikasi praktis dari studi, bukan prosedur yang diuji BIG CHANGE. Kami tidak memanggil API Jev atau menjalankan benchmark lokal. [Dokumentasi API TypeSafe](https://api.typesafe.ai/docs) menjelaskan permintaan terstruktur, jenis jawaban yang diizinkan, dan penemuan model; dokumentasi tersebut tidak secara independen membuktikan akurasi pada beban kerja suatu tim. Akses produk, harga, dan model dapat berubah, jadi tim perlu memeriksa dokumentasi terkini saat merencanakan uji coba.

Untuk saat ini, Jev tampak berguna sebagai calon penilai pertama ketika tugasnya sempit, labelnya jelas, dan evaluasi lokal menunjukkan bahwa perutean berdasarkan keyakinan menangani kesalahan secara efektif. Jika penilaian memerlukan penalaran yang lebih dalam, pemberian nilai bergantung pada kebiasaan penilai yang tersembunyi, atau beberapa model membuat kesalahan yang sama, studi-studi ini memberi alasan bagi tim untuk mempertahankan tinjauan manusia atau pemeriksaan lain yang tervalidasi dalam alur kerja.

## Perubahan besar

Evaluasi baru Jev menggeser pertanyaan dari apakah model keputusan dapat memberikan keputusan murah ke kapan keputusan itu cukup berguna untuk dipertahankan. Jawabannya bergantung pada tugas: perutean berdasarkan tingkat keyakinan memperbaiki cascade evaluasi berpasangan pada data yang disisihkan, sedangkan studi rubrik terpisah menemukan sedikit peningkatan karena kesalahan bertumpang tindih. Hasil pilihan ganda medis juga sangat bervariasi menurut tingkat kesulitan tugas. Langkah berikutnya bagi tim AI adalah kumpulan validasi lokal yang memeriksa kebenaran, tingkat keyakinan, dan perilaku model cadangan secara bersamaan.

## Sumber & bacaan lebih lanjut

- [JEV sebagai Penilai: Terima Jika Yakin, Eskalasikan Jika Ragu](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan, dan Rema Padman, versi 2 bertanggal 27 September 2026. Pracetak yang membandingkan Jev dengan 16 penilai, termasuk adjudikasi manusia tersamar dan pengujian perutean keyakinan pada data yang disisihkan.
- [Jev vs. LLM sebagai Penilai Rubrik: Lebih Murah, Lebih Cepat, dan Salah di Tempat yang Sama](https://arxiv.org/abs/2609.29769v1), Delip Rao dan Chris Callison-Burch, 24 September 2026. Pracetak yang mengevaluasi penilaian rubrik biner dan bertingkat per kriteria pada sembilan panel benchmark.
- [Jev dalam Kedokteran: Evaluasi Benchmark. Hasil awal.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García dan Beatriz Merino-Barbancho, 27 September 2026. Perbandingan benchmark awal pada empat kumpulan data pilihan ganda medis; bukan studi klinis.
- [Dokumentasi API TypeSafe](https://api.typesafe.ai/docs), referensi resmi untuk antarmuka permintaan dan keluaran terstruktur Jev. Dokumentasi menjelaskan perilaku produk, bukan evaluasi kinerja independen.

## Sources

- [JEV sebagai Penilai: Terima Jika Yakin, Eskalasikan Jika Ragu (v2)](https://arxiv.org/abs/2609.26550v2) — Pracetak utama, diajukan 22 September dan direvisi 27 September. Membandingkan Jev 1.13 dengan 16 penilai untuk tugas preferensi, faktualitas berbasis bukti, dan jawaban akhir; mencakup adjudikasi tersamar terpilih, analisis cascade luring yang dibekukan, dan dua pengujian langsung prospektif pada beban kerja yang disisihkan. Belum ditinjau sejawat atau menjadi studi penerapan; batasan tentang penyetaraan komputasi, adjudikasi terpilih, ragam beban kerja, biaya, dan waktu dicatat dalam SOURCE-AUDIT.md.
- [Jev vs. LLM sebagai Penilai Rubrik: Lebih Murah, Lebih Cepat, dan Salah di Tempat yang Sama (v1)](https://arxiv.org/abs/2609.29769v1) — Pracetak utama yang membandingkan Jev dengan tiga LLM kelas flash pada sembilan panel benchmark dan 5.003 pasangan butir rubrik. Teks kriterianya sama; dua panel biner dan tujuh panel bertingkat. Menunjukkan kesalahan berkorelasi yang disampaikan dengan yakin serta analisis perutean yang sebagian besar berbasis pemutaran ulang. Belum ditinjau sejawat; banyak perbandingan tidak konklusif secara statistik dan temuannya dibatasi oleh rubrik, panel, dan kondisi layanan yang dipilih.
- [Jev dalam Kedokteran: Evaluasi Benchmark. Hasil awal. (v1)](https://arxiv.org/abs/2609.34024v1) — Pracetak awal utama yang menguji Jev 1.13 terhadap GPT-6 Sol pada empat benchmark pilihan ganda medis. Mencakup akurasi, kalibrasi/prediksi selektif, abstensi, latensi, dan biaya. Tidak ada penerapan klinis atau adjudikasi klinisi; penulis menyatakan replikasi independen dan verifikasi hasil masih tertunda serta menyarankan agar hasilnya tidak digunakan untuk perawatan klinis.
- [Dokumentasi API TypeSafe](https://api.typesafe.ai/docs) — Dokumentasi OpenAPI resmi yang diakses 29 September 2026, memperlihatkan skema permintaan dan respons terstruktur, endpoint system-one, dan penemuan model. Mendukung deskripsi antarmuka saja, bukan klaim kinerja independen. Ketersediaan dan harga produk dapat berubah.
- [Reel Instagram serah terima pemilik Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — Hanya petunjuk penugasan: Reel tidak dapat diperoleh atau ditranskripsikan. Keterangan dan metadata tidak digunakan sebagai bukti; tidak ada klaim yang diatribusikan pada videonya.