AI-translated from English; not yet reviewed by a fluent editor.

# Jev தீர்ப்பு வழங்கும் AI மாதிரியின் முடிவுகள் பணி, மாற்று மாதிரி ஆகியவற்றைப் பொறுத்து மாறுகின்றன

> Jev-ஐ AI பதில்களுக்கு மதிப்பிடுபவராக மூன்று முன்அச்சுப் பிரதிகள் சோதிக்கின்றன. விருப்பத் தேர்வு, மதிப்பீட்டு அளவுகோல், மருத்துவப் பணிகள் என முடிவுகள் மாறுகின்றன; மாற்று மாதிரி Jev-இன் பிழைகளைச் சரிசெய்யும்போது மட்டுமே நம்பகத்தன்மை அடிப்படையிலான வழிமாற்றம் உதவுகிறது.

By BIG CHANGE Editorial

Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

![Charcoal illustration of a level two-pan balance, each tray holding an answer card, with orange on the central pivot.](https://bigchange.ai/api/media/file/jev-answer-balance-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

மதிப்பீட்டாளராக Jev-ஐ மூன்று புதிய முன்அச்சுப் பிரதிகள் வெவ்வேறு விதங்களில் சோதிக்கின்றன. பதில்களில் எதை விரும்புவது, ஆதார அடிப்படையிலான உண்மைத்தன்மைச் சரிபார்ப்பு ஆகியவற்றில் வலுவான மொழி மாதிரியின் மதிப்பீட்டுக்கு நெருக்கமாக இருப்பதை முதலாவது ஆய்வு கண்டது; பின்னர் நிச்சயமற்றவற்றை வேறு வழிக்கு அனுப்ப நம்பகத்தன்மையைப் பயன்படுத்தியது. மதிப்பிடப்பட்ட அளவுகோல்களில் அந்த வழிமாற்றால் சிறிதளவே பயன் கிடைத்ததாகவும், மாற்று மாதிரிகள் Jev-இன் நம்பிக்கையுடன் செய்த பிழைகளைப் பலமுறை மீண்டும் செய்ததாகவும் இரண்டாவது ஆய்வு கண்டது. மூன்றாவது மருத்துவ அளவுகோல், ஆய்வு சுருக்கம் சார்ந்த கேள்விகளில் ஒத்த துல்லியத்தையும் கடினமான நோயறிதல் நிகழ்வுகளில் கணிசமான இடைவெளிகளையும் தெரிவித்தது.

நடைமுறைப் பதில் “AI-ஐ AI மதிப்பிடலாம்” என்பதைவிடக் குறுகியது. தெளிவாக வரையறுக்கப்பட்ட பணிக்கான விரைவான முதல்நிலை மதிப்பீட்டாளராக Jev உதவக்கூடும்; ஆனால் எல்லா வகைப் பதில்களுக்கும் நம்பகமான ஒரே மதிப்பீட்டாளரை இந்த ஆதாரம் நிறுவவில்லை. தங்கள் சொந்த எடுத்துக்காட்டுகளில் அது எதை முன்னறிவிக்கிறது எனக் குழு சரிபார்த்த பிறகே நம்பகத்தன்மையை வைத்து பணியை வழிமாற்றுவது பயனளிக்கலாம்.

## மாதிரி ஒன்றை மதிப்பிடுவது என்றால் என்ன

மதிப்பீட்டாளர் ஒன்று அல்லது அதற்கு மேற்பட்ட மாதிரி வெளியீடுகளைப் பெற்று, ஒரு விதியின்படி மதிப்பெண் அல்லது தீர்ப்பை வழங்கும். இரண்டு பதில்களில் எது prompt-ஐச் சிறப்பாகப் பின்பற்றுகிறது எனத் தேர்ந்தெடுக்கலாம்; கொடுக்கப்பட்ட ஆவணங்கள் ஒரு கூற்றுக்கு ஆதரவளிக்கின்றனவா எனத் தீர்மானிக்கலாம்; பதிலை மதிப்பீட்டு அளவுகோலுடன் ஒப்பிட்டு மதிப்பிடலாம்; அல்லது மருத்துவத் தேர்வுக் கேள்வியில் சரியான விடையைத் தேர்ந்தெடுக்கலாம். இந்தப் பணிகள் ஒவ்வொன்றும் மதிப்பீட்டாளரிடம் வேறுபட்ட திறன்களைக் கோருகின்றன.

Jev என்பது TypeSafe வழங்கும் hosted தீர்மான மாதிரி. அதன் API கட்டமைக்கப்பட்ட உள்ளீட்டையும் அனுமதிக்கப்பட்ட பதில் வகையையும் ஏற்று, அனுமதிக்கப்பட்ட குறிச்சொற்களுக்கான நிகழ்தகவுகளுடன் ஒரு தேர்வையோ மதிப்பெண்ணையோ திருப்பும். வரையறுக்கப்பட்ட முடிவை எதிர்பார்க்கும் மென்பொருளில் ஒரு பணியைப் பொருத்த இந்த இடைமுகம் உதவும். இருப்பினும், நிகழ்தகவு என்பது மாதிரியின் மதிப்பீடு; அடிப்படைப் பதிலை அது தனியாகச் சரிபார்ப்பதில்லை. TypeSafe ஆவணங்கள் இடைமுகத்தை விளக்குகின்றன; கீழுள்ள ஆய்வுகள் குறிப்பிட்ட சோதனைத் தொகுப்புகளில் செயல்திறனை ஒப்பிடுகின்றன.

முதல் [JEV-as-a-Judge ஆய்வு](https://arxiv.org/abs/2609.26550v2), செப்டம்பர் 27 அன்று திருத்தப்பட்டது; Jev 1.13-ஐ 16 உருவாக்கும் மற்றும் reward மாதிரி மதிப்பீட்டாளர்களுடன் ஒப்பிடுகிறது. [அளவுகோல் மதிப்பீட்டாளர் ஆய்வு](https://arxiv.org/abs/2609.29769v1), செப்டம்பர் 24 அன்று வெளியிடப்பட்டது; Jev-ஐ குறைந்த செலவுள்ள மூன்று மொழி மாதிரிகளுடன் ஒப்பிடுகிறது. [மருத்துவத் தரநிலை ஆய்வு](https://arxiv.org/abs/2609.34024v1), செப்டம்பர் 27 அன்று வெளியிடப்பட்டது; Jev 1.13-ஐ இரண்டு reasoning அமைப்புகளில் GPT-6 Sol-உடன் ஒப்பிடுகிறது. மூன்றும் முன்அச்சுப் பிரதிகள். எதுவும் மருத்துவப் பயன்பாட்டு ஆய்வு அல்ல; எதுவும் ஆய்வாளர் மதிப்பாய்வைப் பெறவில்லை.

## சில தீர்ப்புகளில் நெருக்கம்; காரணமறிதலில் பலவீனம்

முதலாவது ஆய்வு, விருப்ப இணைகள், ஆதாரத்துடன் ஒப்பிட்ட உண்மைத்தன்மை, இறுதிப் பதில் சரிபார்ப்பு ஆகியவற்றில் மொத்தம் 5,172 தீர்ப்புகளை மதிப்பிட்டு, தொடர்ந்து சில சோதனைகளையும் முன்பே பயன்படுத்தாத இரண்டு வழிமாற்று ஆய்வுகளையும் சேர்த்தது. Jev-இன் முக்கியப் பொதுத் தரநிலை மதிப்பெண்கள்: மாதிரியாகத் தேர்ந்தெடுத்த 1,500 RewardBench விருப்ப இணைகளில் 92.5%; 350 JudgeBench இணைகளில் 78.6%; ஆதாரத்துடன் மதிப்பிட்ட 3,000 HaluEval பதில்களில் 87.3%. அதே பணிகளில் வலுவான GPT-6 Astra ஒப்பீட்டு மாதிரி முறையே 92.5%, 93.1%, 88.4% பெற்றது. ஆய்வின் நேர அளவீட்டில் 1,000 அடிப்படைத் தீர்ப்புகளுக்கு Jev $0.044 செலவும் 0.15 வினாடி சராசரி தாமதமும் கொண்டதாகக் கூறப்பட்டது; ஆய்வு நிபந்தனைகளில் GPT-6 Astra $12.182 செலவும் 1.89 வினாடியும் எடுத்தது.

இந்தச் சராசரிகள் ஆய்வாளர்கள் கண்ட வரம்பை மறைக்கின்றன. உரையாடல் தரம், பாதுகாப்பு மறுப்புகள், ஆதாரத்துடன் சரிபார்க்கும் உண்மைத்தன்மை ஆகியவற்றில் GPT-6-ஐவிட சுமார் இரண்டு புள்ளிகளுக்குள் Jev இருந்தது. ஆனால் முடிவைப் பெறவோ சரிபார்க்கவோ காரணமறிதல் தேவைப்படும் பணிகளில் அது பின்தங்கியது: கணிதத்தில் 14.3 புள்ளிகள், குறியீட்டில் 12.9 புள்ளிகள், தர்க்கப் புதிர்களில் 27.6 புள்ளிகள். JudgeBench-இன் புறநிலைச் சரித்தன்மைத் தொகுப்பில் GPT-6-இன் 93.1%-க்கு எதிராக Jev 78.6% பெற்றது. சர்ச்சைக்குரிய 990 உருப்படிகளைக் கொண்ட துணைத் தொகுப்பில், யாருடைய மதிப்பீட்டாளர் எந்த மாதிரி என மறைத்த தீர்ப்பாய்வு, விவாதத்துக்குரிய 69 JudgeBench உருப்படிகளில் 57-இல் GPT-6-ஐ ஆதரித்தது; ஒன்றில் Jev-ஐ ஆதரித்தது. இந்தத் தீர்ப்பாய்வு தேர்ந்தெடுக்கப்பட்ட சிறு பகுதியை மட்டுமே கொண்டாலும், இடைவெளி தரநிலையின் குறிச்சொற்களில் உள்ள சிக்கல் மட்டுமல்ல எனக் காட்டுகிறது.

இங்கு “மதிப்பீட்டாளர்” என்பதன் பொருள், உருவாக்கப்பட்ட இரண்டு பதில்களில் ஒன்றைத் தேர்ந்தெடுப்பது அல்லது வழங்கப்பட்ட குறிப்பை வைத்துத் தனிப் பதில் ஆதரிக்கப்படுகிறதா அல்லது சரியானதா எனத் தீர்மானிப்பது. காரண விளக்கமின்றி, Jev பயன்படுத்திய அதே கட்டுப்படுத்தப்பட்ட தீர்ப்பு மற்றும் நிகழ்தகவு வெளியீட்டு வடிவத்தையே மற்ற உருவாக்கும் மதிப்பீட்டாளர்களுக்கும் ஆய்வாளர்கள் வழங்கினர். ஆகவே இந்த ஒப்பீடு குறிப்பிட்ட ஒப்பந்தத்தின்படி வழங்கிய தீர்ப்புகளைப் பற்றியது; மனிதருக்கு யார் தங்கள் காரணத்தை விளக்க முடியும் என்பதைப் பற்றியது அல்ல.

## நம்பகத்தன்மை வழிமாற்றம், பிழைகள் வேறுபட்டிருக்கும்போது உதவுகிறது

தொடர்முறை, குறைந்த செலவுள்ள முதல்நிலை மதிப்பீட்டாளரைப் பயன்படுத்தி, சில நிகழ்வுகளை அதிக செலவுள்ள மாற்று மதிப்பீட்டாளரிடம் அனுப்பும். முதலாவது ஆய்வில், Jev-இன் அதிகபட்சக் குறிச்சொல் நிகழ்தகவு குறைந்தது 0.9 ஆக இருந்தால் அதன் தீர்ப்பை ஏற்றுக்கொண்டு, அதற்குக் குறைந்த நம்பகத்தன்மையுள்ளவற்றை அடுத்த கட்டத்துக்கு அனுப்பினர். முன்பே பயன்படுத்தாத 1,610 விருப்ப இணைகளில், இரு வரிசை கொண்ட இந்தத் தொடர்முறை 31.5% நிகழ்வுகளை மட்டும் மேலே அனுப்பி, GPT-6-இன் 92.5%-க்கு எதிராக 93.4% துல்லியம் பெற்றது; GPT-6 கட்டணத்தில் 41% மட்டுமே செலவானது. இரண்டு புதிய சரித்தன்மைப் பணிகளிலிருந்து முன்பே ஒதுக்கி வைத்த 570 இணைகளைக் கொண்ட நேரடிச் சோதனையில், Jev மட்டும் GPT-6-ஐவிட 14 புள்ளிகள் பின்தங்கியது; 74% நிகழ்வுகளை மேலே அனுப்பிய தொடர்முறை GPT-6-க்கு இணையான துல்லியத்தைப் பெற்று, அதன் கட்டணத்தில் சுமார் கால் பகுதியைச் சேமித்தது.

இதற்கு ஒரு குறிப்பிட்ட நிபந்தனை உண்டு: Jev-க்கு நிச்சயமில்லாத நிகழ்வுகளில் உள்ள பிழைகளை மாற்று மாதிரி சரிசெய்யக்கூடியதாக இருக்க வேண்டும். பாணியை ஏமாற்றும் இணைகளிலும், ஆதாரக் குறிப்பு இல்லாத உரைநடையிலும் நம்பகத்தன்மை வழிமாற்றம் பலவீனமடைந்தது; அங்கு சோதித்த எல்லா மதிப்பீட்டாளர்களும் தோராயமாகச் சீரற்ற அளவில் இருந்தபோதும் பலமுறை மிகுந்த நம்பிக்கையுடன் பதிலளித்தனர் என ஆய்வாளர்கள் கண்டனர். இரு பதில்களின் வரிசையிலும் முடிவுகளைச் சராசரியாக்குவது இடவரிசை விளைவுகளைக் குறைத்தது என்றும் ஆய்வு கண்டது. உள்ளூர் குறிச்சொல் எடுத்துக்காட்டுகளைப் பயன்படுத்தி வரம்புகள் தேர்ந்தெடுக்கப்பட்டன; குறைந்த நம்பகத்தன்மை எல்லை முறையையும், முன்பே பயன்படுத்தாத தொகுப்பில் மறுசரிபார்ப்பையும் ஆய்வுக் கட்டுரை பரிந்துரைக்கிறது.

தனி அளவுகோல் ஆய்வு, ஏழு தரநிலைகளிலிருந்து எடுக்கப்பட்ட ஒன்பது குழுக்களில் ஒரு நிபந்தனைக்கான மதிப்பீட்டைச் சோதித்தது; மொத்தம் 5,003 உருப்படி–நிபந்தனை இணைகள். இரண்டு குழுக்கள் இருமத் தேர்வு கொண்டவை; ஏழு குழுக்கள் வரிசைப்படுத்தப்பட்ட மதிப்பீட்டு அளவுகோல்களைப் பயன்படுத்தின. எல்லா நான்கு மதிப்பீட்டாளர்களுக்கும் ஒரே நிபந்தனை உரை காட்டப்பட்டது; மதிப்பீட்டுக்கு முன்பே ஆய்வாளர்கள் அளவுகோல்களை நிலைநிறுத்தினர். இணையாக ஒப்பிட்ட 27 சோதனைகளில் எட்டில், துல்லிய வேறுபாட்டுக்கான 95% நம்பக இடைவெளி பூஜ்யத்தை உள்ளடக்கவில்லை; பல ஒப்பீடுகளுக்குத் திருத்திய பிறகு நான்கு மட்டுமே அப்படியே இருந்தன. வேறு சில ஒப்பீடுகள் ஆய்வுக் கட்டுரையின் சமத்துவ வரம்புக்குள் வந்தன; பலவற்றில் வேறுபாட்டையோ சமத்துவத்தையோ நிறுவுவதற்குத் தரவு போதுமான துல்லியமில்லை. இருமத் தேர்வு நிபந்தனைகளில் Jev மற்றவர்களுடன் ஒப்பிடும்போது சிறப்பாகச் செயல்பட்டது. மதிப்பீட்டு அளவுகோல் கொண்ட குழுக்களில் அது ஒருபோதும் இணையான மதிப்பீட்டாளர்களில் முதன்மையாக இருக்கவில்லை; எல்லா மதிப்பீட்டாளர்களும் மனித மதிப்பீட்டாளர்களைவிடக் குறைந்த மதிப்பெண் வழங்க முனைந்தனர்.

அந்த அமைப்பில் விலை, வேகச் சேமிப்பு பெரிதாக இருந்தன. ஒன்பது குழுக்களுக்கும் Jev சுமார் ஆறு சென்ட் செலவானது; மூன்று மொழி மாதிரி மதிப்பீட்டாளர்களுக்கு 29 முதல் 325 மடங்கு அதிகச் செலவும், 30 முதல் 220 மடங்கு அதிக நேரமும் தேவைப்பட்டன. இருந்தும் Jev-இன் நம்பகத்தன்மை வலுவான தொடர்முறையை உருவாக்கவில்லை. பெரும்பாலான குழுக்களில் அதன் பிழைகளை நம்பகத்தன்மை தரவரிசைப்படுத்தியது; ஆனால் மாற்று மாதிரிகள் Jev-இன் மிகுந்த நம்பிக்கையுடனான பெரும்பாலான தவறுகளை அப்படியே மீண்டும் செய்தன. பல முறை பொருத்திய வரம்புகளுடன், சிறந்த தனி மதிப்பீட்டாளரைவிட தொடர்முறை சராசரியாக அதிகபட்சம் 1.5 சதவீதப் புள்ளிகள் மட்டுமே முன்னேறியது; ஒன்பதில் ஆறு குழுக்களில் அந்தச் சிறந்த தனி மதிப்பீட்டாளரைவிட மோசமாக இருந்தது. இந்த மறுஇயக்கத்தில் முன்கூட்டிய நேரடி வெளியீட்டுக்குப் பதிலாகப் பதிவுசெய்த தீர்ப்புகள் பயன்படுத்தப்பட்டன.

இரு ஆய்வுகளின் வேறுபாடு கவனிக்கத்தக்கது. ஜோடி பதில் ஒப்பீடுகளில், Jev-இன் குறைந்த நம்பகத்தன்மை பிழைகளுக்கும் வலுவான மாற்று மாதிரியின் திறன்களுக்கும் இடையே பயனுள்ள பிரிப்பு இருப்பதாக முதல் ஆய்வு கண்டது. நிபந்தனை மதிப்பீட்டில் மாற்று மாதிரியும் பலமுறை அதே பிழைகளைப் பகிர்ந்ததால், மேலே அனுப்புவது திருத்தமின்றிச் செலவைச் சேர்த்தது. மற்றொரு மாதிரி பயனுள்ள வகையில் மாறுபட்ட தீர்ப்பு தருமா என்பதை மாதிரியின் நம்பகத்தன்மைக் குறியீடு மட்டும் ஒரு அணிக்குச் சொல்லாது.

## மருத்துவத் தேர்வு முடிவுகள் பணியின் கடினத்தைப் பொறுத்தவை

மருத்துவ ஆய்வு, ஏற்கெனவே உள்ள நான்கு தரவுத்தொகுப்புகளில் Jev-ஐ மதிப்பிட்டது: 1,373 MetaMedQA தேர்வுக் கேள்விகள்; ஆய்வுச் சுருக்கங்களிலிருந்து பதிலளிக்கப்பட்ட 500 PubMedQA கேள்விகள்; DiagnosisArena-வின் 915 பல்தேர்வு நிகழ்வுகள்; வெளியிடப்பட்ட இறுதி நோயறிதலுடன் கூடிய 34 NEJM Case Challenges. நடுத்தர reasoning உடனும் reasoning இல்லாமலும் Jev-ஐ GPT-6 Sol-உடன் ஒப்பிட்டது. மொத்தம் 8,469 மாதிரி கோரிக்கைகள் அனுப்பப்பட்டன; ஒவ்வொன்றும் சரியான கட்டமைக்கப்பட்ட பதிலைத் திருப்பியது.

PubMedQA-வில் Jev மற்றும் நடுத்தர reasoning உடைய GPT-6 Sol முறையே 78.4%, 78.2% பெற்றன. MetaMedQA-வில் Jev 74.8% பெற்றது; GPT-6 Sol 82.7%. DiagnosisArena-வில் அவை 59.8%, 82.4%; NEJM-இன் 34 நிகழ்வுகளில் 61.8%, 82.4% பெற்றன. reasoning இல்லாத GPT-6-க்கும் கடினமான இரு நிகழ்வுத் தொகுப்புகளில் உயர்ந்த மதிப்பீட்டு முடிவுகள் இருந்தன. 34 NEJM நிகழ்வுகளின் மதிப்பீடு துல்லியமற்றது; பல ஒப்பீடுகளுக்குத் திருத்திய பிறகு அதன் முதன்மை ஒப்பீடு புள்ளிவிவர ரீதியாக முக்கியத்துவம் பெறவில்லை. DiagnosisArena-வின் மிகப் பெரிய இடைவெளி வெளிப்படையான reasoning இன்றியும் நீடித்தது.

கொடுக்கப்பட்ட தேர்வுகளில் ஒன்றைத் தேர்ந்தெடுப்பதே இச்சோதனை; வேறுபாட்டு நோயறிதலை உருவாக்குவதோ நோயாளிகளுக்கு சிகிச்சை அளிப்பதோ அல்ல. தரநிலையின் பதில்களை மருத்துவர்கள் தீர்ப்பாய்வு செய்ததாக ஆய்வுக் கட்டுரை தெரிவிக்கவில்லை. NEJM படங்கள் மாதிரிகளுக்கு விளக்க உரைகளாக வழங்கப்பட்டன என்றும், சவாலான DiagnosisArena நிகழ்வுகள் பிற மொழி மாதிரிகளுக்கு எதிராக வடிகட்டப்பட்டன என்றும் அது குறிப்பிடுகிறது. முடிவுகள் தொடக்கநிலையிலுள்ளவை; சுயாதீன மறுஆய்வு, குறிப்புப் பதில்களுக்கான மருத்துவத் தீர்ப்பாய்வு, ஒவ்வொரு இயக்கத்திலும் முடிவுகள் நிலைத்திருக்கிறதா என்ற சோதனை ஆகியவை இன்னும் நிலுவையில் உள்ளன என ஆசிரியர்கள் கூறுகின்றனர். மருத்துவப் பராமரிப்பை வழிநடத்த இம்முடிவுகளைப் பயன்படுத்த வேண்டாம் என்றும் ஆய்வுக் கட்டுரை வெளிப்படையாகச் சொல்கிறது.

நிகழ்தகவு வரம்புகளின் பயன் சீராக இல்லை. MetaMedQA-வில் Jev-இன் தேர்வுகளில் 52.9%-க்கு குறைந்தது 0.9 நம்பகத்தன்மை இருந்தது; அவற்றில் 93.4% சரியாக இருந்தன. ஏறத்தாழ அதே அளவு கேள்விகளை ஏற்ற GPT-6 அதே அளவு துல்லியமாகவோ அதைவிடச் சிறப்பாகவோ இருந்தது. DiagnosisArena-வில் Jev-இன் நிகழ்தகவு தரவரிசை பலவீனமாக இருந்தது: அதே 0.9 வரம்பில் 17.3% உருப்படிகளை மட்டுமே ஏற்றுக்கொண்டது; ஏற்றுக்கொண்ட பதில்களில் நான்கில் ஒன்று தவறாகவே இருந்தது. எல்லாத் தரநிலைகளிலும் மாதிரிகள் தேர்ந்தெடுத்த விடைக்குக் கொடுத்த சராசரி நிகழ்தகவு அவற்றின் உண்மைத் துல்லியத்தைவிட அதிகமாக இருந்தது. இந்த மாதிரியில் உயர்ந்த மதிப்பெண் என்பது உறுதி என்பதல்ல.

## இந்த ஆய்வுகளிலிருந்து அணிகள் பெறக்கூடிய பாடங்கள்

ஒன்றாகப் பார்க்கும்போது, வழங்கிய உரையிலிருந்து தீர்ப்பைப் பெறவோ ஆதாரத்துடன் சரிபார்க்கவோ கூடிய பணிகளில், குறிப்பிட்ட பணிக்கான மதிப்பீட்டாளராக Jev-ஐச் சோதிப்பதை இந்த ஆய்வுகள் ஆதரிக்கின்றன. அதன் நம்பகத்தன்மை வெளியீட்டை எல்லா சூழலுக்கும் பொருந்தும் பாதுகாப்புச் சுவிட்சாகக் கருதுவதை அவை ஆதரிக்கவில்லை. வெவ்வேறு பணிச்சுமைகளில் வெவ்வேறு முடிவுகள் கிடைத்தன; மாற்று மதிப்பீட்டாளரைத் தேர்ந்தெடுக்கும்போது அதன் ஒட்டுமொத்தத் துல்லியத்துடன் பிழைகள் ஒன்றுடன் ஒன்று பொருந்தாமல் உள்ளனவா என்பதையும் மதிப்பிட வேண்டும் என அளவுகோல் ஆய்வு காட்டுகிறது.

இந்த முறையைப் பரிசீலிக்கும் அணி, தனது பணியிலிருந்து பிரதிநிதித்துவமான, குறிச்சொல் பதித்த மாதிரியைத் தயாரிக்க வேண்டும். சரியான முடிவு எது என வரையறுத்து, கடினமான மற்றும் தவறாக வழிநடத்தும் எடுத்துக்காட்டுகளைச் சேர்த்து, மனித ஆய்வு அல்லது நியாயப்படுத்தக்கூடிய வேறு குறிப்புடன் ஒப்பிட வேண்டும்; பின்னர் பிழை விகிதங்களையும் சரி/தவறான முடிவுகளை நம்பகத்தன்மை எவ்வளவு நன்றாக வேறுபடுத்துகிறது என்பதையும் அளக்க வேண்டும். தொடர்முறையில், மாற்று மதிப்பீட்டாளர் முதல் கட்டப் பிழைகளை உண்மையில் சரிசெய்ததா, எத்தனை நிகழ்வுகள் மேலே அனுப்பப்பட்டன, அதனால் ஏற்பட்ட செலவும் தாமதமும் என்ன என்பதையும் பதிவு செய்ய வேண்டும். வரம்பைத் தேர்ந்தெடுக்கப் பயன்படுத்திய எடுத்துக்காட்டுகளுக்கு அப்பாலும் அது பொருந்துகிறதா என்பதை ஒதுக்கிவைத்த சோதனைத் தொகுப்பு காட்டும்.

இவை ஆய்வுகளிலிருந்து பெறப்படும் நடைமுறைப் பொருள்கள்; BIG CHANGE சோதித்த செயல்முறை அல்ல. Jev API-ஐ அழைக்கவோ உள்ளூர் தரநிலைச் சோதனையை இயக்கவோ நாங்கள் இல்லை. TypeSafe-இன் [API ஆவணம்](https://api.typesafe.ai/docs) கட்டமைக்கப்பட்ட கோரிக்கைகள், அனுமதிக்கப்பட்ட பதில் வகைகள், மாதிரித் தேடல் ஆகியவற்றை விளக்குகிறது; ஒரு குழுவின் பணிச்சுமையில் துல்லியம் இருப்பதை அது சுயாதீனமாக நிறுவாது. தயாரிப்பு அணுகல், விலைகள், மாதிரிகள் மாறக்கூடும்; ஆகவே சோதனையைத் திட்டமிடும்போது தற்போதைய ஆவணங்களை அணிகள் சரிபார்க்க வேண்டும்.

இப்போதைக்கு, பணி குறுகியதாகவும் குறிச்சொற்கள் தெளிவாகவும் இருந்து, உள்ளூர் மதிப்பீடு நம்பகத்தன்மை பிழைகளைச் சரியாக வழிமாற்றுகிறது எனக் காட்டினால், முதல் நிலை மதிப்பீட்டாளராக Jev பயனுள்ள தேர்வாகத் தெரிகிறது. ஆழமான காரணமறிதல் தேவைப்பட்டாலோ, மறைந்துள்ள மதிப்பீட்டாளர் மரபுகளைப் பொறுத்து மதிப்பெண் மாறினாலோ, பல மாதிரிகளும் ஒரே பிழைகளைச் செய்தாலோ, மனித ஆய்வையோ சரிபார்க்கப்பட்ட வேறு சோதனையையோ தொடர வேண்டிய காரணத்தை இந்த ஆய்வுகள் அணிகளுக்கு அளிக்கின்றன.

## முக்கிய மாற்றம்

மலிவான தீர்ப்பை வழங்கும் முடிவு மாதிரி இருக்குமா என்ற கேள்வியிலிருந்து, எந்தச் சூழலில் அந்தத் தீர்ப்பைத் தக்கவைத்துக்கொள்ளும் அளவு பயன் இருக்கும் என்ற கேள்விக்கு Jev-இன் புதிய மதிப்பீடுகள் நகர்த்துகின்றன. பதில் பணியைப் பொறுத்தது: முன்பே பயன்படுத்தாத ஜோடி ஒப்பீட்டு மதிப்பீட்டில் நம்பகத்தன்மை வழிமாற்றம் தொடர்முறையை மேம்படுத்தியது; பிழைகள் ஒன்றோடொன்று ஒத்திருந்ததால் தனி அளவுகோல் ஆய்வில் ஆதாயம் குறைவாக இருந்தது. மருத்துவத் தேர்வு முடிவுகளும் பணியின் கடினத்தைப் பொறுத்து பெரிதாக மாறின. AI அணிகளின் அடுத்த படி, சரித்தன்மை, நம்பகத்தன்மை, மாற்று மாதிரி எவ்வாறு செயல்படுகிறது ஆகியவற்றை ஒன்றாகச் சோதிக்கும் உள்ளூர் சரிபார்ப்புத் தொகுப்பை உருவாக்குவதாகும்.

## ஆதாரங்களும் மேலும் வாசிப்பும்

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure](https://arxiv.org/abs/2609.26550v2), Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman; செப்டம்பர் 27, 2026 தேதியிட்ட இரண்டாம் பதிப்பு. யாருடைய மதிப்பீட்டாளர் எந்த மாதிரி என மறைத்த மனிதத் தீர்ப்பாய்வும், முன்பே பயன்படுத்தாத நம்பகத்தன்மை வழிமாற்றுச் சோதனைகளும் உட்பட Jev-ஐ 16 மதிப்பீட்டாளர்களுடன் ஒப்பிடும் முன்அச்சுப் பிரதி.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places](https://arxiv.org/abs/2609.29769v1), Delip Rao, Chris Callison-Burch; 2026 செப்டம்பர் 24. ஒன்பது தரநிலை குழுக்களில் ஒவ்வொரு நிபந்தனைக்கான இரும மற்றும் தரப்படுத்தப்பட்ட மதிப்பீடுகளை ஆராயும் முன்அச்சுப் பிரதி.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results.](https://arxiv.org/abs/2609.34024v1), Alfredo Madrid-García, Beatriz Merino-Barbancho; 2026 செப்டம்பர் 27. மருத்துவப் பல்தேர்வுத் தரவுத்தொகுப்புகள் நான்கில் முன்தொடக்க ஒப்பீடு; மருத்துவ ஆய்வு அல்ல.
- [TypeSafe API ஆவணம்](https://api.typesafe.ai/docs), Jev-இன் கட்டமைக்கப்பட்ட கோரிக்கை மற்றும் வெளியீட்டு இடைமுகத்துக்கான அதிகாரப்பூர்வக் குறிப்பு. ஆவணம் தயாரிப்பு நடத்தை பற்றி விளக்குகிறது; சுயாதீன மதிப்பீடு அல்ல.

## Sources

- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure (v2)](https://arxiv.org/abs/2609.26550v2) — முதன்மை முன்அச்சுப் பிரதி; செப்டம்பர் 22 அன்று சமர்ப்பிக்கப்பட்டு, செப்டம்பர் 27 அன்று திருத்தப்பட்டது. விருப்பத் தேர்வு, ஆதாரத்துடன் சரிபார்க்கும் உண்மைத்தன்மை, இறுதிப் பதில் பணிகள் ஆகியவற்றில் Jev 1.13-ஐ 16 மதிப்பீட்டாளர்களுடன் ஒப்பிட்டது; தேர்ந்தெடுக்கப்பட்ட, யார் மதிப்பீடு செய்தார்கள் என மறைத்த தீர்ப்பாய்வு, உறையவைக்கப்பட்ட offline தொடர்முறைப் பகுப்பாய்வுகள், முன்பே திட்டமிட்ட நேரடி முன்பயன்பாட்டு-விலக்கு பணிச் சோதனைகள் இரண்டையும் கொண்டது. ஆய்வாளர் மதிப்பாய்வோ பயன்பாட்டில் நிறுவிய ஆய்வோ இல்லை; கணிப்புச் செலவு ஒப்பீடு, தேர்ந்தெடுத்த தீர்ப்பாய்வு, பணிவகை விரிவு, செலவு, நேர அளவீடு குறித்த வரம்புகள் SOURCE-AUDIT.md-இல் பதிவாகியுள்ளன.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places (v1)](https://arxiv.org/abs/2609.29769v1) — ஒன்பது தரநிலைத் தொகுப்புகளின் 5,003 அளவுகோல் உருப்படி இணைகளில், Jev-ஐ மூன்று flash-நிலை LLM-களுடன் ஒப்பிடும் முதன்மை முன்அச்சுப் பிரதி. ஒரே நிபந்தனை உரைகள்; இரண்டு இருமத் தேர்வு, ஏழு தரப்படுத்தப்பட்ட குழுக்கள். தொடர்புடைய, நம்பிக்கையுடனான பிழைகளையும், பெரும்பாலும் பதிவுகளைக் கொண்டு பகுப்பாய்வு செய்த வழிமாற்றையும் காட்டுகிறது. ஆய்வாளர் மதிப்பாய்வு செய்யவில்லை; பல ஒப்பீடுகள் புள்ளிவிவர ரீதியாகத் தெளிவற்றவை; தேர்ந்தெடுத்த அளவுகோல்கள், குழுக்கள், சேவை நிபந்தனைகளுக்குள் மட்டுமே முடிவுகள் பொருந்தும்.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results. (v1)](https://arxiv.org/abs/2609.34024v1) — நான்கு மருத்துவப் பல்தேர்வு தரநிலைகளில் Jev 1.13-ஐ GPT-6 Sol-உடன் சோதிக்கும் தொடக்கநிலை முதன்மை முன்அச்சுப் பிரதி. துல்லியம், அளவுத்திருத்தம்/தேர்ந்தெடுத்த கணிப்பு, பதிலளிக்காமை, தாமதம், செலவு ஆகியவை இடம்பெறுகின்றன. மருத்துவப் பயன்பாடோ மருத்துவர் தீர்ப்பாய்வோ இல்லை; சுயாதீன மறுஆய்வும் முடிவு சரிபார்ப்பும் நிலுவையில் உள்ளதாக ஆசிரியர்கள் கூறி, மருத்துவப் பராமரிப்பில் பயன்படுத்த வேண்டாம் என அறிவுறுத்துகின்றனர்.
- [TypeSafe API ஆவணம்](https://api.typesafe.ai/docs) — 2026 செப்டம்பர் 29 அன்று அணுகப்பட்ட அதிகாரப்பூர்வ OpenAPI ஆவணம்; கட்டமைக்கப்பட்ட கோரிக்கை/பதில் வடிவங்கள், system-one endpoint, மாதிரித் தேடல் ஆகியவற்றைக் காட்டுகிறது. இடைமுக விளக்கத்துக்கு ஆதாரம்; சுயாதீன செயல்திறன் கூற்றுகளுக்கு அல்ல. தயாரிப்பு கிடைப்பும் விலைகளும் மாறலாம்.
- [உரிமையாளர் ஒப்படைத்த Instagram Reel Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — பணிக்கான தொடக்கக் குறிப்பு மட்டுமே: Reel-ஐப் பெறவோ படியெடுக்கவோ முடியவில்லை. Caption மற்றும் metadata ஆதாரமாகப் பயன்படுத்தப்படவில்லை; காணொளிக் காட்சிகளுக்கு எந்தக் கூற்றும் சுமத்தப்படவில்லை.
