மதிப்பீட்டாளராக Jev-ஐ மூன்று புதிய முன்அச்சுப் பிரதிகள் வெவ்வேறு விதங்களில் சோதிக்கின்றன. பதில்களில் எதை விரும்புவது, ஆதார அடிப்படையிலான உண்மைத்தன்மைச் சரிபார்ப்பு ஆகியவற்றில் வலுவான மொழி மாதிரியின் மதிப்பீட்டுக்கு நெருக்கமாக இருப்பதை முதலாவது ஆய்வு கண்டது; பின்னர் நிச்சயமற்றவற்றை வேறு வழிக்கு அனுப்ப நம்பகத்தன்மையைப் பயன்படுத்தியது. மதிப்பிடப்பட்ட அளவுகோல்களில் அந்த வழிமாற்றால் சிறிதளவே பயன் கிடைத்ததாகவும், மாற்று மாதிரிகள் Jev-இன் நம்பிக்கையுடன் செய்த பிழைகளைப் பலமுறை மீண்டும் செய்ததாகவும் இரண்டாவது ஆய்வு கண்டது. மூன்றாவது மருத்துவ அளவுகோல், ஆய்வு சுருக்கம் சார்ந்த கேள்விகளில் ஒத்த துல்லியத்தையும் கடினமான நோயறிதல் நிகழ்வுகளில் கணிசமான இடைவெளிகளையும் தெரிவித்தது.

நடைமுறைப் பதில் “AI-ஐ AI மதிப்பிடலாம்” என்பதைவிடக் குறுகியது. தெளிவாக வரையறுக்கப்பட்ட பணிக்கான விரைவான முதல்நிலை மதிப்பீட்டாளராக Jev உதவக்கூடும்; ஆனால் எல்லா வகைப் பதில்களுக்கும் நம்பகமான ஒரே மதிப்பீட்டாளரை இந்த ஆதாரம் நிறுவவில்லை. தங்கள் சொந்த எடுத்துக்காட்டுகளில் அது எதை முன்னறிவிக்கிறது எனக் குழு சரிபார்த்த பிறகே நம்பகத்தன்மையை வைத்து பணியை வழிமாற்றுவது பயனளிக்கலாம்.

மாதிரி ஒன்றை மதிப்பிடுவது என்றால் என்ன

மதிப்பீட்டாளர் ஒன்று அல்லது அதற்கு மேற்பட்ட மாதிரி வெளியீடுகளைப் பெற்று, ஒரு விதியின்படி மதிப்பெண் அல்லது தீர்ப்பை வழங்கும். இரண்டு பதில்களில் எது prompt-ஐச் சிறப்பாகப் பின்பற்றுகிறது எனத் தேர்ந்தெடுக்கலாம்; கொடுக்கப்பட்ட ஆவணங்கள் ஒரு கூற்றுக்கு ஆதரவளிக்கின்றனவா எனத் தீர்மானிக்கலாம்; பதிலை மதிப்பீட்டு அளவுகோலுடன் ஒப்பிட்டு மதிப்பிடலாம்; அல்லது மருத்துவத் தேர்வுக் கேள்வியில் சரியான விடையைத் தேர்ந்தெடுக்கலாம். இந்தப் பணிகள் ஒவ்வொன்றும் மதிப்பீட்டாளரிடம் வேறுபட்ட திறன்களைக் கோருகின்றன.

Jev என்பது TypeSafe வழங்கும் hosted தீர்மான மாதிரி. அதன் API கட்டமைக்கப்பட்ட உள்ளீட்டையும் அனுமதிக்கப்பட்ட பதில் வகையையும் ஏற்று, அனுமதிக்கப்பட்ட குறிச்சொற்களுக்கான நிகழ்தகவுகளுடன் ஒரு தேர்வையோ மதிப்பெண்ணையோ திருப்பும். வரையறுக்கப்பட்ட முடிவை எதிர்பார்க்கும் மென்பொருளில் ஒரு பணியைப் பொருத்த இந்த இடைமுகம் உதவும். இருப்பினும், நிகழ்தகவு என்பது மாதிரியின் மதிப்பீடு; அடிப்படைப் பதிலை அது தனியாகச் சரிபார்ப்பதில்லை. TypeSafe ஆவணங்கள் இடைமுகத்தை விளக்குகின்றன; கீழுள்ள ஆய்வுகள் குறிப்பிட்ட சோதனைத் தொகுப்புகளில் செயல்திறனை ஒப்பிடுகின்றன.

முதல் JEV-as-a-Judge ஆய்வு, செப்டம்பர் 27 அன்று திருத்தப்பட்டது; Jev 1.13-ஐ 16 உருவாக்கும் மற்றும் reward மாதிரி மதிப்பீட்டாளர்களுடன் ஒப்பிடுகிறது. அளவுகோல் மதிப்பீட்டாளர் ஆய்வு, செப்டம்பர் 24 அன்று வெளியிடப்பட்டது; Jev-ஐ குறைந்த செலவுள்ள மூன்று மொழி மாதிரிகளுடன் ஒப்பிடுகிறது. மருத்துவத் தரநிலை ஆய்வு, செப்டம்பர் 27 அன்று வெளியிடப்பட்டது; Jev 1.13-ஐ இரண்டு reasoning அமைப்புகளில் GPT-6 Sol-உடன் ஒப்பிடுகிறது. மூன்றும் முன்அச்சுப் பிரதிகள். எதுவும் மருத்துவப் பயன்பாட்டு ஆய்வு அல்ல; எதுவும் ஆய்வாளர் மதிப்பாய்வைப் பெறவில்லை.

சில தீர்ப்புகளில் நெருக்கம்; காரணமறிதலில் பலவீனம்

முதலாவது ஆய்வு, விருப்ப இணைகள், ஆதாரத்துடன் ஒப்பிட்ட உண்மைத்தன்மை, இறுதிப் பதில் சரிபார்ப்பு ஆகியவற்றில் மொத்தம் 5,172 தீர்ப்புகளை மதிப்பிட்டு, தொடர்ந்து சில சோதனைகளையும் முன்பே பயன்படுத்தாத இரண்டு வழிமாற்று ஆய்வுகளையும் சேர்த்தது. Jev-இன் முக்கியப் பொதுத் தரநிலை மதிப்பெண்கள்: மாதிரியாகத் தேர்ந்தெடுத்த 1,500 RewardBench விருப்ப இணைகளில் 92.5%; 350 JudgeBench இணைகளில் 78.6%; ஆதாரத்துடன் மதிப்பிட்ட 3,000 HaluEval பதில்களில் 87.3%. அதே பணிகளில் வலுவான GPT-6 Astra ஒப்பீட்டு மாதிரி முறையே 92.5%, 93.1%, 88.4% பெற்றது. ஆய்வின் நேர அளவீட்டில் 1,000 அடிப்படைத் தீர்ப்புகளுக்கு Jev $0.044 செலவும் 0.15 வினாடி சராசரி தாமதமும் கொண்டதாகக் கூறப்பட்டது; ஆய்வு நிபந்தனைகளில் GPT-6 Astra $12.182 செலவும் 1.89 வினாடியும் எடுத்தது.

இந்தச் சராசரிகள் ஆய்வாளர்கள் கண்ட வரம்பை மறைக்கின்றன. உரையாடல் தரம், பாதுகாப்பு மறுப்புகள், ஆதாரத்துடன் சரிபார்க்கும் உண்மைத்தன்மை ஆகியவற்றில் GPT-6-ஐவிட சுமார் இரண்டு புள்ளிகளுக்குள் Jev இருந்தது. ஆனால் முடிவைப் பெறவோ சரிபார்க்கவோ காரணமறிதல் தேவைப்படும் பணிகளில் அது பின்தங்கியது: கணிதத்தில் 14.3 புள்ளிகள், குறியீட்டில் 12.9 புள்ளிகள், தர்க்கப் புதிர்களில் 27.6 புள்ளிகள். JudgeBench-இன் புறநிலைச் சரித்தன்மைத் தொகுப்பில் GPT-6-இன் 93.1%-க்கு எதிராக Jev 78.6% பெற்றது. சர்ச்சைக்குரிய 990 உருப்படிகளைக் கொண்ட துணைத் தொகுப்பில், யாருடைய மதிப்பீட்டாளர் எந்த மாதிரி என மறைத்த தீர்ப்பாய்வு, விவாதத்துக்குரிய 69 JudgeBench உருப்படிகளில் 57-இல் GPT-6-ஐ ஆதரித்தது; ஒன்றில் Jev-ஐ ஆதரித்தது. இந்தத் தீர்ப்பாய்வு தேர்ந்தெடுக்கப்பட்ட சிறு பகுதியை மட்டுமே கொண்டாலும், இடைவெளி தரநிலையின் குறிச்சொற்களில் உள்ள சிக்கல் மட்டுமல்ல எனக் காட்டுகிறது.

இங்கு “மதிப்பீட்டாளர்” என்பதன் பொருள், உருவாக்கப்பட்ட இரண்டு பதில்களில் ஒன்றைத் தேர்ந்தெடுப்பது அல்லது வழங்கப்பட்ட குறிப்பை வைத்துத் தனிப் பதில் ஆதரிக்கப்படுகிறதா அல்லது சரியானதா எனத் தீர்மானிப்பது. காரண விளக்கமின்றி, Jev பயன்படுத்திய அதே கட்டுப்படுத்தப்பட்ட தீர்ப்பு மற்றும் நிகழ்தகவு வெளியீட்டு வடிவத்தையே மற்ற உருவாக்கும் மதிப்பீட்டாளர்களுக்கும் ஆய்வாளர்கள் வழங்கினர். ஆகவே இந்த ஒப்பீடு குறிப்பிட்ட ஒப்பந்தத்தின்படி வழங்கிய தீர்ப்புகளைப் பற்றியது; மனிதருக்கு யார் தங்கள் காரணத்தை விளக்க முடியும் என்பதைப் பற்றியது அல்ல.

நம்பகத்தன்மை வழிமாற்றம், பிழைகள் வேறுபட்டிருக்கும்போது உதவுகிறது

தொடர்முறை, குறைந்த செலவுள்ள முதல்நிலை மதிப்பீட்டாளரைப் பயன்படுத்தி, சில நிகழ்வுகளை அதிக செலவுள்ள மாற்று மதிப்பீட்டாளரிடம் அனுப்பும். முதலாவது ஆய்வில், Jev-இன் அதிகபட்சக் குறிச்சொல் நிகழ்தகவு குறைந்தது 0.9 ஆக இருந்தால் அதன் தீர்ப்பை ஏற்றுக்கொண்டு, அதற்குக் குறைந்த நம்பகத்தன்மையுள்ளவற்றை அடுத்த கட்டத்துக்கு அனுப்பினர். முன்பே பயன்படுத்தாத 1,610 விருப்ப இணைகளில், இரு வரிசை கொண்ட இந்தத் தொடர்முறை 31.5% நிகழ்வுகளை மட்டும் மேலே அனுப்பி, GPT-6-இன் 92.5%-க்கு எதிராக 93.4% துல்லியம் பெற்றது; GPT-6 கட்டணத்தில் 41% மட்டுமே செலவானது. இரண்டு புதிய சரித்தன்மைப் பணிகளிலிருந்து முன்பே ஒதுக்கி வைத்த 570 இணைகளைக் கொண்ட நேரடிச் சோதனையில், Jev மட்டும் GPT-6-ஐவிட 14 புள்ளிகள் பின்தங்கியது; 74% நிகழ்வுகளை மேலே அனுப்பிய தொடர்முறை GPT-6-க்கு இணையான துல்லியத்தைப் பெற்று, அதன் கட்டணத்தில் சுமார் கால் பகுதியைச் சேமித்தது.

இதற்கு ஒரு குறிப்பிட்ட நிபந்தனை உண்டு: Jev-க்கு நிச்சயமில்லாத நிகழ்வுகளில் உள்ள பிழைகளை மாற்று மாதிரி சரிசெய்யக்கூடியதாக இருக்க வேண்டும். பாணியை ஏமாற்றும் இணைகளிலும், ஆதாரக் குறிப்பு இல்லாத உரைநடையிலும் நம்பகத்தன்மை வழிமாற்றம் பலவீனமடைந்தது; அங்கு சோதித்த எல்லா மதிப்பீட்டாளர்களும் தோராயமாகச் சீரற்ற அளவில் இருந்தபோதும் பலமுறை மிகுந்த நம்பிக்கையுடன் பதிலளித்தனர் என ஆய்வாளர்கள் கண்டனர். இரு பதில்களின் வரிசையிலும் முடிவுகளைச் சராசரியாக்குவது இடவரிசை விளைவுகளைக் குறைத்தது என்றும் ஆய்வு கண்டது. உள்ளூர் குறிச்சொல் எடுத்துக்காட்டுகளைப் பயன்படுத்தி வரம்புகள் தேர்ந்தெடுக்கப்பட்டன; குறைந்த நம்பகத்தன்மை எல்லை முறையையும், முன்பே பயன்படுத்தாத தொகுப்பில் மறுசரிபார்ப்பையும் ஆய்வுக் கட்டுரை பரிந்துரைக்கிறது.

தனி அளவுகோல் ஆய்வு, ஏழு தரநிலைகளிலிருந்து எடுக்கப்பட்ட ஒன்பது குழுக்களில் ஒரு நிபந்தனைக்கான மதிப்பீட்டைச் சோதித்தது; மொத்தம் 5,003 உருப்படி–நிபந்தனை இணைகள். இரண்டு குழுக்கள் இருமத் தேர்வு கொண்டவை; ஏழு குழுக்கள் வரிசைப்படுத்தப்பட்ட மதிப்பீட்டு அளவுகோல்களைப் பயன்படுத்தின. எல்லா நான்கு மதிப்பீட்டாளர்களுக்கும் ஒரே நிபந்தனை உரை காட்டப்பட்டது; மதிப்பீட்டுக்கு முன்பே ஆய்வாளர்கள் அளவுகோல்களை நிலைநிறுத்தினர். இணையாக ஒப்பிட்ட 27 சோதனைகளில் எட்டில், துல்லிய வேறுபாட்டுக்கான 95% நம்பக இடைவெளி பூஜ்யத்தை உள்ளடக்கவில்லை; பல ஒப்பீடுகளுக்குத் திருத்திய பிறகு நான்கு மட்டுமே அப்படியே இருந்தன. வேறு சில ஒப்பீடுகள் ஆய்வுக் கட்டுரையின் சமத்துவ வரம்புக்குள் வந்தன; பலவற்றில் வேறுபாட்டையோ சமத்துவத்தையோ நிறுவுவதற்குத் தரவு போதுமான துல்லியமில்லை. இருமத் தேர்வு நிபந்தனைகளில் Jev மற்றவர்களுடன் ஒப்பிடும்போது சிறப்பாகச் செயல்பட்டது. மதிப்பீட்டு அளவுகோல் கொண்ட குழுக்களில் அது ஒருபோதும் இணையான மதிப்பீட்டாளர்களில் முதன்மையாக இருக்கவில்லை; எல்லா மதிப்பீட்டாளர்களும் மனித மதிப்பீட்டாளர்களைவிடக் குறைந்த மதிப்பெண் வழங்க முனைந்தனர்.

அந்த அமைப்பில் விலை, வேகச் சேமிப்பு பெரிதாக இருந்தன. ஒன்பது குழுக்களுக்கும் Jev சுமார் ஆறு சென்ட் செலவானது; மூன்று மொழி மாதிரி மதிப்பீட்டாளர்களுக்கு 29 முதல் 325 மடங்கு அதிகச் செலவும், 30 முதல் 220 மடங்கு அதிக நேரமும் தேவைப்பட்டன. இருந்தும் Jev-இன் நம்பகத்தன்மை வலுவான தொடர்முறையை உருவாக்கவில்லை. பெரும்பாலான குழுக்களில் அதன் பிழைகளை நம்பகத்தன்மை தரவரிசைப்படுத்தியது; ஆனால் மாற்று மாதிரிகள் Jev-இன் மிகுந்த நம்பிக்கையுடனான பெரும்பாலான தவறுகளை அப்படியே மீண்டும் செய்தன. பல முறை பொருத்திய வரம்புகளுடன், சிறந்த தனி மதிப்பீட்டாளரைவிட தொடர்முறை சராசரியாக அதிகபட்சம் 1.5 சதவீதப் புள்ளிகள் மட்டுமே முன்னேறியது; ஒன்பதில் ஆறு குழுக்களில் அந்தச் சிறந்த தனி மதிப்பீட்டாளரைவிட மோசமாக இருந்தது. இந்த மறுஇயக்கத்தில் முன்கூட்டிய நேரடி வெளியீட்டுக்குப் பதிலாகப் பதிவுசெய்த தீர்ப்புகள் பயன்படுத்தப்பட்டன.

இரு ஆய்வுகளின் வேறுபாடு கவனிக்கத்தக்கது. ஜோடி பதில் ஒப்பீடுகளில், Jev-இன் குறைந்த நம்பகத்தன்மை பிழைகளுக்கும் வலுவான மாற்று மாதிரியின் திறன்களுக்கும் இடையே பயனுள்ள பிரிப்பு இருப்பதாக முதல் ஆய்வு கண்டது. நிபந்தனை மதிப்பீட்டில் மாற்று மாதிரியும் பலமுறை அதே பிழைகளைப் பகிர்ந்ததால், மேலே அனுப்புவது திருத்தமின்றிச் செலவைச் சேர்த்தது. மற்றொரு மாதிரி பயனுள்ள வகையில் மாறுபட்ட தீர்ப்பு தருமா என்பதை மாதிரியின் நம்பகத்தன்மைக் குறியீடு மட்டும் ஒரு அணிக்குச் சொல்லாது.

மருத்துவத் தேர்வு முடிவுகள் பணியின் கடினத்தைப் பொறுத்தவை

மருத்துவ ஆய்வு, ஏற்கெனவே உள்ள நான்கு தரவுத்தொகுப்புகளில் Jev-ஐ மதிப்பிட்டது: 1,373 MetaMedQA தேர்வுக் கேள்விகள்; ஆய்வுச் சுருக்கங்களிலிருந்து பதிலளிக்கப்பட்ட 500 PubMedQA கேள்விகள்; DiagnosisArena-வின் 915 பல்தேர்வு நிகழ்வுகள்; வெளியிடப்பட்ட இறுதி நோயறிதலுடன் கூடிய 34 NEJM Case Challenges. நடுத்தர reasoning உடனும் reasoning இல்லாமலும் Jev-ஐ GPT-6 Sol-உடன் ஒப்பிட்டது. மொத்தம் 8,469 மாதிரி கோரிக்கைகள் அனுப்பப்பட்டன; ஒவ்வொன்றும் சரியான கட்டமைக்கப்பட்ட பதிலைத் திருப்பியது.

PubMedQA-வில் Jev மற்றும் நடுத்தர reasoning உடைய GPT-6 Sol முறையே 78.4%, 78.2% பெற்றன. MetaMedQA-வில் Jev 74.8% பெற்றது; GPT-6 Sol 82.7%. DiagnosisArena-வில் அவை 59.8%, 82.4%; NEJM-இன் 34 நிகழ்வுகளில் 61.8%, 82.4% பெற்றன. reasoning இல்லாத GPT-6-க்கும் கடினமான இரு நிகழ்வுத் தொகுப்புகளில் உயர்ந்த மதிப்பீட்டு முடிவுகள் இருந்தன. 34 NEJM நிகழ்வுகளின் மதிப்பீடு துல்லியமற்றது; பல ஒப்பீடுகளுக்குத் திருத்திய பிறகு அதன் முதன்மை ஒப்பீடு புள்ளிவிவர ரீதியாக முக்கியத்துவம் பெறவில்லை. DiagnosisArena-வின் மிகப் பெரிய இடைவெளி வெளிப்படையான reasoning இன்றியும் நீடித்தது.

கொடுக்கப்பட்ட தேர்வுகளில் ஒன்றைத் தேர்ந்தெடுப்பதே இச்சோதனை; வேறுபாட்டு நோயறிதலை உருவாக்குவதோ நோயாளிகளுக்கு சிகிச்சை அளிப்பதோ அல்ல. தரநிலையின் பதில்களை மருத்துவர்கள் தீர்ப்பாய்வு செய்ததாக ஆய்வுக் கட்டுரை தெரிவிக்கவில்லை. NEJM படங்கள் மாதிரிகளுக்கு விளக்க உரைகளாக வழங்கப்பட்டன என்றும், சவாலான DiagnosisArena நிகழ்வுகள் பிற மொழி மாதிரிகளுக்கு எதிராக வடிகட்டப்பட்டன என்றும் அது குறிப்பிடுகிறது. முடிவுகள் தொடக்கநிலையிலுள்ளவை; சுயாதீன மறுஆய்வு, குறிப்புப் பதில்களுக்கான மருத்துவத் தீர்ப்பாய்வு, ஒவ்வொரு இயக்கத்திலும் முடிவுகள் நிலைத்திருக்கிறதா என்ற சோதனை ஆகியவை இன்னும் நிலுவையில் உள்ளன என ஆசிரியர்கள் கூறுகின்றனர். மருத்துவப் பராமரிப்பை வழிநடத்த இம்முடிவுகளைப் பயன்படுத்த வேண்டாம் என்றும் ஆய்வுக் கட்டுரை வெளிப்படையாகச் சொல்கிறது.

நிகழ்தகவு வரம்புகளின் பயன் சீராக இல்லை. MetaMedQA-வில் Jev-இன் தேர்வுகளில் 52.9%-க்கு குறைந்தது 0.9 நம்பகத்தன்மை இருந்தது; அவற்றில் 93.4% சரியாக இருந்தன. ஏறத்தாழ அதே அளவு கேள்விகளை ஏற்ற GPT-6 அதே அளவு துல்லியமாகவோ அதைவிடச் சிறப்பாகவோ இருந்தது. DiagnosisArena-வில் Jev-இன் நிகழ்தகவு தரவரிசை பலவீனமாக இருந்தது: அதே 0.9 வரம்பில் 17.3% உருப்படிகளை மட்டுமே ஏற்றுக்கொண்டது; ஏற்றுக்கொண்ட பதில்களில் நான்கில் ஒன்று தவறாகவே இருந்தது. எல்லாத் தரநிலைகளிலும் மாதிரிகள் தேர்ந்தெடுத்த விடைக்குக் கொடுத்த சராசரி நிகழ்தகவு அவற்றின் உண்மைத் துல்லியத்தைவிட அதிகமாக இருந்தது. இந்த மாதிரியில் உயர்ந்த மதிப்பெண் என்பது உறுதி என்பதல்ல.

இந்த ஆய்வுகளிலிருந்து அணிகள் பெறக்கூடிய பாடங்கள்

ஒன்றாகப் பார்க்கும்போது, வழங்கிய உரையிலிருந்து தீர்ப்பைப் பெறவோ ஆதாரத்துடன் சரிபார்க்கவோ கூடிய பணிகளில், குறிப்பிட்ட பணிக்கான மதிப்பீட்டாளராக Jev-ஐச் சோதிப்பதை இந்த ஆய்வுகள் ஆதரிக்கின்றன. அதன் நம்பகத்தன்மை வெளியீட்டை எல்லா சூழலுக்கும் பொருந்தும் பாதுகாப்புச் சுவிட்சாகக் கருதுவதை அவை ஆதரிக்கவில்லை. வெவ்வேறு பணிச்சுமைகளில் வெவ்வேறு முடிவுகள் கிடைத்தன; மாற்று மதிப்பீட்டாளரைத் தேர்ந்தெடுக்கும்போது அதன் ஒட்டுமொத்தத் துல்லியத்துடன் பிழைகள் ஒன்றுடன் ஒன்று பொருந்தாமல் உள்ளனவா என்பதையும் மதிப்பிட வேண்டும் என அளவுகோல் ஆய்வு காட்டுகிறது.

இந்த முறையைப் பரிசீலிக்கும் அணி, தனது பணியிலிருந்து பிரதிநிதித்துவமான, குறிச்சொல் பதித்த மாதிரியைத் தயாரிக்க வேண்டும். சரியான முடிவு எது என வரையறுத்து, கடினமான மற்றும் தவறாக வழிநடத்தும் எடுத்துக்காட்டுகளைச் சேர்த்து, மனித ஆய்வு அல்லது நியாயப்படுத்தக்கூடிய வேறு குறிப்புடன் ஒப்பிட வேண்டும்; பின்னர் பிழை விகிதங்களையும் சரி/தவறான முடிவுகளை நம்பகத்தன்மை எவ்வளவு நன்றாக வேறுபடுத்துகிறது என்பதையும் அளக்க வேண்டும். தொடர்முறையில், மாற்று மதிப்பீட்டாளர் முதல் கட்டப் பிழைகளை உண்மையில் சரிசெய்ததா, எத்தனை நிகழ்வுகள் மேலே அனுப்பப்பட்டன, அதனால் ஏற்பட்ட செலவும் தாமதமும் என்ன என்பதையும் பதிவு செய்ய வேண்டும். வரம்பைத் தேர்ந்தெடுக்கப் பயன்படுத்திய எடுத்துக்காட்டுகளுக்கு அப்பாலும் அது பொருந்துகிறதா என்பதை ஒதுக்கிவைத்த சோதனைத் தொகுப்பு காட்டும்.

இவை ஆய்வுகளிலிருந்து பெறப்படும் நடைமுறைப் பொருள்கள்; BIG CHANGE சோதித்த செயல்முறை அல்ல. Jev API-ஐ அழைக்கவோ உள்ளூர் தரநிலைச் சோதனையை இயக்கவோ நாங்கள் இல்லை. TypeSafe-இன் API ஆவணம் கட்டமைக்கப்பட்ட கோரிக்கைகள், அனுமதிக்கப்பட்ட பதில் வகைகள், மாதிரித் தேடல் ஆகியவற்றை விளக்குகிறது; ஒரு குழுவின் பணிச்சுமையில் துல்லியம் இருப்பதை அது சுயாதீனமாக நிறுவாது. தயாரிப்பு அணுகல், விலைகள், மாதிரிகள் மாறக்கூடும்; ஆகவே சோதனையைத் திட்டமிடும்போது தற்போதைய ஆவணங்களை அணிகள் சரிபார்க்க வேண்டும்.

இப்போதைக்கு, பணி குறுகியதாகவும் குறிச்சொற்கள் தெளிவாகவும் இருந்து, உள்ளூர் மதிப்பீடு நம்பகத்தன்மை பிழைகளைச் சரியாக வழிமாற்றுகிறது எனக் காட்டினால், முதல் நிலை மதிப்பீட்டாளராக Jev பயனுள்ள தேர்வாகத் தெரிகிறது. ஆழமான காரணமறிதல் தேவைப்பட்டாலோ, மறைந்துள்ள மதிப்பீட்டாளர் மரபுகளைப் பொறுத்து மதிப்பெண் மாறினாலோ, பல மாதிரிகளும் ஒரே பிழைகளைச் செய்தாலோ, மனித ஆய்வையோ சரிபார்க்கப்பட்ட வேறு சோதனையையோ தொடர வேண்டிய காரணத்தை இந்த ஆய்வுகள் அணிகளுக்கு அளிக்கின்றன.

முக்கிய மாற்றம்

மலிவான தீர்ப்பை வழங்கும் முடிவு மாதிரி இருக்குமா என்ற கேள்வியிலிருந்து, எந்தச் சூழலில் அந்தத் தீர்ப்பைத் தக்கவைத்துக்கொள்ளும் அளவு பயன் இருக்கும் என்ற கேள்விக்கு Jev-இன் புதிய மதிப்பீடுகள் நகர்த்துகின்றன. பதில் பணியைப் பொறுத்தது: முன்பே பயன்படுத்தாத ஜோடி ஒப்பீட்டு மதிப்பீட்டில் நம்பகத்தன்மை வழிமாற்றம் தொடர்முறையை மேம்படுத்தியது; பிழைகள் ஒன்றோடொன்று ஒத்திருந்ததால் தனி அளவுகோல் ஆய்வில் ஆதாயம் குறைவாக இருந்தது. மருத்துவத் தேர்வு முடிவுகளும் பணியின் கடினத்தைப் பொறுத்து பெரிதாக மாறின. AI அணிகளின் அடுத்த படி, சரித்தன்மை, நம்பகத்தன்மை, மாற்று மாதிரி எவ்வாறு செயல்படுகிறது ஆகியவற்றை ஒன்றாகச் சோதிக்கும் உள்ளூர் சரிபார்ப்புத் தொகுப்பை உருவாக்குவதாகும்.

ஆதாரங்களும் மேலும் வாசிப்பும்

  • JEV-as-a-Judge: Accept When Confident, Escalate When Unsure, Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman; செப்டம்பர் 27, 2026 தேதியிட்ட இரண்டாம் பதிப்பு. யாருடைய மதிப்பீட்டாளர் எந்த மாதிரி என மறைத்த மனிதத் தீர்ப்பாய்வும், முன்பே பயன்படுத்தாத நம்பகத்தன்மை வழிமாற்றுச் சோதனைகளும் உட்பட Jev-ஐ 16 மதிப்பீட்டாளர்களுடன் ஒப்பிடும் முன்அச்சுப் பிரதி.
  • Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places, Delip Rao, Chris Callison-Burch; 2026 செப்டம்பர் 24. ஒன்பது தரநிலை குழுக்களில் ஒவ்வொரு நிபந்தனைக்கான இரும மற்றும் தரப்படுத்தப்பட்ட மதிப்பீடுகளை ஆராயும் முன்அச்சுப் பிரதி.
  • Jev in Medicine: A Benchmark Evaluation. Preliminary results., Alfredo Madrid-García, Beatriz Merino-Barbancho; 2026 செப்டம்பர் 27. மருத்துவப் பல்தேர்வுத் தரவுத்தொகுப்புகள் நான்கில் முன்தொடக்க ஒப்பீடு; மருத்துவ ஆய்வு அல்ல.
  • TypeSafe API ஆவணம், Jev-இன் கட்டமைக்கப்பட்ட கோரிக்கை மற்றும் வெளியீட்டு இடைமுகத்துக்கான அதிகாரப்பூர்வக் குறிப்பு. ஆவணம் தயாரிப்பு நடத்தை பற்றி விளக்குகிறது; சுயாதீன மதிப்பீடு அல்ல.