మూడు కొత్త ప్రిప్రింట్‌లు Jevను వేర్వేరు రీతుల్లో మూల్యాంకనకర్తగా పరీక్షించాయి. సమాధానాల ప్రాధాన్యత, ఆధారాల ఆధారిత వాస్తవ నిర్ధారణలో అది బలమైన భాషా-మోడల్ న్యాయనిర్ణేతకు దగ్గరగా ఉందని ఒకటి గుర్తించింది; అనిశ్చిత సందర్భాలను మళ్లించే విధానాన్నీ పరీక్షించింది. రేటింగ్ రుబ్రిక్‌లపై ఆ రూటింగ్ వల్ల పెద్దగా ప్రయోజనం లేదని రెండోది కనుగొంది, ఎందుకంటే ప్రత్యామ్నాయ మోడళ్లు తరచూ Jev నమ్మకంగా చేసిన పొరపాట్లనే పునరావృతం చేశాయి. మూడో వైద్య బెంచ్‌మార్క్‌లో పరిశోధనా సారాంశాల ప్రశ్నలకు దాదాపు సమాన ఖచ్చితత్వం కనిపించింది; క్లిష్ట నిర్ధారణ కేసుల్లో మాత్రం గణనీయమైన అంతరం ఉంది.

ఆచరణలో సమాధానం “AI, AIను న్యాయనిర్ణయించగలదు” అన్నదానికంటే పరిమితం. స్పష్టంగా నిర్వచించిన పనికి Jev వేగవంతమైన ప్రాథమిక న్యాయనిర్ణేత కావచ్చు; అయితే ప్రతి రకమైన సమాధానానికి ఒకే విశ్వసనీయ న్యాయనిర్ణేత ఉందని ఆధారాలు చూపడం లేదు. తమ ఉదాహరణలపై విశ్వాస సూచిక ఏమి అంచనా వేస్తుందో బృందం పరిశీలించిన తర్వాతే, అది పనిని సరైన మార్గానికి మళ్లించడంలో ఉపయోగపడుతుంది.

ఒక మోడల్ న్యాయనిర్ణేతగా పనిచేయడమంటే ఏమిటి

మూల్యాంకనకర్త ఒకటి లేదా అంతకంటే ఎక్కువ మోడల్ సమాధానాలను తీసుకుని, ఏదో ఒక నియమం ప్రకారం స్కోరు లేదా తీర్పు ఇస్తుంది. రెండు సమాధానాల్లో ఏది ప్రాంప్ట్‌ను మెరుగ్గా పాటిస్తుందో ఎంచుకోవడం, ఇచ్చిన పత్రాలు ఒక వాదనకు మద్దతిస్తున్నాయో నిర్ణయించడం, రుబ్రిక్‌తో సమాధానాన్ని స్కోరు చేయడం లేదా వైద్య బహుళైచ్ఛిక కేసులో సరైన ఎంపికను గుర్తించడం వంటి పనులు న్యాయనిర్ణేతకు ఇవ్వవచ్చు. ఈ పనులకు మూల్యాంకనకర్త నుంచి వేర్వేరు సామర్థ్యాలు అవసరం.

Jev అనేది TypeSafe హోస్ట్ చేసే నిర్ణయ మోడల్. దాని API నిర్మిత ఇన్‌పుట్, అనుమతించిన ప్రతిస్పందన రకాన్ని స్వీకరించి, అనుమతించిన లేబుళ్లపై సంభావ్యతలతో పాటు ఎంపిక లేదా స్కోరును అందిస్తుంది. పరిమిత ఫలితాన్ని ఆశించే సాఫ్ట్‌వేర్‌లో పనిని అమర్చేందుకు ఈ ఇంటర్‌ఫేస్ ఉపయోగపడవచ్చు. అయితే సంభావ్యత అనేది మోడల్ అంచనా మాత్రమే; మూల సమాధానాన్ని అది స్వతంత్రంగా ధృవీకరించదు. TypeSafe డాక్యుమెంటేషన్ ఇంటర్‌ఫేస్‌ను వివరిస్తుంది; దిగువ పరిశోధనల్లో నిర్దిష్ట పరీక్షా సమూహాలపై పనితీరును పోల్చారు.

ఈ JEV-as-a-Judge అధ్యయనంను సెప్టెంబర్ 27న సవరించారు; ఇందులో Jev 1.13ను 16 జనరేటివ్, రివార్డ్-మోడల్ న్యాయనిర్ణేతలతో పోల్చారు. రుబ్రిక్-న్యాయనిర్ణేత అధ్యయనం సెప్టెంబర్ 24న ప్రచురితమై, Jevను తక్కువ ఖర్చు గల మూడు భాషా మోడళ్లతో పోల్చింది. వైద్య బెంచ్‌మార్క్ సెప్టెంబర్ 27న ప్రచురితమై, రెండు reasoning సెట్టింగ్‌లలో Jev 1.13ను GPT-6 Solతో పోల్చింది. ఈ మూడూ ప్రిప్రింట్‌లు. వీటిలో ఏదీ వైద్య క్లినికల్ వినియోగ అధ్యయనం కాదు; ఏదీ సహచర సమీక్ష పొందలేదు.

కొన్ని తీర్పుల్లో దగ్గరగా, తర్కంలో బలహీనంగా

మొదటి పత్రం ప్రాధాన్యత జంటలు, ఆధారాలతో నిర్ధారించిన వాస్తవికత, తుది సమాధాన తనిఖీలపై 5,172 తీర్పులను మూల్యాంకనం చేసి, ఆపై తదుపరి పరీక్షలు, ముందుగా పక్కన ఉంచిన రెండు రూటింగ్ అధ్యయనాలను జోడించింది. ప్రధాన బహిరంగ బెంచ్‌మార్క్‌లో Jev స్కోర్లు: నమూనాగా ఎంచుకున్న 1,500 RewardBench ప్రాధాన్యత జంటల్లో 92.5%, 350 JudgeBench జంటల్లో 78.6%, ఆధారాలతో అంచనా వేసిన 3,000 HaluEval సమాధానాల్లో 87.3%. అదే పనుల్లో అత్యుత్తమ GPT-6 Astra పోలిక మోడల్ వరుసగా 92.5%, 93.1%, 88.4% సాధించింది. అధ్యయన సమయ ప్యానెల్ ప్రకారం ప్రతి 1,000 ప్రాథమిక తీర్పులకు Jev ధర $0.044, మధ్యస్థ లేటెన్సీ 0.15 సెకన్లు; అదే పరిస్థితుల్లో GPT-6 Astra ధర $12.182, సమయం 1.89 సెకన్లు.

ఈ సగటులు రచయితలు గుర్తించిన పరిమితిని దాచేస్తాయి. సంభాషణ నాణ్యత, భద్రతా నిరాకరణలు, ఆధారాలతో నిర్ధారించిన వాస్తవికతలో Jev, GPT-6కు సుమారు రెండు పాయింట్లలోపే ఉంది. ఫలితాన్ని ఉత్పన్నం చేయడం లేదా తనిఖీ చేయడం అవసరమైన పనుల్లో అది వెనుకబడింది: గణితంలో 14.3 పాయింట్లు, కోడ్‌లో 12.9 పాయింట్లు, తర్క పజిళ్లలో 27.6 పాయింట్ల అంతరం. JudgeBenchలో వస్తునిష్ఠ సరైనత సమూహంపై Jev 78.6%, GPT-6 93.1% సాధించాయి. 990 అంశాల ఉపసమూహంలో వివాదాస్పద కేసులపై అంధ సమీక్షలో, వివాదాస్పద 69 JudgeBench అంశాల్లో 57పై సమీక్షకులు GPT-6కు, ఒక్కదానిపై Jevకు మద్దతిచ్చారు. ఈ సమీక్ష ఎంపిక చేసిన కొద్దిపాటి అంశాలకే పరిమితం; అయినా, ఈ అంతరం బెంచ్‌మార్క్ లేబుళ్ల సమస్య ఒక్కటే కాదని సూచిస్తుంది.

ఇక్కడ “న్యాయనిర్ణేత” అంటే రెండు రూపొందించిన సమాధానాల్లో ఒకదాన్ని ఎంచుకోవడం లేదా పేర్కొన్న ఆధారం ప్రకారం ఒక సమాధానానికి మద్దతు ఉందో, అది సరైనదో నిర్ణయించడం. జనరేటివ్ న్యాయనిర్ణేతలకు కారణ వివరణలు ఇవ్వనివ్వకుండా, Jev తరహా పరిమిత తీర్పు-మరియు-సంభావ్యత అవుట్‌పుట్‌ను రచయితలు ఉద్దేశపూర్వకంగా ఇచ్చారు. అందువల్ల పోలిక మానవుడికి తన తర్కాన్ని ఏ న్యాయనిర్ణేత మెరుగ్గా వివరిస్తుందన్నది కాదు; నిర్దిష్ట అవుట్‌పుట్ నియమంలో ఇచ్చిన తీర్పుల గురించే.

పొరపాట్లు వేరుపడినప్పుడు విశ్వాస-ఆధారిత రూటింగ్ పనిచేస్తుంది

కాస్కేడ్ విధానంలో మొదట తక్కువ ఖర్చు గల న్యాయనిర్ణేతను ఉపయోగించి, కొన్ని కేసులను ఖరీదైన ప్రత్యామ్నాయ మోడల్‌కు పంపిస్తారు. మొదటి అధ్యయనంలో, Jev అత్యధిక లేబుల్ సంభావ్యత కనీసం 0.9 ఉన్నప్పుడు దాని తీర్పును అంగీకరించి, తక్కువ విశ్వాసం ఉన్న కేసులను ముందుకు పంపే నియమాన్ని పరీక్షించారు. పరీక్షలో ఉంచిన 1,610 ప్రాధాన్యత జంటల్లో, రెండు క్రమాల కాస్కేడ్ 31.5% కేసులను పైస్థాయికి పంపింది; GPT-6 92.5%తో పోలిస్తే 93.4% సాధించి, దాని రుసుములో 41% ఖర్చు చేసింది. రెండు కొత్త సరైనత పనుల నుంచి ముందే నిర్దేశించిన ప్రత్యక్ష పరీక్షలోని 570 జంటల్లో Jev ఒక్కటే GPT-6 కంటే 14 పాయింట్లు వెనుకబడింది; కాస్కేడ్ 74% కేసులను పైస్థాయికి పంపి, GPT-6 ఖర్చులో సుమారు నాలుగో వంతు ఆదా చేస్తూనే దాని ఖచ్చితత్వాన్ని అందుకుంది.

ఈ ఫలితానికి ఒక నిర్దిష్ట షరతు ఉంది: Jevకు అనిశ్చితంగా ఉన్న కేసుల్లో, ప్రత్యామ్నాయ మోడల్ సరిచేయగల పొరపాట్లు ఉండాలి. శైలి-ఆధారిత విరుద్ధ జంటల్లో విశ్వాస రూటింగ్ బలహీనపడిందని, సూచనలేని గద్యంపై విఫలమైందని రచయితలు కనుగొన్నారు; ఈ సందర్భాల్లో పరీక్షించిన న్యాయనిర్ణేతలన్నీ యాదృచ్ఛిక అవకాశానికి దగ్గరగా ఉన్నప్పటికీ తరచూ నమ్మకంగా సమాధానమిచ్చాయి. రెండు సమాధానాల క్రమాల్లోని తీర్పులను సగటు చేయడం వల్ల స్థాన ప్రభావాలు తగ్గాయని అధ్యయనం తెలిపింది. స్థానికంగా లేబుల్ చేసిన ఉదాహరణలతో పరిమితులను ఎంచుకుని, తక్కువ విశ్వాస పరిమితి పద్ధతిని, దాచిన పరీక్షా సమూహంతో తనిఖీని పత్రం సిఫార్సు చేసింది.

వేరే రుబ్రిక్ అధ్యయనం ఏడు బెంచ్‌మార్క్‌ల నుంచి తీసుకున్న తొమ్మిది ప్యానెల్‌లలో, ఒక్కో ప్రమాణానికి ఇచ్చిన స్కోరును పరీక్షించింది; మొత్తం 5,003 అంశం–ప్రమాణ జంటలు. రెండు ప్యానెల్‌లు బైనరీ, ఏడింటిలో క్రమబద్ధ రేటింగ్ స్కేల్‌లు ఉన్నాయి. నలుగురు న్యాయనిర్ణేతలకూ ఒకే ప్రమాణ పాఠ్యాన్ని ఇచ్చి, మూల్యాంకనానికి ముందే రచయితలు రుబ్రిక్‌లను స్థిరపరిచారు. 27 జత పోలికల్లో ఎనిమిదింటి 95% విశ్వాస అంతరం ఖచ్చితత్వ వ్యత్యాసం లేదన్న విలువను మినహాయించింది; బహుళ పోలికలకు సవరణ తర్వాత నాలుగు మాత్రమే మిగిలాయి. మరికొన్ని పోలికలు పత్రం నిర్వచించిన సమానత్వ పరిమితిని చేరాయి; చాలావాటిలో వ్యత్యాసం లేదా సమానత్వం నిర్ధారించడానికి అంచనాలు తగినంత ఖచ్చితంగా లేవు. బైనరీ ప్రమాణాల్లో Jev ఇతరులతో పోలిస్తే మెరుగ్గా చేసింది. గ్రేడెడ్ ప్యానెల్‌లలో సరిపోల్చిన న్యాయనిర్ణేతలలో అది ఎప్పుడూ మొదటి స్థానంలో లేదు; అన్ని న్యాయనిర్ణేతలూ మానవ రేటర్ల కంటే తక్కువ స్కోర్లు ఇచ్చే ధోరణి చూపాయి.

ఆ సెటప్‌లో ధర, వేగం ఆదా గణనీయంగా ఉన్నాయి. తొమ్మిది ప్యానెల్‌లన్నింటికీ Jev ఖర్చు సుమారు ఆరు సెంట్లు; మూడు భాషా-మోడల్ న్యాయనిర్ణేతలు 29 నుంచి 325 రెట్లు ఎక్కువ ఖర్చు చేసి, 30 నుంచి 220 రెట్లు ఎక్కువ సమయం తీసుకున్నారు. అయినా Jev విశ్వాసం బలమైన కాస్కేడ్‌ను సృష్టించలేదు. చాలా ప్యానెల్‌లలో దాని పొరపాట్లను విశ్వాసం గుర్తించినా, ప్రత్యామ్నాయ మోడళ్లు Jev అత్యంత నమ్మకంగా చేసిన పొరపాట్లలో దాదాపు అన్నింటినీ పునరావృతం చేశాయి. వేర్వేరు భాగాలపై సరిపోల్చిన పరిమితులతో, సగటున ఉత్తమ ఏకైక న్యాయనిర్ణేత కంటే కాస్కేడ్ గరిష్ఠంగా 1.5 శాతం పాయింట్లే మెరుగుపడింది; తొమ్మిదిలో ఆరు ప్యానెల్‌లలో మాత్రం ఆ న్యాయనిర్ణేత కంటే అధ్వాన్నంగా పనిచేసింది. ఈ పునఃపరీక్ష భవిష్యత్ ప్రత్యక్ష వినియోగం కాదు; ముందుగా నమోదు చేసిన తీర్పులను ఉపయోగించింది.

ఈ రెండు పత్రాల మధ్య వ్యత్యాసం గమనించదగినది. జత సమాధానాల పోలికలో, Jev తక్కువ విశ్వాసంతో చేసిన పొరపాట్లను బలమైన ప్రత్యామ్నాయ మోడల్ సరిచేయగల ఉపయోగకరమైన విభజనను మొదటి అధ్యయనం గుర్తించింది. ప్రమాణాల స్కోరింగ్‌లో ప్రత్యామ్నాయ మోడల్ తరచూ అదే పొరపాట్లు చేయడంతో, పైస్థాయికి పంపడం వల్ల ఖర్చు పెరిగినా సవరణ పెద్దగా జరగలేదు. మరో మోడల్ ఉపయోగకరంగా భిన్నమైన తీర్పు ఇస్తుందో లేదో, మోడల్ విశ్వాస సంకేతం ఒక్కటే బృందానికి చెప్పదు.

వైద్య బహుళైచ్ఛిక ఫలితాలు పని కష్టతను బట్టి మారుతాయి

వైద్య పత్రం ఇప్పటికే ఉన్న నాలుగు డేటాసెట్‌లపై Jevను మూల్యాంకనం చేసింది: పరీక్షల్లోని 1,373 MetaMedQA ప్రశ్నలు, పరిశోధనా సారాంశాల ఆధారంగా సమాధానమిచ్చిన 500 PubMedQA ప్రశ్నలు, 915 DiagnosisArena బహుళైచ్ఛిక కేసులు, ప్రచురిత తుది నిర్ధారణ ఉన్న 34 NEJM Case Challenges. Jevను GPT-6 Solతో మధ్యస్థ reasoningతో, reasoning లేకుండా పోల్చారు. మొత్తం 8,469 మోడల్ అభ్యర్థనలు జరిగాయి; ప్రతి అభ్యర్థనకు చెల్లుబాటు అయ్యే నిర్మిత సమాధానం వచ్చింది.

PubMedQAలో Jev, మధ్యస్థ reasoningతో GPT-6 Sol వరుసగా 78.4%, 78.2% సాధించాయి. MetaMedQAలో Jev 74.8%, GPT-6 Sol 82.7%; DiagnosisArenaలో 59.8% వర్సెస్ 82.4%; 34 NEJM కేసుల్లో 61.8% వర్సెస్ 82.4%. reasoning లేకుండా GPT-6 కూడా రెండు క్లిష్ట కేసు సమూహాల్లో ఎక్కువ పాయింట్ అంచనాలు సాధించింది. 34 NEJM కేసుల అంచనా ఖచ్చితత్వం తక్కువ; బహుళ పోలికల సవరణ తర్వాత దాని ప్రధాన పోలిక గణాంకపరంగా ముఖ్యంగా మిగల్లేదు. DiagnosisArenaలోని చాలా పెద్ద అంతరం స్పష్టమైన reasoning లేకున్నా కొనసాగింది.

ఇది ఇచ్చిన ఎంపికల్లో సరైనదాన్ని ఎంచుకునే పరీక్ష మాత్రమే; భేద నిర్ధారణ చేయడం లేదా రోగులకు చికిత్స ఇవ్వడం కాదు. బెంచ్‌మార్క్ సమాధానాలను వైద్యులు సమీక్షించి తీర్పు ఇచ్చినట్లు పత్రం నివేదించలేదు. NEJM చిత్రాలను మోడళ్లకు శీర్షికల రూపంలో ఇచ్చారని, క్లిష్ట DiagnosisArena కేసులను ఇతర భాషా మోడళ్లతో పోల్చి వడపోశారని పేర్కొంది. ఫలితాలు ప్రాథమికమని, స్వతంత్ర పునరావృతం, ఆధార సమాధానాలపై వైద్య సమీక్ష, పునరావృత పరీక్షల్లో స్థిరత్వ పరిశీలనలు ఇంకా పెండింగ్‌లో ఉన్నాయని రచయితలు చెబుతున్నారు. వైద్య సంరక్షణకు మార్గనిర్దేశం చేసేందుకు ఈ ఫలితాలను ఉపయోగించవద్దని పత్రం స్పష్టంగా హెచ్చరిస్తుంది.

సంభావ్యత పరిమితుల విలువ ఒకేలా లేదు. MetaMedQAలో Jev ఎంపికల్లో 52.9%కి కనీసం 0.9 విశ్వాసం ఉంది; ఆ ఎంపికల్లో 93.4% సరైనవి. దాదాపు సమాన సంఖ్యలో కేసులను అంగీకరించినప్పుడు GPT-6 కూడా అంతే ఖచ్చితంగా లేదా అంతకంటే మెరుగ్గా ఉంది. DiagnosisArenaలో Jev సంభావ్యత ర్యాంకింగ్ బలహీనంగా ఉంది: అదే 0.9 పరిమితి వద్ద 17.3% అంశాలనే అంగీకరించింది; అంగీకరించిన సమాధానాల్లో నాలుగింట ఒకటి ఇంకా తప్పే. ప్రతి బెంచ్‌మార్క్‌లోనూ మోడళ్ల ఎంపిక చేసిన ఎంపికల సగటు సంభావ్యత వాటి ఖచ్చితత్వాన్ని మించింది. ఈ నమూనాలో అధిక స్కోరు అంటే నిశ్చితత్వం కాదు.

ఈ అధ్యయనాల నుంచి బృందాలు ఏమి తీసుకోవచ్చు

కలిపి చూస్తే, ఇచ్చిన పాఠ్యం నుంచి తీర్పును చదవగలిగే లేదా ఆధారాలతో తనిఖీ చేయగల పనుల్లో Jevను నిర్దిష్ట పనికి మూల్యాంకనకర్తగా పరీక్షించేందుకు ఈ పత్రాలు మద్దతిస్తాయి. దాని విశ్వాస ఫీల్డ్‌ను సార్వత్రిక భద్రతా స్విచ్‌లా చూడటానికి మాత్రం మద్దతు ఇవ్వవు. వేర్వేరు పనుల్లో వేర్వేరు ఫలితాలు వచ్చాయి; ఖచ్చితత్వంతో పాటు పొరపాట్లు స్వతంత్రమా కాదా అన్నదీ ప్రత్యామ్నాయ మోడల్‌లో పరీక్షించాలని రుబ్రిక్ అధ్యయనం చూపిస్తుంది.

ఈ విధానాన్ని పరిశీలించే బృందానికి తన పనినుంచి ప్రతినిధ్యంగా ఎంపిక చేసి లేబుల్ చేసిన నమూనా అవసరం. సరైన నిర్ణయం అంటే ఏమిటో నిర్వచించి, క్లిష్టమైన, తప్పుదారి పట్టించే ఉదాహరణలను చేర్చి, మానవ సమీక్ష లేదా సమర్థించగల మరో ఆధారంతో పోల్చాలి. ఆపై పొరపాటు రేట్లతో పాటు, సరైనవి–తప్పులను విశ్వాసం ఎంత బాగా వేరు చేస్తుందో కొలవాలి. కాస్కేడ్ కోసం, మొదటి దశ పొరపాట్లను ప్రత్యామ్నాయ మోడల్ నిజంగా సరిచేస్తుందా, ఎన్ని కేసులు పైస్థాయికి వెళ్తాయి, దాంతో ఖర్చు, ఆలస్యం ఎంత వస్తుందో కూడా నమోదు చేయాలి. పరిమితిని ఎంచుకోవడానికి ఉపయోగించిన ఉదాహరణలకు మించి అది వర్తిస్తుందో లేదో, ప్రత్యేకంగా కేటాయించిన పరీక్షా సమూహం చూపగలదు.

ఇవి అధ్యయనాల నుంచి తీసుకున్న ఆచరణాత్మక సూచనలు మాత్రమే; BIG CHANGE పరీక్షించిన విధానం కాదు. Jev APIని పిలవలేదు, స్థానిక బెంచ్‌మార్క్‌ను కూడా నడపలేదు. TypeSafe యొక్క API డాక్యుమెంటేషన్ లో నిర్మిత అభ్యర్థనలు, అనుమతించిన సమాధాన రకాలు, మోడల్ శోధన వివరించబడ్డాయి; కానీ బృందం పనిపై ఖచ్చితత్వాన్ని అది స్వతంత్రంగా నిర్ధారించదు. ఉత్పత్తి ప్రాప్యత, ధరలు, మోడళ్లు మారవచ్చు; ప్రయోగాన్ని ప్రణాళిక చేసేటప్పుడు ప్రస్తుత డాక్యుమెంటేషన్‌ను తనిఖీ చేయాలి.

ప్రస్తుతానికి, పని పరిమితంగా ఉండి, లేబుళ్లు స్పష్టంగా ఉండి, స్థానిక మూల్యాంకనంలో విశ్వాసం పొరపాట్లను సమర్థంగా మళ్లిస్తుందని తేలితే Jevను తొలి న్యాయనిర్ణేత అభ్యర్థిగా ఉపయోగించడం సమంజసం. లోతైన తర్కం అవసరమైనప్పుడు, స్కోరింగ్ దాచిన రేటర్ సంప్రదాయాలపై ఆధారపడినప్పుడు లేదా పలు మోడళ్లు ఒకే పొరపాట్లు చేసినప్పుడు, మానవ సమీక్ష లేదా ధృవీకరించిన మరో తనిఖీని కొనసాగించేందుకు ఈ అధ్యయనాలు కారణం చూపుతున్నాయి.

పెద్ద మార్పు

Jevపై కొత్త మూల్యాంకనాలు, నిర్ణయ మోడల్ తక్కువ ఖర్చుతో తీర్పు ఇవ్వగలదా అన్న ప్రశ్నను దాటి, ఆ తీర్పును ఎప్పుడు కొనసాగించదగినంతగా ఉపయోగించవచ్చన్నదానిపై దృష్టి మళ్లిస్తున్నాయి. సమాధానం పని తీరుపై ఆధారపడి ఉంటుంది: పరీక్షలో దాచిన జత-పోలిక మూల్యాంకన కాస్కేడ్‌లో విశ్వాస రూటింగ్ మెరుగుదల ఇచ్చింది; వేరే రుబ్రిక్ అధ్యయనంలో పొరపాట్లు కలిసిపోవడంతో లాభం తక్కువగా ఉంది. వైద్య బహుళైచ్ఛిక ఫలితాలూ పని కష్టతను బట్టి బాగా మారాయి. AI బృందాల తదుపరి అడుగు సరైనత, విశ్వాసం, ప్రత్యామ్నాయ ప్రవర్తనను కలిపి పరీక్షించే స్థానిక ధృవీకరణ సమూహం నిర్మించడం.

మూలాలు, మరింత చదవండి

  • JEV-as-a-Judge: Accept When Confident, Escalate When Unsure — Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman; 2026 సెప్టెంబర్ 27 తేదీతో రెండో సంచిక. అంధ మానవ తీర్పు, దాచిన విశ్వాస-రూటింగ్ పరీక్షలతో Jevను 16 న్యాయనిర్ణేతలతో పోల్చిన ప్రిప్రింట్.
  • Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places — Delip Rao, Chris Callison-Burch; 2026 సెప్టెంబర్ 24. తొమ్మిది బెంచ్‌మార్క్ ప్యానెల్‌లలో ఒక్కో ప్రమాణానికి బైనరీ, గ్రేడెడ్ తీర్పులను మూల్యాంకనం చేసిన ప్రిప్రింట్.
  • Jev in Medicine: A Benchmark Evaluation. Preliminary results. — Alfredo Madrid-García, Beatriz Merino-Barbancho; 2026 సెప్టెంబర్ 27. నాలుగు వైద్య బహుళైచ్ఛిక డేటాసెట్‌లపై ప్రాథమిక బెంచ్‌మార్క్ పోలిక; క్లినికల్ అధ్యయనం కాదు.
  • TypeSafe API డాక్యుమెంటేషన్ — Jev నిర్మిత అభ్యర్థన, అవుట్‌పుట్ ఇంటర్‌ఫేస్‌కు అధికారిక సూచిక. డాక్యుమెంటేషన్ ఉత్పత్తి ప్రవర్తనను వివరిస్తుంది; స్వతంత్ర మూల్యాంకనం కాదు.