AI-translated from English; not yet reviewed by a fluent editor.
# Jev AI న్యాయనిర్ణేత ఫలితాలు పని, ప్రత్యామ్నాయ మోడల్ను బట్టి మారుతాయి
> AI సమాధానాలకు న్యాయనిర్ణేతగా Jevను మూడు ప్రిప్రింట్ అధ్యయనాలు పరీక్షించాయి. ప్రాధాన్యత, రుబ్రిక్, వైద్య పనుల్లో ఫలితాలు మారాయి; ప్రత్యామ్నాయ మోడల్ Jev పొరపాట్లను సరిచేసినప్పుడే విశ్వాస-ఆధారిత రూటింగ్ ఉపయోగపడింది.
By BIG CHANGE Editorial
Published: 2026-09-29T20:57:02.938Z
Updated: 2026-09-29T20:57:02.938Z
Canonical: https://bigchange.ai/blog/jev-ai-judge-evaluation-confidence-routing

AI-generated conceptual illustration by BIG CHANGE.
మూడు కొత్త ప్రిప్రింట్లు Jevను వేర్వేరు రీతుల్లో మూల్యాంకనకర్తగా పరీక్షించాయి. సమాధానాల ప్రాధాన్యత, ఆధారాల ఆధారిత వాస్తవ నిర్ధారణలో అది బలమైన భాషా-మోడల్ న్యాయనిర్ణేతకు దగ్గరగా ఉందని ఒకటి గుర్తించింది; అనిశ్చిత సందర్భాలను మళ్లించే విధానాన్నీ పరీక్షించింది. రేటింగ్ రుబ్రిక్లపై ఆ రూటింగ్ వల్ల పెద్దగా ప్రయోజనం లేదని రెండోది కనుగొంది, ఎందుకంటే ప్రత్యామ్నాయ మోడళ్లు తరచూ Jev నమ్మకంగా చేసిన పొరపాట్లనే పునరావృతం చేశాయి. మూడో వైద్య బెంచ్మార్క్లో పరిశోధనా సారాంశాల ప్రశ్నలకు దాదాపు సమాన ఖచ్చితత్వం కనిపించింది; క్లిష్ట నిర్ధారణ కేసుల్లో మాత్రం గణనీయమైన అంతరం ఉంది.
ఆచరణలో సమాధానం “AI, AIను న్యాయనిర్ణయించగలదు” అన్నదానికంటే పరిమితం. స్పష్టంగా నిర్వచించిన పనికి Jev వేగవంతమైన ప్రాథమిక న్యాయనిర్ణేత కావచ్చు; అయితే ప్రతి రకమైన సమాధానానికి ఒకే విశ్వసనీయ న్యాయనిర్ణేత ఉందని ఆధారాలు చూపడం లేదు. తమ ఉదాహరణలపై విశ్వాస సూచిక ఏమి అంచనా వేస్తుందో బృందం పరిశీలించిన తర్వాతే, అది పనిని సరైన మార్గానికి మళ్లించడంలో ఉపయోగపడుతుంది.
## ఒక మోడల్ న్యాయనిర్ణేతగా పనిచేయడమంటే ఏమిటి
మూల్యాంకనకర్త ఒకటి లేదా అంతకంటే ఎక్కువ మోడల్ సమాధానాలను తీసుకుని, ఏదో ఒక నియమం ప్రకారం స్కోరు లేదా తీర్పు ఇస్తుంది. రెండు సమాధానాల్లో ఏది ప్రాంప్ట్ను మెరుగ్గా పాటిస్తుందో ఎంచుకోవడం, ఇచ్చిన పత్రాలు ఒక వాదనకు మద్దతిస్తున్నాయో నిర్ణయించడం, రుబ్రిక్తో సమాధానాన్ని స్కోరు చేయడం లేదా వైద్య బహుళైచ్ఛిక కేసులో సరైన ఎంపికను గుర్తించడం వంటి పనులు న్యాయనిర్ణేతకు ఇవ్వవచ్చు. ఈ పనులకు మూల్యాంకనకర్త నుంచి వేర్వేరు సామర్థ్యాలు అవసరం.
Jev అనేది TypeSafe హోస్ట్ చేసే నిర్ణయ మోడల్. దాని API నిర్మిత ఇన్పుట్, అనుమతించిన ప్రతిస్పందన రకాన్ని స్వీకరించి, అనుమతించిన లేబుళ్లపై సంభావ్యతలతో పాటు ఎంపిక లేదా స్కోరును అందిస్తుంది. పరిమిత ఫలితాన్ని ఆశించే సాఫ్ట్వేర్లో పనిని అమర్చేందుకు ఈ ఇంటర్ఫేస్ ఉపయోగపడవచ్చు. అయితే సంభావ్యత అనేది మోడల్ అంచనా మాత్రమే; మూల సమాధానాన్ని అది స్వతంత్రంగా ధృవీకరించదు. TypeSafe డాక్యుమెంటేషన్ ఇంటర్ఫేస్ను వివరిస్తుంది; దిగువ పరిశోధనల్లో నిర్దిష్ట పరీక్షా సమూహాలపై పనితీరును పోల్చారు.
ఈ [JEV-as-a-Judge అధ్యయనం](https://arxiv.org/abs/2609.26550v2)ను సెప్టెంబర్ 27న సవరించారు; ఇందులో Jev 1.13ను 16 జనరేటివ్, రివార్డ్-మోడల్ న్యాయనిర్ణేతలతో పోల్చారు. [రుబ్రిక్-న్యాయనిర్ణేత అధ్యయనం](https://arxiv.org/abs/2609.29769v1) సెప్టెంబర్ 24న ప్రచురితమై, Jevను తక్కువ ఖర్చు గల మూడు భాషా మోడళ్లతో పోల్చింది. [వైద్య బెంచ్మార్క్](https://arxiv.org/abs/2609.34024v1) సెప్టెంబర్ 27న ప్రచురితమై, రెండు reasoning సెట్టింగ్లలో Jev 1.13ను GPT-6 Solతో పోల్చింది. ఈ మూడూ ప్రిప్రింట్లు. వీటిలో ఏదీ వైద్య క్లినికల్ వినియోగ అధ్యయనం కాదు; ఏదీ సహచర సమీక్ష పొందలేదు.
## కొన్ని తీర్పుల్లో దగ్గరగా, తర్కంలో బలహీనంగా
మొదటి పత్రం ప్రాధాన్యత జంటలు, ఆధారాలతో నిర్ధారించిన వాస్తవికత, తుది సమాధాన తనిఖీలపై 5,172 తీర్పులను మూల్యాంకనం చేసి, ఆపై తదుపరి పరీక్షలు, ముందుగా పక్కన ఉంచిన రెండు రూటింగ్ అధ్యయనాలను జోడించింది. ప్రధాన బహిరంగ బెంచ్మార్క్లో Jev స్కోర్లు: నమూనాగా ఎంచుకున్న 1,500 RewardBench ప్రాధాన్యత జంటల్లో 92.5%, 350 JudgeBench జంటల్లో 78.6%, ఆధారాలతో అంచనా వేసిన 3,000 HaluEval సమాధానాల్లో 87.3%. అదే పనుల్లో అత్యుత్తమ GPT-6 Astra పోలిక మోడల్ వరుసగా 92.5%, 93.1%, 88.4% సాధించింది. అధ్యయన సమయ ప్యానెల్ ప్రకారం ప్రతి 1,000 ప్రాథమిక తీర్పులకు Jev ధర $0.044, మధ్యస్థ లేటెన్సీ 0.15 సెకన్లు; అదే పరిస్థితుల్లో GPT-6 Astra ధర $12.182, సమయం 1.89 సెకన్లు.
ఈ సగటులు రచయితలు గుర్తించిన పరిమితిని దాచేస్తాయి. సంభాషణ నాణ్యత, భద్రతా నిరాకరణలు, ఆధారాలతో నిర్ధారించిన వాస్తవికతలో Jev, GPT-6కు సుమారు రెండు పాయింట్లలోపే ఉంది. ఫలితాన్ని ఉత్పన్నం చేయడం లేదా తనిఖీ చేయడం అవసరమైన పనుల్లో అది వెనుకబడింది: గణితంలో 14.3 పాయింట్లు, కోడ్లో 12.9 పాయింట్లు, తర్క పజిళ్లలో 27.6 పాయింట్ల అంతరం. JudgeBenchలో వస్తునిష్ఠ సరైనత సమూహంపై Jev 78.6%, GPT-6 93.1% సాధించాయి. 990 అంశాల ఉపసమూహంలో వివాదాస్పద కేసులపై అంధ సమీక్షలో, వివాదాస్పద 69 JudgeBench అంశాల్లో 57పై సమీక్షకులు GPT-6కు, ఒక్కదానిపై Jevకు మద్దతిచ్చారు. ఈ సమీక్ష ఎంపిక చేసిన కొద్దిపాటి అంశాలకే పరిమితం; అయినా, ఈ అంతరం బెంచ్మార్క్ లేబుళ్ల సమస్య ఒక్కటే కాదని సూచిస్తుంది.
ఇక్కడ “న్యాయనిర్ణేత” అంటే రెండు రూపొందించిన సమాధానాల్లో ఒకదాన్ని ఎంచుకోవడం లేదా పేర్కొన్న ఆధారం ప్రకారం ఒక సమాధానానికి మద్దతు ఉందో, అది సరైనదో నిర్ణయించడం. జనరేటివ్ న్యాయనిర్ణేతలకు కారణ వివరణలు ఇవ్వనివ్వకుండా, Jev తరహా పరిమిత తీర్పు-మరియు-సంభావ్యత అవుట్పుట్ను రచయితలు ఉద్దేశపూర్వకంగా ఇచ్చారు. అందువల్ల పోలిక మానవుడికి తన తర్కాన్ని ఏ న్యాయనిర్ణేత మెరుగ్గా వివరిస్తుందన్నది కాదు; నిర్దిష్ట అవుట్పుట్ నియమంలో ఇచ్చిన తీర్పుల గురించే.
## పొరపాట్లు వేరుపడినప్పుడు విశ్వాస-ఆధారిత రూటింగ్ పనిచేస్తుంది
కాస్కేడ్ విధానంలో మొదట తక్కువ ఖర్చు గల న్యాయనిర్ణేతను ఉపయోగించి, కొన్ని కేసులను ఖరీదైన ప్రత్యామ్నాయ మోడల్కు పంపిస్తారు. మొదటి అధ్యయనంలో, Jev అత్యధిక లేబుల్ సంభావ్యత కనీసం 0.9 ఉన్నప్పుడు దాని తీర్పును అంగీకరించి, తక్కువ విశ్వాసం ఉన్న కేసులను ముందుకు పంపే నియమాన్ని పరీక్షించారు. పరీక్షలో ఉంచిన 1,610 ప్రాధాన్యత జంటల్లో, రెండు క్రమాల కాస్కేడ్ 31.5% కేసులను పైస్థాయికి పంపింది; GPT-6 92.5%తో పోలిస్తే 93.4% సాధించి, దాని రుసుములో 41% ఖర్చు చేసింది. రెండు కొత్త సరైనత పనుల నుంచి ముందే నిర్దేశించిన ప్రత్యక్ష పరీక్షలోని 570 జంటల్లో Jev ఒక్కటే GPT-6 కంటే 14 పాయింట్లు వెనుకబడింది; కాస్కేడ్ 74% కేసులను పైస్థాయికి పంపి, GPT-6 ఖర్చులో సుమారు నాలుగో వంతు ఆదా చేస్తూనే దాని ఖచ్చితత్వాన్ని అందుకుంది.
ఈ ఫలితానికి ఒక నిర్దిష్ట షరతు ఉంది: Jevకు అనిశ్చితంగా ఉన్న కేసుల్లో, ప్రత్యామ్నాయ మోడల్ సరిచేయగల పొరపాట్లు ఉండాలి. శైలి-ఆధారిత విరుద్ధ జంటల్లో విశ్వాస రూటింగ్ బలహీనపడిందని, సూచనలేని గద్యంపై విఫలమైందని రచయితలు కనుగొన్నారు; ఈ సందర్భాల్లో పరీక్షించిన న్యాయనిర్ణేతలన్నీ యాదృచ్ఛిక అవకాశానికి దగ్గరగా ఉన్నప్పటికీ తరచూ నమ్మకంగా సమాధానమిచ్చాయి. రెండు సమాధానాల క్రమాల్లోని తీర్పులను సగటు చేయడం వల్ల స్థాన ప్రభావాలు తగ్గాయని అధ్యయనం తెలిపింది. స్థానికంగా లేబుల్ చేసిన ఉదాహరణలతో పరిమితులను ఎంచుకుని, తక్కువ విశ్వాస పరిమితి పద్ధతిని, దాచిన పరీక్షా సమూహంతో తనిఖీని పత్రం సిఫార్సు చేసింది.
వేరే రుబ్రిక్ అధ్యయనం ఏడు బెంచ్మార్క్ల నుంచి తీసుకున్న తొమ్మిది ప్యానెల్లలో, ఒక్కో ప్రమాణానికి ఇచ్చిన స్కోరును పరీక్షించింది; మొత్తం 5,003 అంశం–ప్రమాణ జంటలు. రెండు ప్యానెల్లు బైనరీ, ఏడింటిలో క్రమబద్ధ రేటింగ్ స్కేల్లు ఉన్నాయి. నలుగురు న్యాయనిర్ణేతలకూ ఒకే ప్రమాణ పాఠ్యాన్ని ఇచ్చి, మూల్యాంకనానికి ముందే రచయితలు రుబ్రిక్లను స్థిరపరిచారు. 27 జత పోలికల్లో ఎనిమిదింటి 95% విశ్వాస అంతరం ఖచ్చితత్వ వ్యత్యాసం లేదన్న విలువను మినహాయించింది; బహుళ పోలికలకు సవరణ తర్వాత నాలుగు మాత్రమే మిగిలాయి. మరికొన్ని పోలికలు పత్రం నిర్వచించిన సమానత్వ పరిమితిని చేరాయి; చాలావాటిలో వ్యత్యాసం లేదా సమానత్వం నిర్ధారించడానికి అంచనాలు తగినంత ఖచ్చితంగా లేవు. బైనరీ ప్రమాణాల్లో Jev ఇతరులతో పోలిస్తే మెరుగ్గా చేసింది. గ్రేడెడ్ ప్యానెల్లలో సరిపోల్చిన న్యాయనిర్ణేతలలో అది ఎప్పుడూ మొదటి స్థానంలో లేదు; అన్ని న్యాయనిర్ణేతలూ మానవ రేటర్ల కంటే తక్కువ స్కోర్లు ఇచ్చే ధోరణి చూపాయి.
ఆ సెటప్లో ధర, వేగం ఆదా గణనీయంగా ఉన్నాయి. తొమ్మిది ప్యానెల్లన్నింటికీ Jev ఖర్చు సుమారు ఆరు సెంట్లు; మూడు భాషా-మోడల్ న్యాయనిర్ణేతలు 29 నుంచి 325 రెట్లు ఎక్కువ ఖర్చు చేసి, 30 నుంచి 220 రెట్లు ఎక్కువ సమయం తీసుకున్నారు. అయినా Jev విశ్వాసం బలమైన కాస్కేడ్ను సృష్టించలేదు. చాలా ప్యానెల్లలో దాని పొరపాట్లను విశ్వాసం గుర్తించినా, ప్రత్యామ్నాయ మోడళ్లు Jev అత్యంత నమ్మకంగా చేసిన పొరపాట్లలో దాదాపు అన్నింటినీ పునరావృతం చేశాయి. వేర్వేరు భాగాలపై సరిపోల్చిన పరిమితులతో, సగటున ఉత్తమ ఏకైక న్యాయనిర్ణేత కంటే కాస్కేడ్ గరిష్ఠంగా 1.5 శాతం పాయింట్లే మెరుగుపడింది; తొమ్మిదిలో ఆరు ప్యానెల్లలో మాత్రం ఆ న్యాయనిర్ణేత కంటే అధ్వాన్నంగా పనిచేసింది. ఈ పునఃపరీక్ష భవిష్యత్ ప్రత్యక్ష వినియోగం కాదు; ముందుగా నమోదు చేసిన తీర్పులను ఉపయోగించింది.
ఈ రెండు పత్రాల మధ్య వ్యత్యాసం గమనించదగినది. జత సమాధానాల పోలికలో, Jev తక్కువ విశ్వాసంతో చేసిన పొరపాట్లను బలమైన ప్రత్యామ్నాయ మోడల్ సరిచేయగల ఉపయోగకరమైన విభజనను మొదటి అధ్యయనం గుర్తించింది. ప్రమాణాల స్కోరింగ్లో ప్రత్యామ్నాయ మోడల్ తరచూ అదే పొరపాట్లు చేయడంతో, పైస్థాయికి పంపడం వల్ల ఖర్చు పెరిగినా సవరణ పెద్దగా జరగలేదు. మరో మోడల్ ఉపయోగకరంగా భిన్నమైన తీర్పు ఇస్తుందో లేదో, మోడల్ విశ్వాస సంకేతం ఒక్కటే బృందానికి చెప్పదు.
## వైద్య బహుళైచ్ఛిక ఫలితాలు పని కష్టతను బట్టి మారుతాయి
వైద్య పత్రం ఇప్పటికే ఉన్న నాలుగు డేటాసెట్లపై Jevను మూల్యాంకనం చేసింది: పరీక్షల్లోని 1,373 MetaMedQA ప్రశ్నలు, పరిశోధనా సారాంశాల ఆధారంగా సమాధానమిచ్చిన 500 PubMedQA ప్రశ్నలు, 915 DiagnosisArena బహుళైచ్ఛిక కేసులు, ప్రచురిత తుది నిర్ధారణ ఉన్న 34 NEJM Case Challenges. Jevను GPT-6 Solతో మధ్యస్థ reasoningతో, reasoning లేకుండా పోల్చారు. మొత్తం 8,469 మోడల్ అభ్యర్థనలు జరిగాయి; ప్రతి అభ్యర్థనకు చెల్లుబాటు అయ్యే నిర్మిత సమాధానం వచ్చింది.
PubMedQAలో Jev, మధ్యస్థ reasoningతో GPT-6 Sol వరుసగా 78.4%, 78.2% సాధించాయి. MetaMedQAలో Jev 74.8%, GPT-6 Sol 82.7%; DiagnosisArenaలో 59.8% వర్సెస్ 82.4%; 34 NEJM కేసుల్లో 61.8% వర్సెస్ 82.4%. reasoning లేకుండా GPT-6 కూడా రెండు క్లిష్ట కేసు సమూహాల్లో ఎక్కువ పాయింట్ అంచనాలు సాధించింది. 34 NEJM కేసుల అంచనా ఖచ్చితత్వం తక్కువ; బహుళ పోలికల సవరణ తర్వాత దాని ప్రధాన పోలిక గణాంకపరంగా ముఖ్యంగా మిగల్లేదు. DiagnosisArenaలోని చాలా పెద్ద అంతరం స్పష్టమైన reasoning లేకున్నా కొనసాగింది.
ఇది ఇచ్చిన ఎంపికల్లో సరైనదాన్ని ఎంచుకునే పరీక్ష మాత్రమే; భేద నిర్ధారణ చేయడం లేదా రోగులకు చికిత్స ఇవ్వడం కాదు. బెంచ్మార్క్ సమాధానాలను వైద్యులు సమీక్షించి తీర్పు ఇచ్చినట్లు పత్రం నివేదించలేదు. NEJM చిత్రాలను మోడళ్లకు శీర్షికల రూపంలో ఇచ్చారని, క్లిష్ట DiagnosisArena కేసులను ఇతర భాషా మోడళ్లతో పోల్చి వడపోశారని పేర్కొంది. ఫలితాలు ప్రాథమికమని, స్వతంత్ర పునరావృతం, ఆధార సమాధానాలపై వైద్య సమీక్ష, పునరావృత పరీక్షల్లో స్థిరత్వ పరిశీలనలు ఇంకా పెండింగ్లో ఉన్నాయని రచయితలు చెబుతున్నారు. వైద్య సంరక్షణకు మార్గనిర్దేశం చేసేందుకు ఈ ఫలితాలను ఉపయోగించవద్దని పత్రం స్పష్టంగా హెచ్చరిస్తుంది.
సంభావ్యత పరిమితుల విలువ ఒకేలా లేదు. MetaMedQAలో Jev ఎంపికల్లో 52.9%కి కనీసం 0.9 విశ్వాసం ఉంది; ఆ ఎంపికల్లో 93.4% సరైనవి. దాదాపు సమాన సంఖ్యలో కేసులను అంగీకరించినప్పుడు GPT-6 కూడా అంతే ఖచ్చితంగా లేదా అంతకంటే మెరుగ్గా ఉంది. DiagnosisArenaలో Jev సంభావ్యత ర్యాంకింగ్ బలహీనంగా ఉంది: అదే 0.9 పరిమితి వద్ద 17.3% అంశాలనే అంగీకరించింది; అంగీకరించిన సమాధానాల్లో నాలుగింట ఒకటి ఇంకా తప్పే. ప్రతి బెంచ్మార్క్లోనూ మోడళ్ల ఎంపిక చేసిన ఎంపికల సగటు సంభావ్యత వాటి ఖచ్చితత్వాన్ని మించింది. ఈ నమూనాలో అధిక స్కోరు అంటే నిశ్చితత్వం కాదు.
## ఈ అధ్యయనాల నుంచి బృందాలు ఏమి తీసుకోవచ్చు
కలిపి చూస్తే, ఇచ్చిన పాఠ్యం నుంచి తీర్పును చదవగలిగే లేదా ఆధారాలతో తనిఖీ చేయగల పనుల్లో Jevను నిర్దిష్ట పనికి మూల్యాంకనకర్తగా పరీక్షించేందుకు ఈ పత్రాలు మద్దతిస్తాయి. దాని విశ్వాస ఫీల్డ్ను సార్వత్రిక భద్రతా స్విచ్లా చూడటానికి మాత్రం మద్దతు ఇవ్వవు. వేర్వేరు పనుల్లో వేర్వేరు ఫలితాలు వచ్చాయి; ఖచ్చితత్వంతో పాటు పొరపాట్లు స్వతంత్రమా కాదా అన్నదీ ప్రత్యామ్నాయ మోడల్లో పరీక్షించాలని రుబ్రిక్ అధ్యయనం చూపిస్తుంది.
ఈ విధానాన్ని పరిశీలించే బృందానికి తన పనినుంచి ప్రతినిధ్యంగా ఎంపిక చేసి లేబుల్ చేసిన నమూనా అవసరం. సరైన నిర్ణయం అంటే ఏమిటో నిర్వచించి, క్లిష్టమైన, తప్పుదారి పట్టించే ఉదాహరణలను చేర్చి, మానవ సమీక్ష లేదా సమర్థించగల మరో ఆధారంతో పోల్చాలి. ఆపై పొరపాటు రేట్లతో పాటు, సరైనవి–తప్పులను విశ్వాసం ఎంత బాగా వేరు చేస్తుందో కొలవాలి. కాస్కేడ్ కోసం, మొదటి దశ పొరపాట్లను ప్రత్యామ్నాయ మోడల్ నిజంగా సరిచేస్తుందా, ఎన్ని కేసులు పైస్థాయికి వెళ్తాయి, దాంతో ఖర్చు, ఆలస్యం ఎంత వస్తుందో కూడా నమోదు చేయాలి. పరిమితిని ఎంచుకోవడానికి ఉపయోగించిన ఉదాహరణలకు మించి అది వర్తిస్తుందో లేదో, ప్రత్యేకంగా కేటాయించిన పరీక్షా సమూహం చూపగలదు.
ఇవి అధ్యయనాల నుంచి తీసుకున్న ఆచరణాత్మక సూచనలు మాత్రమే; BIG CHANGE పరీక్షించిన విధానం కాదు. Jev APIని పిలవలేదు, స్థానిక బెంచ్మార్క్ను కూడా నడపలేదు. TypeSafe యొక్క [API డాక్యుమెంటేషన్](https://api.typesafe.ai/docs) లో నిర్మిత అభ్యర్థనలు, అనుమతించిన సమాధాన రకాలు, మోడల్ శోధన వివరించబడ్డాయి; కానీ బృందం పనిపై ఖచ్చితత్వాన్ని అది స్వతంత్రంగా నిర్ధారించదు. ఉత్పత్తి ప్రాప్యత, ధరలు, మోడళ్లు మారవచ్చు; ప్రయోగాన్ని ప్రణాళిక చేసేటప్పుడు ప్రస్తుత డాక్యుమెంటేషన్ను తనిఖీ చేయాలి.
ప్రస్తుతానికి, పని పరిమితంగా ఉండి, లేబుళ్లు స్పష్టంగా ఉండి, స్థానిక మూల్యాంకనంలో విశ్వాసం పొరపాట్లను సమర్థంగా మళ్లిస్తుందని తేలితే Jevను తొలి న్యాయనిర్ణేత అభ్యర్థిగా ఉపయోగించడం సమంజసం. లోతైన తర్కం అవసరమైనప్పుడు, స్కోరింగ్ దాచిన రేటర్ సంప్రదాయాలపై ఆధారపడినప్పుడు లేదా పలు మోడళ్లు ఒకే పొరపాట్లు చేసినప్పుడు, మానవ సమీక్ష లేదా ధృవీకరించిన మరో తనిఖీని కొనసాగించేందుకు ఈ అధ్యయనాలు కారణం చూపుతున్నాయి.
## పెద్ద మార్పు
Jevపై కొత్త మూల్యాంకనాలు, నిర్ణయ మోడల్ తక్కువ ఖర్చుతో తీర్పు ఇవ్వగలదా అన్న ప్రశ్నను దాటి, ఆ తీర్పును ఎప్పుడు కొనసాగించదగినంతగా ఉపయోగించవచ్చన్నదానిపై దృష్టి మళ్లిస్తున్నాయి. సమాధానం పని తీరుపై ఆధారపడి ఉంటుంది: పరీక్షలో దాచిన జత-పోలిక మూల్యాంకన కాస్కేడ్లో విశ్వాస రూటింగ్ మెరుగుదల ఇచ్చింది; వేరే రుబ్రిక్ అధ్యయనంలో పొరపాట్లు కలిసిపోవడంతో లాభం తక్కువగా ఉంది. వైద్య బహుళైచ్ఛిక ఫలితాలూ పని కష్టతను బట్టి బాగా మారాయి. AI బృందాల తదుపరి అడుగు సరైనత, విశ్వాసం, ప్రత్యామ్నాయ ప్రవర్తనను కలిపి పరీక్షించే స్థానిక ధృవీకరణ సమూహం నిర్మించడం.
## మూలాలు, మరింత చదవండి
- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure](https://arxiv.org/abs/2609.26550v2) — Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman; 2026 సెప్టెంబర్ 27 తేదీతో రెండో సంచిక. అంధ మానవ తీర్పు, దాచిన విశ్వాస-రూటింగ్ పరీక్షలతో Jevను 16 న్యాయనిర్ణేతలతో పోల్చిన ప్రిప్రింట్.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places](https://arxiv.org/abs/2609.29769v1) — Delip Rao, Chris Callison-Burch; 2026 సెప్టెంబర్ 24. తొమ్మిది బెంచ్మార్క్ ప్యానెల్లలో ఒక్కో ప్రమాణానికి బైనరీ, గ్రేడెడ్ తీర్పులను మూల్యాంకనం చేసిన ప్రిప్రింట్.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results.](https://arxiv.org/abs/2609.34024v1) — Alfredo Madrid-García, Beatriz Merino-Barbancho; 2026 సెప్టెంబర్ 27. నాలుగు వైద్య బహుళైచ్ఛిక డేటాసెట్లపై ప్రాథమిక బెంచ్మార్క్ పోలిక; క్లినికల్ అధ్యయనం కాదు.
- [TypeSafe API డాక్యుమెంటేషన్](https://api.typesafe.ai/docs) — Jev నిర్మిత అభ్యర్థన, అవుట్పుట్ ఇంటర్ఫేస్కు అధికారిక సూచిక. డాక్యుమెంటేషన్ ఉత్పత్తి ప్రవర్తనను వివరిస్తుంది; స్వతంత్ర మూల్యాంకనం కాదు.
## Sources
- [JEV-as-a-Judge: Accept When Confident, Escalate When Unsure (v2)](https://arxiv.org/abs/2609.26550v2) — ప్రధాన ప్రిప్రింట్; సెప్టెంబర్ 22న సమర్పించి, సెప్టెంబర్ 27న సవరించారు. ప్రాధాన్యత, ఆధారాలపై ఆధారిత వాస్తవ నిర్ధారణ, తుది-సమాధాన పనుల్లో Jev 1.13ను 16 న్యాయనిర్ణేతలతో పోల్చింది; ఎంపిక చేసిన అంధ సమీక్ష, స్థిరపరచిన ఆఫ్లైన్ కాస్కేడ్ విశ్లేషణలు, ముందుగా నిర్దేశించిన రెండు ప్రత్యక్ష దాచిన-పనిభారం పరీక్షలు ఉన్నాయి. సహచర సమీక్ష పొందలేదు; వినియోగ సామర్థ్య సరిపోలిక, ఎంపిక చేసిన తీర్పు సమీక్ష, పని విస్తృతి, ఖర్చు, సమయ పరిమితులు SOURCE-AUDIT.mdలో నమోదు చేశాం.
- [Jev vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places (v1)](https://arxiv.org/abs/2609.29769v1) — తొమ్మిది బెంచ్మార్క్ ప్యానెల్లు, 5,003 రుబ్రిక్ అంశం-జంటలపై Jevను మూడు flash-శ్రేణి LLMలతో పోల్చిన ప్రాథమిక ప్రిప్రింట్. ప్రమాణ పాఠ్యాలు ఒకేలా ఉన్నాయి; రెండు బైనరీ, ఏడు గ్రేడెడ్ ప్యానెల్లు. పరస్పరం సంబంధిత నమ్మకమైన పొరపాట్లు, ఎక్కువగా రీప్లే ఆధారిత రూటింగ్ విశ్లేషణను చూపిస్తుంది. సహచర సమీక్ష పొందలేదు; అనేక పోలికలు గణాంకపరంగా నిశ్చయాత్మకం కావు; ఫలితాలు ఎంచుకున్న రుబ్రిక్లు, ప్యానెల్లు, సర్వింగ్ పరిస్థితుల పరిధికే పరిమితం.
- [Jev in Medicine: A Benchmark Evaluation. Preliminary results. (v1)](https://arxiv.org/abs/2609.34024v1) — నాలుగు వైద్య బహుళైచ్ఛిక బెంచ్మార్క్లపై Jev 1.13ను GPT-6 Solతో పోల్చిన ప్రాథమిక ప్రధాన ప్రిప్రింట్. ఖచ్చితత్వం, కాలిబ్రేషన్/ఎంపికాత్మక అంచనా, సమాధానం నిలిపివేత, లేటెన్సీ, ఖర్చు ఉన్నాయి. క్లినికల్ వినియోగం లేదా వైద్యుల తీర్పు లేదు; స్వతంత్ర పునరావృతం, ఫలితాల ధృవీకరణ పెండింగ్లో ఉన్నాయని రచయితలు చెబుతూ, వైద్య సంరక్షణలో ఉపయోగించవద్దని సూచించారు.
- [TypeSafe API డాక్యుమెంటేషన్](https://api.typesafe.ai/docs) — 2026 సెప్టెంబర్ 29న తెరిచిన అధికారిక OpenAPI డాక్యుమెంటేషన్లో నిర్మిత అభ్యర్థన/ప్రతిస్పందన స్కీమాలు, system-one ఎండ్పాయింట్, మోడల్ శోధన ఉన్నాయి. ఇది ఇంటర్ఫేస్ వివరణకు ఆధారం మాత్రమే; స్వతంత్ర పనితీరు వాదనలకు కాదు. ఉత్పత్తి లభ్యత, ధరలు మారవచ్చు.
- [యజమాని హ్యాండాఫ్ Instagram Reel Dd3wdNKxg5J](https://www.instagram.com/reel/Dd3wdNKxg5J/?stkn=czk2a2JmOHVyMDRm) — కేటాయింపు సూచన మాత్రమే: Reelను పొందడం లేదా ట్రాన్స్క్రైబ్ చేయడం సాధ్యపడలేదు. క్యాప్షన్, మెటాడేటాను ఆధారాలుగా ఉపయోగించలేదు; వీడియో దృశ్యాలకు ఎలాంటి వాదనలను ఆపాదించలేదు.
BIG CHANGE వార్తాపత్రిక
పెద్ద దృశ్యం. మీ వేగంతో.
AI, రోబోటిక్స్ తాజా కథనాలు, గమనించదగిన మార్పులు, ఆచరణలో పెట్టగల ఆలోచనలు. రోజువారీ బ్రీఫింగ్, వారపు సంకలనం లేదా నెలవారీ దృక్కోణం ఎంచుకోండి.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
మీ గోప్యత, మీ ఎంపిక.
అవసరమైన నిల్వ సైట్ భద్రతకు తోడ్పడి, మీ ఎంపికలను గుర్తుంచుకుంటుంది. మీరు అనుమతించే వరకు ఐచ్ఛిక Google Analytics ఆఫ్లోనే ఉంటుంది. అవసరమైన స్టోరేజ్తోనే ప్రతి కథనాన్ని చదవవచ్చు. గోప్యత వివరాలు