ఒక డెవలపర్ Allan Riordan Boll సెప్టెంబర్ 25న ప్రచురించిన Python ఉదాహరణ Jev శైలి నిర్ణయ అభ్యర్థనకు చిత్రాలను జతచేస్తుంది. ఇది ప్రతి వెబ్‌క్యామ్ ఫ్రేమ్‌ను చిన్న ప్రశ్నలతో పాటు విజన్ మోడల్‌కు పంపి, మోడల్ తదుపరి టోకెన్ సంభావ్యతలను అవును/కాదు విలువ, ఎంపిక లేదా స్కోరుగా మారుస్తుంది. ఇది స్వతంత్ర ర్యాపర్; Jev విజన్ ఫీచర్ కాదు, Jev మోడల్ పరీక్షా కాదు.

డెవలపర్లకు ఈ పద్ధతి పరిమితి తెలుసుకోవడం ఉపయోగకరం. విజన్ మోడల్ వివరణ రాయకుండానే నిర్దిష్ట ప్రశ్నకు సమాధానం చెప్పగలదు; అయితే తిరిగి వచ్చే ఎంపికల సంభావ్యతలు prompt, అందుబాటులోని టోకెన్ ప్రత్యామ్నాయాలు, మోడల్‌పై ఆధారపడతాయి. ఈ పోస్ట్ పరిశీలించదగిన పనిచేసే నమూనాను చూపుతుంది; ఖచ్చితత్వ అధ్యయనం కాదు.

పెద్ద మార్పు

  • ఏమి మారింది:ఒక డెవలపర్ Jevతో అనుబంధమైన చిన్న నిర్ణయ ఫార్మాట్‌ను సాధారణ విజన్ మోడళ్లతో చిత్రాలకు అన్వయించారు. ప్రతి అభ్యర్థనకు చిత్రం జతచేస్తారు; ఒక అక్షర సమాధానం దృశ్య ప్రశ్నను సాఫ్ట్‌వేర్ నిర్వహించగల విలువగా మారుస్తుంది.
  • ఇది ఎందుకు ముఖ్యం:ప్రతి ప్రశ్నకు ప్రత్యేక చిత్ర వర్గీకరణ నమూనా నిర్మించకుండానే డెవలపర్లు పాఠ్యంలో దృశ్య ప్రమాణాన్ని మార్చి రక నిర్దేశిత ఫలితాన్ని పొందవచ్చు. ఈ ఉదాహరణ కనిపించే వ్యక్తులు, మొక్కలు, ప్రదేశం లోపలా బయటా అనే విషయం, వెలుతురును చూస్తుంది; ఇతర కెమెరాలు లేదా దృశ్యాలకు ఆ తీర్పులు ఎంత నమ్మకంగా వర్తిస్తాయో నిరూపించదు.
  • గమనించాల్సింది:ఎంచుకున్న మోడల్, ఎండ్‌పాయింట్ పని కోసం అవసరమైన ప్రత్యామ్నాయ-టోకెన్ స్కోర్లను తగినంత స్థిరంగా ఇస్తాయా అనేదే ఆచరణాత్మక నిర్ణయం. వెబ్‌క్యామ్ ఫలితం చర్యను ప్రేరేపించే ముందు ప్రతినిధి చిత్రాలతో ఫ్రేమ్ త్రూపుట్, నిర్ణయ నాణ్యతను కలిపి కొలవాలి.

చిత్ర నిర్ణయం ఎలా పనిచేస్తుంది

TypeSafe AI Jev త్వరిత ప్రారంభ మార్గదర్శి ఒక రక నిర్దేశిత state మరియు రక నిర్దేశిత questions ప్రశ్నల సమితిని నమోదు చేస్తుంది: noul అవును/కాదు విలువ కోసం, choice పేరున్న ప్రత్యామ్నాయాల కోసం, score క్రమబద్ధ స్థాయిల కోసం. Boll స్క్రిప్ట్ ఆ పేర్లను ఉపయోగించి చిత్ర మార్గాలు లేదా base64 డేటా URLల శ్రేణి అయిన attachments ను జతచేస్తుంది. ఆ ఫీల్డ్ అభ్యర్థన ఆబ్జెక్ట్‌కు ఆయన చేర్చిన విస్తరణ; ఉదహరించిన Jev త్వరిత ప్రారంభం పాఠ్య స్థితిని వివరిస్తుంది కానీ దాన్ని Jev API ఇన్‌పుట్‌గా నమోదు చేయదు.

ప్రతి ప్రశ్నకు స్క్రిప్ట్ అక్షరాలతో గుర్తించిన ఎంపికలతో prompt నిర్మిస్తుంది, ఉదాహరణకు [A] true మరియు [B] false వంటి అక్షర ఎంపికలతో prompt నిర్మిస్తుంది. ఉత్తమ అక్షరంతో సమాధానం ఇవ్వమని మోడల్‌ను అడిగి, మొదటి అవుట్‌పుట్ టోకెన్ యొక్క top_logprobsను చదువుతుంది. తిరిగి వచ్చిన లాగ్ సంభావ్యతలను ఘాతాంకం చేసి, జాబితాలోని అక్షరాల మధ్య బరువులను సాధారణీకరించి, ప్రశ్న రకానికి జతచేస్తుంది. choice అత్యధిక బరువు గల ఎంపిక, దాని పంపిణీని ఇస్తుంది. noul దానికి సంబంధించిన బరువును ఇస్తుంది true. score క్రమబద్ధ స్థాయిల బరువుతో కూడిన సగటును ఇస్తుంది. వదిలేసిన ఎంపిక టోకెన్లకు ఇంకా గణనీయమైన బరువు ఉండవచ్చంటే స్క్రిప్ట్ సమాధానాన్ని తిరస్కరిస్తుంది.

ప్రతి ప్రశ్నతో చిత్రం పంపబడుతుంది. అన్ని సమాధానాలను ఒక మోడల్ కాల్‌లో పొందకుండా ఉదాహరణ వేర్వేరు అభ్యర్థనలు పంపుతుంది. OpenAI మార్గం Responses APIని input_image, top_logprobs మరియు message.output_text.logprobsతో ఉపయోగిస్తుంది; స్థానిక llama.cpp మార్గం Chat Completionsను image_url కంటెంట్ అంశం, లాగ్ సంభావ్యతలతో ఉపయోగిస్తుంది. OpenAI చిత్ర మార్గదర్శి base64 చిత్ర డేటா URLలను వివరిస్తుంది; దాని Responses సూచన లాగ్-సంభావ్యత అవుట్‌పుట్‌ను, ప్రతి టోకెన్ స్థానానికి గరిష్ఠంగా 20 ప్రత్యామ్నాయాలు తిరిగి రావచ్చని వివరిస్తుంది. llama.cpp సర్వర్ డాక్యుమెంటేషన్ దాని చాట్ ఇంటర్‌ఫేస్‌లో చిత్ర URLలను వివరిస్తుంది. ఈ మూలాలు అభ్యర్థన నమూనాకు మద్దతిస్తాయి; రెండు ఎండ్‌పాయింట్లలోనూ ఉదాహరణను నడపలేదు.

వెబ్‌క్యామ్ ఉదాహరణ ఏం కొలుస్తుంది

స్క్రిప్ట్ OpenCVతో ఫ్రేమ్‌ను పట్టుకుని JPEGగా ఎన్‌కోడ్ చేసి నాలుగు ప్రశ్నలు వేస్తుంది: వ్యక్తి లేదా మొక్క కనిపిస్తుందా, ప్రదేశం లోపలా బయటా, వెలుతురు ఎంత. ప్రివ్యూ కొనసాగుతుండగా నేపథ్య వర్కర్ ఒక్కోసారి ఒక ఫ్రేమ్‌ను అంచనా వేస్తుంది. కెమెరా అమరిక Linux V4L2ను ఉపయోగిస్తుంది కాబట్టి ప్రచురించిన ఫైల్ మార్పులు లేకుండా ఎక్కడైనా పనిచేసే వెబ్‌క్యామ్ అమరిక కాదు. వ్యాస పాఠ్యంలో ఒక్కో ఫ్రేమ్‌కు మూడు ప్రశ్నలని ఉంది, కానీ ప్రచురిత కోడ్‌లో నాలుగు ఉన్నాయి; ఈ లెక్కకు కోడ్ ఆధారం.

Boll సుమారు సెకనుకు ఒక ఫ్రేమ్‌ను అంచనా వేసినట్లు RTX 3090పై స్థానికంగా నడిపిన Gemma 4 12B QAT మోడల్‌తో, అలాగే సుమారు సెకనుకు 0.2 ఫ్రేమ్‌లు హోస్ట్ చేసిన GPT-6 Lunaతో వచ్చినట్లు చెబుతున్నారు. మళ్లీ మళ్లీ కనెక్షన్లు చేయడం హోస్ట్ ఫలితానికి కారణమై ఉండవచ్చని సూచిస్తున్నారు. హార్డ్‌వేర్, నెట్‌వర్క్, చిత్ర పరిమాణం, క్యాషింగ్, ఖచ్చితత్వం లేదా అభ్యర్థన సమయంపై నియంత్రిత పోలికను పోస్ట్ ఇవ్వదు. ఈ సంఖ్యలు ఈ రచయిత సెటప్, కోడ్‌ను వివరిస్తాయి; మోడళ్ల సాధారణ వేగ ర్యాంకింగ్ కాదు. GPT-6 Luna చిత్ర ఇన్‌పుట్‌ను అంగీకరిస్తుందని OpenAI పేర్కొంటుంది, దాని మోడల్ మార్గదర్శి ఉదాహరణలో ఉపయోగించిన none reasoning సెట్టింగ్‌ను Luna మద్దతిస్తుందని చెబుతుంది.

స్క్రిప్ట్‌ను మార్చే డెవలపర్ మొదట నిర్దిష్ట తనిఖీలు చేయాలి: మోడల్ చిత్ర ఇన్‌పుట్‌ను అంగీకరించి అవసరమైన మొదటి-టోకెన్ ప్రత్యామ్నాయాలను ఇస్తుందో నిర్ధారించండి; అన్ని ఎంపిక అక్షరాలు కనిపిస్తున్నాయా చూడండి; ఆపై ఉద్దేశించిన కెమెరా లేదా డేటాసెట్ నుంచి లేబుల్ చేసిన చిత్రాలపై తిరిగి వచ్చిన నిర్ణయాలను అంచనా వేయండి. సాధారణీకరించిన బరువులు జాబితాలోని అక్షర టోకెన్లతో పోల్చినవి. అవి ఒక్కటే దృశ్య తీర్పు సరైనదని కొలిచిన సంభావ్యతలు కావు. OpenAI పాత logprobs cookbook టోకెన్-సంభావ్యత భావనను వివరిస్తుంది; అయితే అది ఆర్కైవ్‌గా గుర్తించబడింది, API ఉదాహరణలు పాతబడివుండవచ్చు.

రక నిర్దేశిత ఫలితం తర్వాత అప్లికేషన్ కోడ్ ఏం చేయాలో కూడా ఈ ర్యాపర్ స్పష్టం చేస్తుంది. ఇచ్చిన చిత్రాన్ని రాతపూర్వక ప్రమాణంతో మోడల్ అంచనా వేస్తుంది. అప్లికేషన్ ఫ్రేమ్‌లను ఎంచుకుని, లేని స్కోర్లను నిర్వహించి, ఫలితం చర్యకు సరిపడా సురక్షితమో నిర్ణయిస్తుంది. Boll ఉదాహరణ పట్టికను ముద్రిస్తుంది; ఆటోమేటెడ్ చర్య లేదా కొలిచిన అమలును నివేదించదు.

మూలాలు, మరింత చదవడానికి

  • Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” సెప్టెంబర్ 25, 2026: అసలు Python ఉదాహరణ, వెబ్‌క్యామ్ పని విధానం, రచయిత తెలిపిన ఫ్రేమ్ వేగాలు. పాఠ్యంలో ఒక్కో ఫ్రేమ్‌కు మూడు ప్రశ్నలని ఉంది; కోడ్ నాలుగింటిని నిర్వచిస్తుంది. సమయాలు స్వతంత్ర లేదా నియంత్రిత బెంచ్‌మార్క్ కావు.
  • TypeSafe AI, Jev త్వరిత ప్రారంభం: పాఠ్య స్థితి, noul, choiceమరియు scoreప్రశ్న రకాలను నమోదు చేస్తుంది. రచయిత అనుకూల attachmentsఫీల్డ్‌ను Jev API ఫీచర్‌గా నమోదు చేయదు.
  • OpenAI, Images and vision: input_image, చిత్ర URLలు, విజన్ ఇన్‌పుట్ కోసం base64 డేటా URLలను వివరిస్తుంది. Responses API సూచనను వివరిస్తుంది message.output_text.logprobsమరియు తిరిగి వచ్చే ప్రత్యామ్నాయాల పరిమితిని వివరిస్తుంది.
  • OpenAI, GPT-6 Luna మోడల్, మోడల్ మార్గదర్శి: చిత్ర ఇన్‌పుట్, మోడల్ nonereasoning సెట్టింగ్‌ను నిర్ధారిస్తుంది; మోడల్ మార్గదర్శిపారామీటర్ అనుకూలతను వివరిస్తుంది. ఈ పత్రాలు బ్లాగ్ రచయిత త్రూపుట్‌ను ధృవీకరించవు.
  • llama.cpp సర్వర్ డాక్యుమెంటేషన్: OpenAI-అనుకూల చాట్ ఎండ్‌పాయింట్, చిత్ర URL ఇన్‌పుట్‌ను వివరిస్తుంది. వాడుతున్న ఖచ్చితమైన సంస్కరణ, మోడల్‌తో బ్యాకెండ్ మద్దతు, తిరిగి వచ్చే టోకెన్ జాబితాను తనిఖీ చేయాలి.
  • OpenAI cookbook, Using logprobs: టోకెన్ సంభావ్యతల నేపథ్య వివరణ. ఈ రెసిపీ ఆర్కైవ్‌లో ఉందని, కొన్ని మోడళ్లు లేదా APIలకు పాతదై ఉండవచ్చని OpenAI హెచ్చరిస్తుంది.