AI-translated from English; not yet reviewed by a fluent editor.
# Jev తరహా విజన్ ర్యాపర్ చిత్ర ప్రశ్నలను రక నిర్దేశిత ఎంపికలుగా మారుస్తుంది
> ఒక స్వతంత్ర Python ఉదాహరణ విజన్ మోడల్ టోకెన్ సంభావ్యతలను ఉపయోగించి చిత్రాల నుంచి రక నిర్దేశిత నిర్ణయాలను అందిస్తుంది. వెబ్క్యామ్ వేగాలు రచయిత తెలిపినవి; ఖచ్చితత్వం పరీక్షించలేదు.
By BIG CHANGE Editorial
Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

AI-generated conceptual illustration by BIG CHANGE.
ఒక [డెవలపర్ Allan Riordan Boll సెప్టెంబర్ 25న ప్రచురించిన Python ఉదాహరణ ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)Jev శైలి నిర్ణయ అభ్యర్థనకు చిత్రాలను జతచేస్తుంది. ఇది ప్రతి వెబ్క్యామ్ ఫ్రేమ్ను చిన్న ప్రశ్నలతో పాటు విజన్ మోడల్కు పంపి, మోడల్ తదుపరి టోకెన్ సంభావ్యతలను అవును/కాదు విలువ, ఎంపిక లేదా స్కోరుగా మారుస్తుంది. ఇది స్వతంత్ర ర్యాపర్; Jev విజన్ ఫీచర్ కాదు, Jev మోడల్ పరీక్షా కాదు.
డెవలపర్లకు ఈ పద్ధతి పరిమితి తెలుసుకోవడం ఉపయోగకరం. విజన్ మోడల్ వివరణ రాయకుండానే నిర్దిష్ట ప్రశ్నకు సమాధానం చెప్పగలదు; అయితే తిరిగి వచ్చే ఎంపికల సంభావ్యతలు prompt, అందుబాటులోని టోకెన్ ప్రత్యామ్నాయాలు, మోడల్పై ఆధారపడతాయి. ఈ పోస్ట్ పరిశీలించదగిన పనిచేసే నమూనాను చూపుతుంది; ఖచ్చితత్వ అధ్యయనం కాదు.
## పెద్ద మార్పు
- **ఏమి మారింది:**ఒక డెవలపర్ Jevతో అనుబంధమైన చిన్న నిర్ణయ ఫార్మాట్ను సాధారణ విజన్ మోడళ్లతో చిత్రాలకు అన్వయించారు. ప్రతి అభ్యర్థనకు చిత్రం జతచేస్తారు; ఒక అక్షర సమాధానం దృశ్య ప్రశ్నను సాఫ్ట్వేర్ నిర్వహించగల విలువగా మారుస్తుంది.
- **ఇది ఎందుకు ముఖ్యం:**ప్రతి ప్రశ్నకు ప్రత్యేక చిత్ర వర్గీకరణ నమూనా నిర్మించకుండానే డెవలపర్లు పాఠ్యంలో దృశ్య ప్రమాణాన్ని మార్చి రక నిర్దేశిత ఫలితాన్ని పొందవచ్చు. ఈ ఉదాహరణ కనిపించే వ్యక్తులు, మొక్కలు, ప్రదేశం లోపలా బయటా అనే విషయం, వెలుతురును చూస్తుంది; ఇతర కెమెరాలు లేదా దృశ్యాలకు ఆ తీర్పులు ఎంత నమ్మకంగా వర్తిస్తాయో నిరూపించదు.
- **గమనించాల్సింది:**ఎంచుకున్న మోడల్, ఎండ్పాయింట్ పని కోసం అవసరమైన ప్రత్యామ్నాయ-టోకెన్ స్కోర్లను తగినంత స్థిరంగా ఇస్తాయా అనేదే ఆచరణాత్మక నిర్ణయం. వెబ్క్యామ్ ఫలితం చర్యను ప్రేరేపించే ముందు ప్రతినిధి చిత్రాలతో ఫ్రేమ్ త్రూపుట్, నిర్ణయ నాణ్యతను కలిపి కొలవాలి.
## చిత్ర నిర్ణయం ఎలా పనిచేస్తుంది
[TypeSafe AI Jev త్వరిత ప్రారంభ మార్గదర్శి](https://docs.typesafe.ai/introduction/quickstart) ఒక రక నిర్దేశిత `state` మరియు రక నిర్దేశిత `questions` ప్రశ్నల సమితిని నమోదు చేస్తుంది: `noul` అవును/కాదు విలువ కోసం, `choice` పేరున్న ప్రత్యామ్నాయాల కోసం, `score` క్రమబద్ధ స్థాయిల కోసం. Boll స్క్రిప్ట్ ఆ పేర్లను ఉపయోగించి చిత్ర మార్గాలు లేదా base64 డేటా URLల శ్రేణి అయిన `attachments` ను జతచేస్తుంది. ఆ ఫీల్డ్ అభ్యర్థన ఆబ్జెక్ట్కు ఆయన చేర్చిన విస్తరణ; ఉదహరించిన Jev త్వరిత ప్రారంభం పాఠ్య స్థితిని వివరిస్తుంది కానీ దాన్ని Jev API ఇన్పుట్గా నమోదు చేయదు.
ప్రతి ప్రశ్నకు స్క్రిప్ట్ అక్షరాలతో గుర్తించిన ఎంపికలతో prompt నిర్మిస్తుంది, ఉదాహరణకు `[A] true` మరియు `[B] false` వంటి అక్షర ఎంపికలతో prompt నిర్మిస్తుంది. ఉత్తమ అక్షరంతో సమాధానం ఇవ్వమని మోడల్ను అడిగి, మొదటి అవుట్పుట్ టోకెన్ యొక్క `top_logprobs`ను చదువుతుంది. తిరిగి వచ్చిన లాగ్ సంభావ్యతలను ఘాతాంకం చేసి, జాబితాలోని అక్షరాల మధ్య బరువులను సాధారణీకరించి, ప్రశ్న రకానికి జతచేస్తుంది. `choice` అత్యధిక బరువు గల ఎంపిక, దాని పంపిణీని ఇస్తుంది. `noul` దానికి సంబంధించిన బరువును ఇస్తుంది `true`. `score` క్రమబద్ధ స్థాయిల బరువుతో కూడిన సగటును ఇస్తుంది. వదిలేసిన ఎంపిక టోకెన్లకు ఇంకా గణనీయమైన బరువు ఉండవచ్చంటే స్క్రిప్ట్ సమాధానాన్ని తిరస్కరిస్తుంది.
ప్రతి ప్రశ్నతో చిత్రం పంపబడుతుంది. అన్ని సమాధానాలను ఒక మోడల్ కాల్లో పొందకుండా ఉదాహరణ వేర్వేరు అభ్యర్థనలు పంపుతుంది. OpenAI మార్గం Responses APIని `input_image`, `top_logprobs` మరియు `message.output_text.logprobs`తో ఉపయోగిస్తుంది; స్థానిక llama.cpp మార్గం Chat Completionsను `image_url` కంటెంట్ అంశం, లాగ్ సంభావ్యతలతో ఉపయోగిస్తుంది. [OpenAI చిత్ర మార్గదర్శి](https://developers.openai.com/api/docs/guides/images-vision) base64 చిత్ర డేటா URLలను వివరిస్తుంది; దాని [Responses సూచన](https://developers.openai.com/api/reference/resources/responses/methods/create) లాగ్-సంభావ్యత అవుట్పుట్ను, ప్రతి టోకెన్ స్థానానికి గరిష్ఠంగా 20 ప్రత్యామ్నాయాలు తిరిగి రావచ్చని వివరిస్తుంది. [llama.cpp సర్వర్ డాక్యుమెంటేషన్](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) దాని చాట్ ఇంటర్ఫేస్లో చిత్ర URLలను వివరిస్తుంది. ఈ మూలాలు అభ్యర్థన నమూనాకు మద్దతిస్తాయి; రెండు ఎండ్పాయింట్లలోనూ ఉదాహరణను నడపలేదు.
## వెబ్క్యామ్ ఉదాహరణ ఏం కొలుస్తుంది
స్క్రిప్ట్ OpenCVతో ఫ్రేమ్ను పట్టుకుని JPEGగా ఎన్కోడ్ చేసి నాలుగు ప్రశ్నలు వేస్తుంది: వ్యక్తి లేదా మొక్క కనిపిస్తుందా, ప్రదేశం లోపలా బయటా, వెలుతురు ఎంత. ప్రివ్యూ కొనసాగుతుండగా నేపథ్య వర్కర్ ఒక్కోసారి ఒక ఫ్రేమ్ను అంచనా వేస్తుంది. కెమెరా అమరిక Linux V4L2ను ఉపయోగిస్తుంది కాబట్టి ప్రచురించిన ఫైల్ మార్పులు లేకుండా ఎక్కడైనా పనిచేసే వెబ్క్యామ్ అమరిక కాదు. వ్యాస పాఠ్యంలో ఒక్కో ఫ్రేమ్కు మూడు ప్రశ్నలని ఉంది, కానీ ప్రచురిత కోడ్లో నాలుగు ఉన్నాయి; ఈ లెక్కకు కోడ్ ఆధారం.
Boll సుమారు **సెకనుకు ఒక ఫ్రేమ్ను అంచనా వేసినట్లు** RTX 3090పై స్థానికంగా నడిపిన Gemma 4 12B QAT మోడల్తో, అలాగే సుమారు **సెకనుకు 0.2 ఫ్రేమ్లు** హోస్ట్ చేసిన GPT-6 Lunaతో వచ్చినట్లు చెబుతున్నారు. మళ్లీ మళ్లీ కనెక్షన్లు చేయడం హోస్ట్ ఫలితానికి కారణమై ఉండవచ్చని సూచిస్తున్నారు. హార్డ్వేర్, నెట్వర్క్, చిత్ర పరిమాణం, క్యాషింగ్, ఖచ్చితత్వం లేదా అభ్యర్థన సమయంపై నియంత్రిత పోలికను పోస్ట్ ఇవ్వదు. ఈ సంఖ్యలు ఈ రచయిత సెటప్, కోడ్ను వివరిస్తాయి; మోడళ్ల సాధారణ వేగ ర్యాంకింగ్ కాదు. [GPT-6 Luna చిత్ర ఇన్పుట్ను అంగీకరిస్తుందని OpenAI పేర్కొంటుంది](https://developers.openai.com/api/docs/models/gpt-6-luna), దాని [మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/guides/latest-model) ఉదాహరణలో ఉపయోగించిన `none` reasoning సెట్టింగ్ను Luna మద్దతిస్తుందని చెబుతుంది.
స్క్రిప్ట్ను మార్చే డెవలపర్ మొదట నిర్దిష్ట తనిఖీలు చేయాలి: మోడల్ చిత్ర ఇన్పుట్ను అంగీకరించి అవసరమైన మొదటి-టోకెన్ ప్రత్యామ్నాయాలను ఇస్తుందో నిర్ధారించండి; అన్ని ఎంపిక అక్షరాలు కనిపిస్తున్నాయా చూడండి; ఆపై ఉద్దేశించిన కెమెరా లేదా డేటాసెట్ నుంచి లేబుల్ చేసిన చిత్రాలపై తిరిగి వచ్చిన నిర్ణయాలను అంచనా వేయండి. సాధారణీకరించిన బరువులు జాబితాలోని అక్షర టోకెన్లతో పోల్చినవి. అవి ఒక్కటే దృశ్య తీర్పు సరైనదని కొలిచిన సంభావ్యతలు కావు. OpenAI [పాత logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)టోకెన్-సంభావ్యత భావనను వివరిస్తుంది; అయితే అది ఆర్కైవ్గా గుర్తించబడింది, API ఉదాహరణలు పాతబడివుండవచ్చు.
రక నిర్దేశిత ఫలితం తర్వాత అప్లికేషన్ కోడ్ ఏం చేయాలో కూడా ఈ ర్యాపర్ స్పష్టం చేస్తుంది. ఇచ్చిన చిత్రాన్ని రాతపూర్వక ప్రమాణంతో మోడల్ అంచనా వేస్తుంది. అప్లికేషన్ ఫ్రేమ్లను ఎంచుకుని, లేని స్కోర్లను నిర్వహించి, ఫలితం చర్యకు సరిపడా సురక్షితమో నిర్ణయిస్తుంది. Boll ఉదాహరణ పట్టికను ముద్రిస్తుంది; ఆటోమేటెడ్ చర్య లేదా కొలిచిన అమలును నివేదించదు.
## మూలాలు, మరింత చదవడానికి
- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” సెప్టెంబర్ 25, 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): అసలు Python ఉదాహరణ, వెబ్క్యామ్ పని విధానం, రచయిత తెలిపిన ఫ్రేమ్ వేగాలు. పాఠ్యంలో ఒక్కో ఫ్రేమ్కు మూడు ప్రశ్నలని ఉంది; కోడ్ నాలుగింటిని నిర్వచిస్తుంది. సమయాలు స్వతంత్ర లేదా నియంత్రిత బెంచ్మార్క్ కావు.
- [TypeSafe AI, Jev త్వరిత ప్రారంభం](https://docs.typesafe.ai/introduction/quickstart): పాఠ్య స్థితి, `noul`, `choice`మరియు `score`ప్రశ్న రకాలను నమోదు చేస్తుంది. రచయిత అనుకూల `attachments`ఫీల్డ్ను Jev API ఫీచర్గా నమోదు చేయదు.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): `input_image`, చిత్ర URLలు, విజన్ ఇన్పుట్ కోసం base64 డేటా URLలను వివరిస్తుంది. [Responses API సూచన](https://developers.openai.com/api/reference/resources/responses/methods/create)ను వివరిస్తుంది `message.output_text.logprobs`మరియు తిరిగి వచ్చే ప్రత్యామ్నాయాల పరిమితిని వివరిస్తుంది.
- [OpenAI, GPT-6 Luna మోడల్, మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/models/gpt-6-luna): చిత్ర ఇన్పుట్, మోడల్ `none`reasoning సెట్టింగ్ను నిర్ధారిస్తుంది; [మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/guides/latest-model)పారామీటర్ అనుకూలతను వివరిస్తుంది. ఈ పత్రాలు బ్లాగ్ రచయిత త్రూపుట్ను ధృవీకరించవు.
- [llama.cpp సర్వర్ డాక్యుమెంటేషన్](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): OpenAI-అనుకూల చాట్ ఎండ్పాయింట్, చిత్ర URL ఇన్పుట్ను వివరిస్తుంది. వాడుతున్న ఖచ్చితమైన సంస్కరణ, మోడల్తో బ్యాకెండ్ మద్దతు, తిరిగి వచ్చే టోకెన్ జాబితాను తనిఖీ చేయాలి.
- [OpenAI cookbook, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): టోకెన్ సంభావ్యతల నేపథ్య వివరణ. ఈ రెసిపీ ఆర్కైవ్లో ఉందని, కొన్ని మోడళ్లు లేదా APIలకు పాతదై ఉండవచ్చని OpenAI హెచ్చరిస్తుంది.
## Sources
- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — స్వతంత్ర అసలు Python కోడ్, రచయిత తెలిపిన వెబ్క్యామ్ పరిశీలనలు. చుట్టూ ఉన్న పాఠ్యంలో మూడు ప్రశ్నలని ఉన్నా కోడ్ నాలుగింటిని నిర్వచిస్తుంది; నియంత్రిత బెంచ్మార్క్ లేదా స్వతంత్ర ఖచ్చితత్వ అధ్యయనం లేదు.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — పాఠ్య స్థితి, ప్రశ్న రకాలు, అభ్యర్థన బాడీ ఉదాహరణను వివరిస్తుంది. బ్లాగ్ రచయిత తన Jev తరహా అభ్యర్థన ఆబ్జెక్ట్కు జోడింపులు చేర్చారు; ఈ త్వరిత ప్రారంభం ఆ ఫీల్డ్ను వివరించదు.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — చిత్ర ఇన్పుట్, base64 డేటా URLలను వివరిస్తుంది. అభ్యర్థన నమూనాకు మద్దతిస్తుంది; రచయిత గమనించిన త్రూపుట్కు కాదు.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — చిత్ర ఇన్పుట్లు, message.output_text.logprobs, ప్రతి టోకెన్ స్థానానికి గరిష్ఠంగా 20 top log probabilities (కొన్నిసార్లు అంతకంటే తక్కువ)ను వివరిస్తుంది.
- [OpenAI: GPT-6 Luna, మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/models/gpt-6-luna) — చిత్ర ఇన్పుట్, none reasoning effortను జాబితా చేస్తుంది; OpenAI మోడల్ మార్గదర్శి effort ఆధారంగా logprob పారామీటర్ పరిమితులను వివరిస్తుంది.
- [llama.cpp సర్వర్ README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI-అనుకూల చాట్ ఎండ్పాయింట్, image_url ఇన్పుట్ను వివరిస్తుంది. ఖచ్చితమైన బ్యాకెండ్/మోడల్ సంస్కరణ ఇక్కడ స్వతంత్రంగా అమలు చేసి పరీక్షించలేదు.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — టోకెన్ సంభావ్యతల నేపథ్య వివరణ. ప్రస్తుత మోడళ్లు లేదా APIలకు ఈ Cookbook ఉదాహరణ పాతబడివుండవచ్చని OpenAI ఆర్కైవ్గా గుర్తించింది.
BIG CHANGE వార్తాపత్రిక
పెద్ద దృశ్యం. మీ వేగంతో.
AI, రోబోటిక్స్ తాజా కథనాలు, గమనించదగిన మార్పులు, ఆచరణలో పెట్టగల ఆలోచనలు. రోజువారీ బ్రీఫింగ్, వారపు సంకలనం లేదా నెలవారీ దృక్కోణం ఎంచుకోండి.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
మీ గోప్యత, మీ ఎంపిక.
అవసరమైన నిల్వ సైట్ భద్రతకు తోడ్పడి, మీ ఎంపికలను గుర్తుంచుకుంటుంది. మీరు అనుమతించే వరకు ఐచ్ఛిక Google Analytics ఆఫ్లోనే ఉంటుంది. అవసరమైన స్టోరేజ్తోనే ప్రతి కథనాన్ని చదవవచ్చు. గోప్యత వివరాలు