AI-translated from English; not yet reviewed by a fluent editor.

# Jev తరహా విజన్ ర్యాపర్ చిత్ర ప్రశ్నలను రక నిర్దేశిత ఎంపికలుగా మారుస్తుంది

> ఒక స్వతంత్ర Python ఉదాహరణ విజన్ మోడల్ టోకెన్ సంభావ్యతలను ఉపయోగించి చిత్రాల నుంచి రక నిర్దేశిత నిర్ణయాలను అందిస్తుంది. వెబ్‌క్యామ్ వేగాలు రచయిత తెలిపినవి; ఖచ్చితత్వం పరీక్షించలేదు.

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

ఒక [డెవలపర్ Allan Riordan Boll సెప్టెంబర్ 25న ప్రచురించిన Python ఉదాహరణ ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)Jev శైలి నిర్ణయ అభ్యర్థనకు చిత్రాలను జతచేస్తుంది. ఇది ప్రతి వెబ్‌క్యామ్ ఫ్రేమ్‌ను చిన్న ప్రశ్నలతో పాటు విజన్ మోడల్‌కు పంపి, మోడల్ తదుపరి టోకెన్ సంభావ్యతలను అవును/కాదు విలువ, ఎంపిక లేదా స్కోరుగా మారుస్తుంది. ఇది స్వతంత్ర ర్యాపర్; Jev విజన్ ఫీచర్ కాదు, Jev మోడల్ పరీక్షా కాదు.

డెవలపర్లకు ఈ పద్ధతి పరిమితి తెలుసుకోవడం ఉపయోగకరం. విజన్ మోడల్ వివరణ రాయకుండానే నిర్దిష్ట ప్రశ్నకు సమాధానం చెప్పగలదు; అయితే తిరిగి వచ్చే ఎంపికల సంభావ్యతలు prompt, అందుబాటులోని టోకెన్ ప్రత్యామ్నాయాలు, మోడల్‌పై ఆధారపడతాయి. ఈ పోస్ట్ పరిశీలించదగిన పనిచేసే నమూనాను చూపుతుంది; ఖచ్చితత్వ అధ్యయనం కాదు.

## పెద్ద మార్పు

- **ఏమి మారింది:**ఒక డెవలపర్ Jevతో అనుబంధమైన చిన్న నిర్ణయ ఫార్మాట్‌ను సాధారణ విజన్ మోడళ్లతో చిత్రాలకు అన్వయించారు. ప్రతి అభ్యర్థనకు చిత్రం జతచేస్తారు; ఒక అక్షర సమాధానం దృశ్య ప్రశ్నను సాఫ్ట్‌వేర్ నిర్వహించగల విలువగా మారుస్తుంది.
- **ఇది ఎందుకు ముఖ్యం:**ప్రతి ప్రశ్నకు ప్రత్యేక చిత్ర వర్గీకరణ నమూనా నిర్మించకుండానే డెవలపర్లు పాఠ్యంలో దృశ్య ప్రమాణాన్ని మార్చి రక నిర్దేశిత ఫలితాన్ని పొందవచ్చు. ఈ ఉదాహరణ కనిపించే వ్యక్తులు, మొక్కలు, ప్రదేశం లోపలా బయటా అనే విషయం, వెలుతురును చూస్తుంది; ఇతర కెమెరాలు లేదా దృశ్యాలకు ఆ తీర్పులు ఎంత నమ్మకంగా వర్తిస్తాయో నిరూపించదు.
- **గమనించాల్సింది:**ఎంచుకున్న మోడల్, ఎండ్‌పాయింట్ పని కోసం అవసరమైన ప్రత్యామ్నాయ-టోకెన్ స్కోర్లను తగినంత స్థిరంగా ఇస్తాయా అనేదే ఆచరణాత్మక నిర్ణయం. వెబ్‌క్యామ్ ఫలితం చర్యను ప్రేరేపించే ముందు ప్రతినిధి చిత్రాలతో ఫ్రేమ్ త్రూపుట్, నిర్ణయ నాణ్యతను కలిపి కొలవాలి.

## చిత్ర నిర్ణయం ఎలా పనిచేస్తుంది

[TypeSafe AI Jev త్వరిత ప్రారంభ మార్గదర్శి](https://docs.typesafe.ai/introduction/quickstart) ఒక రక నిర్దేశిత `state` మరియు రక నిర్దేశిత `questions` ప్రశ్నల సమితిని నమోదు చేస్తుంది: `noul` అవును/కాదు విలువ కోసం, `choice` పేరున్న ప్రత్యామ్నాయాల కోసం, `score` క్రమబద్ధ స్థాయిల కోసం. Boll స్క్రిప్ట్ ఆ పేర్లను ఉపయోగించి చిత్ర మార్గాలు లేదా base64 డేటా URLల శ్రేణి అయిన `attachments` ను జతచేస్తుంది. ఆ ఫీల్డ్ అభ్యర్థన ఆబ్జెక్ట్‌కు ఆయన చేర్చిన విస్తరణ; ఉదహరించిన Jev త్వరిత ప్రారంభం పాఠ్య స్థితిని వివరిస్తుంది కానీ దాన్ని Jev API ఇన్‌పుట్‌గా నమోదు చేయదు.

ప్రతి ప్రశ్నకు స్క్రిప్ట్ అక్షరాలతో గుర్తించిన ఎంపికలతో prompt నిర్మిస్తుంది, ఉదాహరణకు `[A] true` మరియు `[B] false` వంటి అక్షర ఎంపికలతో prompt నిర్మిస్తుంది. ఉత్తమ అక్షరంతో సమాధానం ఇవ్వమని మోడల్‌ను అడిగి, మొదటి అవుట్‌పుట్ టోకెన్ యొక్క `top_logprobs`ను చదువుతుంది. తిరిగి వచ్చిన లాగ్ సంభావ్యతలను ఘాతాంకం చేసి, జాబితాలోని అక్షరాల మధ్య బరువులను సాధారణీకరించి, ప్రశ్న రకానికి జతచేస్తుంది. `choice` అత్యధిక బరువు గల ఎంపిక, దాని పంపిణీని ఇస్తుంది. `noul` దానికి సంబంధించిన బరువును ఇస్తుంది `true`. `score` క్రమబద్ధ స్థాయిల బరువుతో కూడిన సగటును ఇస్తుంది. వదిలేసిన ఎంపిక టోకెన్లకు ఇంకా గణనీయమైన బరువు ఉండవచ్చంటే స్క్రిప్ట్ సమాధానాన్ని తిరస్కరిస్తుంది.

ప్రతి ప్రశ్నతో చిత్రం పంపబడుతుంది. అన్ని సమాధానాలను ఒక మోడల్ కాల్‌లో పొందకుండా ఉదాహరణ వేర్వేరు అభ్యర్థనలు పంపుతుంది. OpenAI మార్గం Responses APIని `input_image`, `top_logprobs` మరియు `message.output_text.logprobs`తో ఉపయోగిస్తుంది; స్థానిక llama.cpp మార్గం Chat Completionsను `image_url` కంటెంట్ అంశం, లాగ్ సంభావ్యతలతో ఉపయోగిస్తుంది. [OpenAI చిత్ర మార్గదర్శి](https://developers.openai.com/api/docs/guides/images-vision) base64 చిత్ర డేటா URLలను వివరిస్తుంది; దాని [Responses సూచన](https://developers.openai.com/api/reference/resources/responses/methods/create) లాగ్-సంభావ్యత అవుట్‌పుట్‌ను, ప్రతి టోకెన్ స్థానానికి గరిష్ఠంగా 20 ప్రత్యామ్నాయాలు తిరిగి రావచ్చని వివరిస్తుంది. [llama.cpp సర్వర్ డాక్యుమెంటేషన్](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) దాని చాట్ ఇంటర్‌ఫేస్‌లో చిత్ర URLలను వివరిస్తుంది. ఈ మూలాలు అభ్యర్థన నమూనాకు మద్దతిస్తాయి; రెండు ఎండ్‌పాయింట్లలోనూ ఉదాహరణను నడపలేదు.

## వెబ్‌క్యామ్ ఉదాహరణ ఏం కొలుస్తుంది

స్క్రిప్ట్ OpenCVతో ఫ్రేమ్‌ను పట్టుకుని JPEGగా ఎన్‌కోడ్ చేసి నాలుగు ప్రశ్నలు వేస్తుంది: వ్యక్తి లేదా మొక్క కనిపిస్తుందా, ప్రదేశం లోపలా బయటా, వెలుతురు ఎంత. ప్రివ్యూ కొనసాగుతుండగా నేపథ్య వర్కర్ ఒక్కోసారి ఒక ఫ్రేమ్‌ను అంచనా వేస్తుంది. కెమెరా అమరిక Linux V4L2ను ఉపయోగిస్తుంది కాబట్టి ప్రచురించిన ఫైల్ మార్పులు లేకుండా ఎక్కడైనా పనిచేసే వెబ్‌క్యామ్ అమరిక కాదు. వ్యాస పాఠ్యంలో ఒక్కో ఫ్రేమ్‌కు మూడు ప్రశ్నలని ఉంది, కానీ ప్రచురిత కోడ్‌లో నాలుగు ఉన్నాయి; ఈ లెక్కకు కోడ్ ఆధారం.

Boll సుమారు **సెకనుకు ఒక ఫ్రేమ్‌ను అంచనా వేసినట్లు** RTX 3090పై స్థానికంగా నడిపిన Gemma 4 12B QAT మోడల్‌తో, అలాగే సుమారు  **సెకనుకు 0.2 ఫ్రేమ్‌లు** హోస్ట్ చేసిన GPT-6 Lunaతో వచ్చినట్లు చెబుతున్నారు. మళ్లీ మళ్లీ కనెక్షన్లు చేయడం హోస్ట్ ఫలితానికి కారణమై ఉండవచ్చని సూచిస్తున్నారు. హార్డ్‌వేర్, నెట్‌వర్క్, చిత్ర పరిమాణం, క్యాషింగ్, ఖచ్చితత్వం లేదా అభ్యర్థన సమయంపై నియంత్రిత పోలికను పోస్ట్ ఇవ్వదు. ఈ సంఖ్యలు ఈ రచయిత సెటప్, కోడ్‌ను వివరిస్తాయి; మోడళ్ల సాధారణ వేగ ర్యాంకింగ్ కాదు. [GPT-6 Luna చిత్ర ఇన్‌పుట్‌ను అంగీకరిస్తుందని OpenAI పేర్కొంటుంది](https://developers.openai.com/api/docs/models/gpt-6-luna), దాని [మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/guides/latest-model) ఉదాహరణలో ఉపయోగించిన `none` reasoning సెట్టింగ్‌ను Luna మద్దతిస్తుందని చెబుతుంది.

స్క్రిప్ట్‌ను మార్చే డెవలపర్ మొదట నిర్దిష్ట తనిఖీలు చేయాలి: మోడల్ చిత్ర ఇన్‌పుట్‌ను అంగీకరించి అవసరమైన మొదటి-టోకెన్ ప్రత్యామ్నాయాలను ఇస్తుందో నిర్ధారించండి; అన్ని ఎంపిక అక్షరాలు కనిపిస్తున్నాయా చూడండి; ఆపై ఉద్దేశించిన కెమెరా లేదా డేటాసెట్ నుంచి లేబుల్ చేసిన చిత్రాలపై తిరిగి వచ్చిన నిర్ణయాలను అంచనా వేయండి. సాధారణీకరించిన బరువులు జాబితాలోని అక్షర టోకెన్లతో పోల్చినవి. అవి ఒక్కటే దృశ్య తీర్పు సరైనదని కొలిచిన సంభావ్యతలు కావు. OpenAI [పాత logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)టోకెన్-సంభావ్యత భావనను వివరిస్తుంది; అయితే అది ఆర్కైవ్‌గా గుర్తించబడింది, API ఉదాహరణలు పాతబడివుండవచ్చు.

రక నిర్దేశిత ఫలితం తర్వాత అప్లికేషన్ కోడ్ ఏం చేయాలో కూడా ఈ ర్యాపర్ స్పష్టం చేస్తుంది. ఇచ్చిన చిత్రాన్ని రాతపూర్వక ప్రమాణంతో మోడల్ అంచనా వేస్తుంది. అప్లికేషన్ ఫ్రేమ్‌లను ఎంచుకుని, లేని స్కోర్లను నిర్వహించి, ఫలితం చర్యకు సరిపడా సురక్షితమో నిర్ణయిస్తుంది. Boll ఉదాహరణ పట్టికను ముద్రిస్తుంది; ఆటోమేటెడ్ చర్య లేదా కొలిచిన అమలును నివేదించదు.

## మూలాలు, మరింత చదవడానికి

- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” సెప్టెంబర్ 25, 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): అసలు Python ఉదాహరణ, వెబ్‌క్యామ్ పని విధానం, రచయిత తెలిపిన ఫ్రేమ్ వేగాలు. పాఠ్యంలో ఒక్కో ఫ్రేమ్‌కు మూడు ప్రశ్నలని ఉంది; కోడ్ నాలుగింటిని నిర్వచిస్తుంది. సమయాలు స్వతంత్ర లేదా నియంత్రిత బెంచ్‌మార్క్ కావు.
- [TypeSafe AI, Jev త్వరిత ప్రారంభం](https://docs.typesafe.ai/introduction/quickstart): పాఠ్య స్థితి, `noul`, `choice`మరియు `score`ప్రశ్న రకాలను నమోదు చేస్తుంది. రచయిత అనుకూల `attachments`ఫీల్డ్‌ను Jev API ఫీచర్‌గా నమోదు చేయదు.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): `input_image`, చిత్ర URLలు, విజన్ ఇన్‌పుట్ కోసం base64 డేటా URLలను వివరిస్తుంది. [Responses API సూచన](https://developers.openai.com/api/reference/resources/responses/methods/create)ను వివరిస్తుంది `message.output_text.logprobs`మరియు తిరిగి వచ్చే ప్రత్యామ్నాయాల పరిమితిని వివరిస్తుంది.
- [OpenAI, GPT-6 Luna మోడల్, మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/models/gpt-6-luna): చిత్ర ఇన్‌పుట్, మోడల్ `none`reasoning సెట్టింగ్‌ను నిర్ధారిస్తుంది; [మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/guides/latest-model)పారామీటర్ అనుకూలతను వివరిస్తుంది. ఈ పత్రాలు బ్లాగ్ రచయిత త్రూపుట్‌ను ధృవీకరించవు.
- [llama.cpp సర్వర్ డాక్యుమెంటేషన్](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): OpenAI-అనుకూల చాట్ ఎండ్‌పాయింట్, చిత్ర URL ఇన్‌పుట్‌ను వివరిస్తుంది. వాడుతున్న ఖచ్చితమైన సంస్కరణ, మోడల్‌తో బ్యాకెండ్ మద్దతు, తిరిగి వచ్చే టోకెన్ జాబితాను తనిఖీ చేయాలి.
- [OpenAI cookbook, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): టోకెన్ సంభావ్యతల నేపథ్య వివరణ. ఈ రెసిపీ ఆర్కైవ్‌లో ఉందని, కొన్ని మోడళ్లు లేదా APIలకు పాతదై ఉండవచ్చని OpenAI హెచ్చరిస్తుంది.

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — స్వతంత్ర అసలు Python కోడ్, రచయిత తెలిపిన వెబ్‌క్యామ్ పరిశీలనలు. చుట్టూ ఉన్న పాఠ్యంలో మూడు ప్రశ్నలని ఉన్నా కోడ్ నాలుగింటిని నిర్వచిస్తుంది; నియంత్రిత బెంచ్‌మార్క్ లేదా స్వతంత్ర ఖచ్చితత్వ అధ్యయనం లేదు.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — పాఠ్య స్థితి, ప్రశ్న రకాలు, అభ్యర్థన బాడీ ఉదాహరణను వివరిస్తుంది. బ్లాగ్ రచయిత తన Jev తరహా అభ్యర్థన ఆబ్జెక్ట్‌కు జోడింపులు చేర్చారు; ఈ త్వరిత ప్రారంభం ఆ ఫీల్డ్‌ను వివరించదు.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — చిత్ర ఇన్‌పుట్, base64 డేటా URLలను వివరిస్తుంది. అభ్యర్థన నమూనాకు మద్దతిస్తుంది; రచయిత గమనించిన త్రూపుట్‌కు కాదు.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — చిత్ర ఇన్‌పుట్‌లు, message.output_text.logprobs, ప్రతి టోకెన్ స్థానానికి గరిష్ఠంగా 20 top log probabilities (కొన్నిసార్లు అంతకంటే తక్కువ)ను వివరిస్తుంది.
- [OpenAI: GPT-6 Luna, మోడల్ మార్గదర్శి](https://developers.openai.com/api/docs/models/gpt-6-luna) — చిత్ర ఇన్‌పుట్, none reasoning effortను జాబితా చేస్తుంది; OpenAI మోడల్ మార్గదర్శి effort ఆధారంగా logprob పారామీటర్ పరిమితులను వివరిస్తుంది.
- [llama.cpp సర్వర్ README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI-అనుకూల చాట్ ఎండ్‌పాయింట్, image_url ఇన్‌పుట్‌ను వివరిస్తుంది. ఖచ్చితమైన బ్యాకెండ్/మోడల్ సంస్కరణ ఇక్కడ స్వతంత్రంగా అమలు చేసి పరీక్షించలేదు.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — టోకెన్ సంభావ్యతల నేపథ్య వివరణ. ప్రస్తుత మోడళ్లు లేదా APIలకు ఈ Cookbook ఉదాహరణ పాతబడివుండవచ్చని OpenAI ఆర్కైవ్‌గా గుర్తించింది.
