AI-translated from English; not yet reviewed by a fluent editor.
# Jev जैसी विज़न wrapper छवि से जुड़े सवालों को तयशुदा विकल्पों में बदलती है
> एक स्वतंत्र Python उदाहरण विज़न मॉडल की टोकन संभावनाओं का उपयोग करके छवियों से तयशुदा निर्णय देता है। वेबकैम की बताई गई गति लेखक के अपने परीक्षण पर आधारित है; सटीकता की जाँच नहीं की गई।
By BIG CHANGE Editorial
Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

AI-generated conceptual illustration by BIG CHANGE.
एक [डेवलपर Allan Riordan Boll द्वारा 25 सितंबर को प्रकाशित Python उदाहरण](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) Jev-शैली के निर्णय अनुरोध में छवियाँ जोड़ता है। यह हर वेबकैम फ़्रेम को छोटे प्रश्नों के साथ विज़न मॉडल को भेजता है, फिर मॉडल के अगले टोकन की संभावनाओं को हाँ/नहीं मान, विकल्प या स्कोर में बदलता है। यह उदाहरण एक स्वतंत्र wrapper है, Jev का विज़न फ़ीचर या Jev मॉडल का परीक्षण नहीं।
डेवलपर्स के लिए इसका उपयोगी पहलू इस तकनीक की सीमा है। विज़न मॉडल विवरण लिखे बिना किसी सीमित प्रश्न का जवाब दे सकता है, लेकिन विकल्पों की लौटाई गई संभावनाएँ prompt, उपलब्ध टोकन विकल्पों और मॉडल पर निर्भर करती हैं। यह पोस्ट देखने-परखने लायक काम करता हुआ तरीका देती है, सटीकता का अध्ययन नहीं।
## बड़ा बदलाव
- **क्या बदला:** एक डेवलपर ने सामान्य विज़न मॉडल से छवियों के बारे में सवाल पूछने के लिए Jev से जुड़ा छोटा-निर्णय प्रारूप अपनाया है। हर अनुरोध के साथ छवि भेजी जाती है, और एक अक्षर का जवाब दृश्य सवाल को ऐसे मान में बदल देता है जिसे सॉफ़्टवेयर इस्तेमाल कर सकता है।
- **यह क्यों मायने रखता है:** डेवलपर पाठ में दृश्य मानदंड बदल सकते हैं और हर सवाल के लिए अलग छवि-वर्गीकारक बनाए बिना तयशुदा नतीजा पा सकते हैं। यह उदाहरण दिखाई देने वाले लोगों, पौधों, दृश्य के अंदर या बाहर होने और रोशनी का स्तर जाँचता है; इससे यह साबित नहीं होता कि ये निर्णय दूसरे कैमरों या दृश्यों पर भी उतनी ही विश्वसनीयता से लागू होंगे।
- **अब क्या देखना है:** व्यावहारिक सवाल यह है कि चुना हुआ मॉडल और endpoint काम के लिए ज़रूरी वैकल्पिक टोकन के स्कोर कितनी निरंतरता से लौटाते हैं। वेबकैम के नतीजे के आधार पर कोई कार्रवाई करने से पहले प्रतिनिधि छवियों पर फ़्रेम की गति और निर्णय की गुणवत्ता दोनों मापनी चाहिए।
## छवि पर निर्णय कैसे काम करता है
[TypeSafe AI की Jev त्वरित शुरुआत](https://docs.typesafe.ai/introduction/quickstart) में `state` और typed `questions` के सेट का विवरण है: `noul` हाँ/नहीं मान के लिए, `choice` नाम वाले विकल्पों के लिए और `score` क्रमबद्ध स्तरों के लिए। Boll की स्क्रिप्ट इन्हीं नामों का इस्तेमाल करती है और अनुरोध में छवि पथों या base64 data URL का `attachments` ऐरे जोड़ती है। यह फ़ील्ड उनके अनुरोध ऑब्जेक्ट में खुद जोड़ा गया विस्तार है; उद्धृत Jev त्वरित शुरुआत में text state का विवरण है, इस फ़ील्ड को Jev API इनपुट नहीं बताया गया।
हर प्रश्न के लिए स्क्रिप्ट अक्षरों वाले विकल्पों के साथ prompt बनाती है, जैसे `[A] true` और `[B] false`। यह मॉडल से सबसे उपयुक्त अक्षर में जवाब माँगती है और पहले आउटपुट टोकन के `top_logprobs` पढ़ती है। फिर यह लौटाई गई log probabilities का घातांक निकालती है, सूचीबद्ध अक्षरों के भारों को सामान्यीकृत करती है और उन्हें सवाल के प्रकार से जोड़ती है। `choice` विकल्प के लिए सबसे अधिक भार वाला उत्तर और उसका वितरण लौटाता है। `noul` हाँ/नहीं मान के लिए `true` का भार देता है। `score` क्रमबद्ध स्तरों का भारित औसत देता है। अगर छोड़े गए विकल्प टोकनों का भार भी महत्वपूर्ण हो सकता है तो स्क्रिप्ट जवाब अस्वीकार कर देती है।
हर प्रश्न के साथ छवि भेजी जाती है। उदाहरण सभी जवाब एक ही model call में पाने के बजाय अलग-अलग अनुरोध भेजता है। OpenAI वाला रास्ता Responses API में `input_image`, `top_logprobs` और `message.output_text.logprobs` का उपयोग करता है; स्थानीय llama.cpp वाला रास्ता Chat Completions में `image_url` content item और log probabilities का उपयोग करता है। [OpenAI की छवि मार्गदर्शिका](https://developers.openai.com/api/docs/guides/images-vision) base64 image data URL का विवरण देती है, और उसकी [Responses API संदर्भ](https://developers.openai.com/api/reference/resources/responses/methods/create) log-probability आउटपुट तथा हर टोकन स्थान पर अधिकतम 20 लौटाए गए विकल्पों की सीमा बताता है। [llama.cpp सर्वर दस्तावेज़](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) chat interface में image URL का विवरण देते हैं। ये स्रोत अनुरोध का तरीका स्पष्ट करते हैं; हमने उदाहरण को किसी भी endpoint पर चलाकर नहीं देखा।
## वेबकैम उदाहरण क्या मापता है
स्क्रिप्ट OpenCV से फ़्रेम लेती है, उसे JPEG में बदलती है और चार सवाल पूछती है: क्या कोई व्यक्ति या पौधा दिख रहा है, दृश्य घर के अंदर है या बाहर, और रोशनी कितनी है। बैकग्राउंड worker एक बार में एक फ़्रेम का मूल्यांकन करता है, जबकि पूर्वावलोकन चलता रहता है। कैमरे की व्यवस्था Linux V4L2 पर आधारित है, इसलिए बदलाव किए बिना प्रकाशित फ़ाइल को अलग-अलग प्रणालियों पर चलने वाली वेबकैम व्यवस्था नहीं माना जा सकता। लेख में प्रति फ़्रेम तीन सवाल बताए गए हैं, लेकिन प्रकाशित कोड में चार हैं; यहाँ गिनती कोड पर आधारित है।
Boll के अनुसार, **स्थानीय रूप से चलाए गए Gemma 4 12B QAT मॉडल और RTX 3090 पर हर सेकंड लगभग एक फ़्रेम का मूल्यांकन हुआ**; hosted GPT-6 Luna के साथ गति लगभग **0.2 फ़्रेम प्रति सेकंड** थी। उनका अनुमान है कि बार-बार connection बनाने से hosted नतीजे पर असर पड़ा हो सकता है। पोस्ट में हार्डवेयर, नेटवर्क, छवि आकार, caching, सटीकता या अनुरोध के समय की नियंत्रित तुलना नहीं है। ये आँकड़े लेखक की अपनी व्यवस्था और कोड का वर्णन करते हैं, मॉडलों की सामान्य गति-रैंकिंग नहीं। [OpenAI के अनुसार GPT-6 Luna छवि इनपुट ले सकता है](https://developers.openai.com/api/docs/models/gpt-6-luna), और उसकी [मॉडल मार्गदर्शिका](https://developers.openai.com/api/docs/guides/latest-model) कहती है कि Luna उदाहरण में इस्तेमाल की गई `none` reasoning setting का समर्थन करता है।
स्क्रिप्ट को अपनाने वाले डेवलपर के लिए शुरुआती जाँचें स्पष्ट हैं: पुष्टि करें कि मॉडल छवि इनपुट स्वीकार करता है और पहले टोकन के ज़रूरी विकल्पों के स्कोर देता है; जाँचें कि विकल्पों के सभी अक्षर लौटे हैं; फिर लक्षित कैमरे या डेटासेट की लेबल लगी छवियों पर जवाबों का मूल्यांकन करें। सामान्यीकृत भार सूचीबद्ध अक्षर टोकनों के आपसी अनुपात बताते हैं। अपने-आप में वे यह नहीं मापते कि दृश्य पर दिया गया निर्णय सही है या नहीं। OpenAI की [पुरानी logprobs cookbook](https://developers.openai.com/cookbook/examples/using_logprobs) टोकन-संभावना का विचार समझाती है, लेकिन उसे संग्रहित और पुराना चिह्नित किया गया है; उसमें API के कुछ उदाहरण अब पुराने हो सकते हैं।
यह wrapper यह भी दिखाती है कि तयशुदा नतीजे के बाद कौन-से फैसले application code को लेने होते हैं। मॉडल दी गई छवि को लिखे हुए मानदंड के अनुसार परखता है। application तय करता है कि कौन-से फ़्रेम भेजने हैं, छूटे हुए स्कोर कैसे सँभालने हैं और किसी नतीजे पर कार्रवाई करना सुरक्षित है या नहीं। Boll का उदाहरण तालिका दिखाता है; यह स्वचालित कार्रवाई या किसी वास्तविक तैनाती के मापे गए नतीजे नहीं बताता।
## स्रोत और आगे पढ़ें
- [Allan Riordan Boll, “विज़न मॉडल समेत LLM के लिए Jev जैसी wrapper”, 25 सितंबर 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): मूल Python उदाहरण, वेबकैम कार्यप्रवाह और लेखक द्वारा बताए गए फ़्रेम-दर। लेख में प्रति फ़्रेम तीन सवाल कहे गए हैं, जबकि कोड में चार हैं। इसका समय-मापन स्वतंत्र या नियंत्रित benchmark नहीं है।
- [TypeSafe AI, Jev त्वरित शुरुआत](https://docs.typesafe.ai/introduction/quickstart): text state और `noul`, `choice` तथा `score` सवालों के प्रकारों का विवरण देती है। इसमें लेखक का custom `attachments` फ़ील्ड Jev API की सुविधा के रूप में दर्ज नहीं है।
- [OpenAI, छवियाँ और विज़न](https://developers.openai.com/api/docs/guides/images-vision): विज़न इनपुट के लिए `input_image`, image URL और base64 data URL का विवरण। [Responses API संदर्भ](https://developers.openai.com/api/reference/resources/responses/methods/create) में `message.output_text.logprobs` और लौटाए जाने वाले विकल्पों की सीमा का विवरण है।
- [OpenAI, GPT-6 Luna मॉडल और मॉडल मार्गदर्शिका](https://developers.openai.com/api/docs/models/gpt-6-luna): छवि इनपुट और मॉडल की `none` reasoning setting की पुष्टि करती है; [मॉडल मार्गदर्शिका](https://developers.openai.com/api/docs/guides/latest-model) पैरामीटरों की संगतता विस्तार से बताती है। ये दस्तावेज़ ब्लॉग लेखक की गति के आँकड़ों की पुष्टि नहीं करते।
- [llama.cpp सर्वर दस्तावेज़](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): इसके OpenAI-संगत chat endpoint और image URL इनपुट का विवरण देते हैं। इस्तेमाल किए गए सटीक संस्करण और मॉडल में backend समर्थन तथा लौटाए गए टोकन की सूची की जाँच अब भी ज़रूरी है।
- [OpenAI cookbook, logprobs का उपयोग](https://developers.openai.com/cookbook/examples/using_logprobs): टोकन-संभावनाओं की पृष्ठभूमि समझाता है। OpenAI ने इस नुस्खे को संग्रहित चिह्नित किया है और चेताया है कि कुछ मॉडल या API उदाहरण पुराने हो सकते हैं।
## Sources
- [Allan Riordan Boll: विज़न मॉडल समेत LLM के लिए Jev जैसी wrapper](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — मूल स्वतंत्र Python कोड और लेखक के वेबकैम अवलोकन। आसपास के लेख में तीन सवाल बताए गए हैं, जबकि कोड में चार हैं; कोई नियंत्रित benchmark या स्वतंत्र सटीकता-अध्ययन नहीं है।
- [TypeSafe AI: Jev त्वरित शुरुआत](https://docs.typesafe.ai/introduction/quickstart) — text state, सवालों के प्रकार और अनुरोध के उदाहरण का विवरण। ब्लॉग लेखक अपने Jev-जैसे अनुरोध ऑब्जेक्ट में संलग्नक जोड़ता है; इस त्वरित शुरुआत में वह फ़ील्ड दर्ज नहीं है।
- [OpenAI: छवियाँ और विज़न](https://developers.openai.com/api/docs/guides/images-vision) — छवि इनपुट और base64 data URL का विवरण। यह अनुरोध का तरीका बताता है, लेखक की देखी गई गति नहीं।
- [OpenAI: model response बनाना](https://developers.openai.com/api/reference/resources/responses/methods/create) — image input, message.output_text.logprobs और हर टोकन स्थान पर अधिकतम 20 top log probabilities—कभी-कभी इससे कम—का विवरण।
- [OpenAI: GPT-6 Luna और मॉडल मार्गदर्शिका](https://developers.openai.com/api/docs/models/gpt-6-luna) — छवि इनपुट और none reasoning effort सूचीबद्ध करता है; OpenAI की मॉडल मार्गदर्शिका बताती है कि अलग-अलग effort पर logprob पैरामीटरों की क्या सीमाएँ हैं।
- [llama.cpp सर्वर README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI-संगत chat endpoint और image_url इनपुट का विवरण। यहाँ backend/model के सटीक संस्करण का स्वतंत्र परीक्षण नहीं किया गया।
- [OpenAI Cookbook: logprobs का उपयोग](https://developers.openai.com/cookbook/examples/using_logprobs) — टोकन-संभावनाओं की पृष्ठभूमि। OpenAI ने cookbook के इस उदाहरण को संग्रहित और मौजूदा मॉडलों या API के लिए संभवतः पुराना चिह्नित किया है।
BIG CHANGE न्यूज़लेटर
बड़ी तस्वीर। आपकी गति से।
AI और रोबोटिक्स पर ताज़ा लेख, ध्यान देने योग्य बदलाव और उपयोगी विचार। दैनिक ब्रीफ़िंग, साप्ताहिक सारांश या मासिक परिप्रेक्ष्य चुनें।
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
आपकी गोपनीयता, आपकी पसंद।
ज़रूरी स्टोरेज साइट की सुरक्षा में मदद करता है और आपकी पसंद याद रखता है। आपकी अनुमति मिलने तक वैकल्पिक Google Analytics बंद रहता है। आप हर लेख केवल आवश्यक स्टोरेज के साथ पढ़ सकते हैं। गोपनीयता का विवरण