एक डेवलपर Allan Riordan Boll द्वारा 25 सितंबर को प्रकाशित Python उदाहरण Jev-शैली के निर्णय अनुरोध में छवियाँ जोड़ता है। यह हर वेबकैम फ़्रेम को छोटे प्रश्नों के साथ विज़न मॉडल को भेजता है, फिर मॉडल के अगले टोकन की संभावनाओं को हाँ/नहीं मान, विकल्प या स्कोर में बदलता है। यह उदाहरण एक स्वतंत्र wrapper है, Jev का विज़न फ़ीचर या Jev मॉडल का परीक्षण नहीं।
डेवलपर्स के लिए इसका उपयोगी पहलू इस तकनीक की सीमा है। विज़न मॉडल विवरण लिखे बिना किसी सीमित प्रश्न का जवाब दे सकता है, लेकिन विकल्पों की लौटाई गई संभावनाएँ prompt, उपलब्ध टोकन विकल्पों और मॉडल पर निर्भर करती हैं। यह पोस्ट देखने-परखने लायक काम करता हुआ तरीका देती है, सटीकता का अध्ययन नहीं।
बड़ा बदलाव
- क्या बदला: एक डेवलपर ने सामान्य विज़न मॉडल से छवियों के बारे में सवाल पूछने के लिए Jev से जुड़ा छोटा-निर्णय प्रारूप अपनाया है। हर अनुरोध के साथ छवि भेजी जाती है, और एक अक्षर का जवाब दृश्य सवाल को ऐसे मान में बदल देता है जिसे सॉफ़्टवेयर इस्तेमाल कर सकता है।
- यह क्यों मायने रखता है: डेवलपर पाठ में दृश्य मानदंड बदल सकते हैं और हर सवाल के लिए अलग छवि-वर्गीकारक बनाए बिना तयशुदा नतीजा पा सकते हैं। यह उदाहरण दिखाई देने वाले लोगों, पौधों, दृश्य के अंदर या बाहर होने और रोशनी का स्तर जाँचता है; इससे यह साबित नहीं होता कि ये निर्णय दूसरे कैमरों या दृश्यों पर भी उतनी ही विश्वसनीयता से लागू होंगे।
- अब क्या देखना है: व्यावहारिक सवाल यह है कि चुना हुआ मॉडल और endpoint काम के लिए ज़रूरी वैकल्पिक टोकन के स्कोर कितनी निरंतरता से लौटाते हैं। वेबकैम के नतीजे के आधार पर कोई कार्रवाई करने से पहले प्रतिनिधि छवियों पर फ़्रेम की गति और निर्णय की गुणवत्ता दोनों मापनी चाहिए।
छवि पर निर्णय कैसे काम करता है
TypeSafe AI की Jev त्वरित शुरुआत में state और typed questions के सेट का विवरण है: noul हाँ/नहीं मान के लिए, choice नाम वाले विकल्पों के लिए और score क्रमबद्ध स्तरों के लिए। Boll की स्क्रिप्ट इन्हीं नामों का इस्तेमाल करती है और अनुरोध में छवि पथों या base64 data URL का attachments ऐरे जोड़ती है। यह फ़ील्ड उनके अनुरोध ऑब्जेक्ट में खुद जोड़ा गया विस्तार है; उद्धृत Jev त्वरित शुरुआत में text state का विवरण है, इस फ़ील्ड को Jev API इनपुट नहीं बताया गया।
हर प्रश्न के लिए स्क्रिप्ट अक्षरों वाले विकल्पों के साथ prompt बनाती है, जैसे [A] true और [B] false। यह मॉडल से सबसे उपयुक्त अक्षर में जवाब माँगती है और पहले आउटपुट टोकन के top_logprobs पढ़ती है। फिर यह लौटाई गई log probabilities का घातांक निकालती है, सूचीबद्ध अक्षरों के भारों को सामान्यीकृत करती है और उन्हें सवाल के प्रकार से जोड़ती है। choice विकल्प के लिए सबसे अधिक भार वाला उत्तर और उसका वितरण लौटाता है। noul हाँ/नहीं मान के लिए true का भार देता है। score क्रमबद्ध स्तरों का भारित औसत देता है। अगर छोड़े गए विकल्प टोकनों का भार भी महत्वपूर्ण हो सकता है तो स्क्रिप्ट जवाब अस्वीकार कर देती है।
हर प्रश्न के साथ छवि भेजी जाती है। उदाहरण सभी जवाब एक ही model call में पाने के बजाय अलग-अलग अनुरोध भेजता है। OpenAI वाला रास्ता Responses API में input_image, top_logprobs और message.output_text.logprobs का उपयोग करता है; स्थानीय llama.cpp वाला रास्ता Chat Completions में image_url content item और log probabilities का उपयोग करता है। OpenAI की छवि मार्गदर्शिका base64 image data URL का विवरण देती है, और उसकी Responses API संदर्भ log-probability आउटपुट तथा हर टोकन स्थान पर अधिकतम 20 लौटाए गए विकल्पों की सीमा बताता है। llama.cpp सर्वर दस्तावेज़ chat interface में image URL का विवरण देते हैं। ये स्रोत अनुरोध का तरीका स्पष्ट करते हैं; हमने उदाहरण को किसी भी endpoint पर चलाकर नहीं देखा।
वेबकैम उदाहरण क्या मापता है
स्क्रिप्ट OpenCV से फ़्रेम लेती है, उसे JPEG में बदलती है और चार सवाल पूछती है: क्या कोई व्यक्ति या पौधा दिख रहा है, दृश्य घर के अंदर है या बाहर, और रोशनी कितनी है। बैकग्राउंड worker एक बार में एक फ़्रेम का मूल्यांकन करता है, जबकि पूर्वावलोकन चलता रहता है। कैमरे की व्यवस्था Linux V4L2 पर आधारित है, इसलिए बदलाव किए बिना प्रकाशित फ़ाइल को अलग-अलग प्रणालियों पर चलने वाली वेबकैम व्यवस्था नहीं माना जा सकता। लेख में प्रति फ़्रेम तीन सवाल बताए गए हैं, लेकिन प्रकाशित कोड में चार हैं; यहाँ गिनती कोड पर आधारित है।
Boll के अनुसार, स्थानीय रूप से चलाए गए Gemma 4 12B QAT मॉडल और RTX 3090 पर हर सेकंड लगभग एक फ़्रेम का मूल्यांकन हुआ; hosted GPT-6 Luna के साथ गति लगभग 0.2 फ़्रेम प्रति सेकंड थी। उनका अनुमान है कि बार-बार connection बनाने से hosted नतीजे पर असर पड़ा हो सकता है। पोस्ट में हार्डवेयर, नेटवर्क, छवि आकार, caching, सटीकता या अनुरोध के समय की नियंत्रित तुलना नहीं है। ये आँकड़े लेखक की अपनी व्यवस्था और कोड का वर्णन करते हैं, मॉडलों की सामान्य गति-रैंकिंग नहीं। OpenAI के अनुसार GPT-6 Luna छवि इनपुट ले सकता है, और उसकी मॉडल मार्गदर्शिका कहती है कि Luna उदाहरण में इस्तेमाल की गई none reasoning setting का समर्थन करता है।
स्क्रिप्ट को अपनाने वाले डेवलपर के लिए शुरुआती जाँचें स्पष्ट हैं: पुष्टि करें कि मॉडल छवि इनपुट स्वीकार करता है और पहले टोकन के ज़रूरी विकल्पों के स्कोर देता है; जाँचें कि विकल्पों के सभी अक्षर लौटे हैं; फिर लक्षित कैमरे या डेटासेट की लेबल लगी छवियों पर जवाबों का मूल्यांकन करें। सामान्यीकृत भार सूचीबद्ध अक्षर टोकनों के आपसी अनुपात बताते हैं। अपने-आप में वे यह नहीं मापते कि दृश्य पर दिया गया निर्णय सही है या नहीं। OpenAI की पुरानी logprobs cookbook टोकन-संभावना का विचार समझाती है, लेकिन उसे संग्रहित और पुराना चिह्नित किया गया है; उसमें API के कुछ उदाहरण अब पुराने हो सकते हैं।
यह wrapper यह भी दिखाती है कि तयशुदा नतीजे के बाद कौन-से फैसले application code को लेने होते हैं। मॉडल दी गई छवि को लिखे हुए मानदंड के अनुसार परखता है। application तय करता है कि कौन-से फ़्रेम भेजने हैं, छूटे हुए स्कोर कैसे सँभालने हैं और किसी नतीजे पर कार्रवाई करना सुरक्षित है या नहीं। Boll का उदाहरण तालिका दिखाता है; यह स्वचालित कार्रवाई या किसी वास्तविक तैनाती के मापे गए नतीजे नहीं बताता।
स्रोत और आगे पढ़ें
- Allan Riordan Boll, “विज़न मॉडल समेत LLM के लिए Jev जैसी wrapper”, 25 सितंबर 2026: मूल Python उदाहरण, वेबकैम कार्यप्रवाह और लेखक द्वारा बताए गए फ़्रेम-दर। लेख में प्रति फ़्रेम तीन सवाल कहे गए हैं, जबकि कोड में चार हैं। इसका समय-मापन स्वतंत्र या नियंत्रित benchmark नहीं है।
- TypeSafe AI, Jev त्वरित शुरुआत: text state और
noul,choiceतथाscoreसवालों के प्रकारों का विवरण देती है। इसमें लेखक का customattachmentsफ़ील्ड Jev API की सुविधा के रूप में दर्ज नहीं है। - OpenAI, छवियाँ और विज़न: विज़न इनपुट के लिए
input_image, image URL और base64 data URL का विवरण। Responses API संदर्भ मेंmessage.output_text.logprobsऔर लौटाए जाने वाले विकल्पों की सीमा का विवरण है। - OpenAI, GPT-6 Luna मॉडल और मॉडल मार्गदर्शिका: छवि इनपुट और मॉडल की
nonereasoning setting की पुष्टि करती है; मॉडल मार्गदर्शिका पैरामीटरों की संगतता विस्तार से बताती है। ये दस्तावेज़ ब्लॉग लेखक की गति के आँकड़ों की पुष्टि नहीं करते। - llama.cpp सर्वर दस्तावेज़: इसके OpenAI-संगत chat endpoint और image URL इनपुट का विवरण देते हैं। इस्तेमाल किए गए सटीक संस्करण और मॉडल में backend समर्थन तथा लौटाए गए टोकन की सूची की जाँच अब भी ज़रूरी है।
- OpenAI cookbook, logprobs का उपयोग: टोकन-संभावनाओं की पृष्ठभूमि समझाता है। OpenAI ने इस नुस्खे को संग्रहित चिह्नित किया है और चेताया है कि कुछ मॉडल या API उदाहरण पुराने हो सकते हैं।



