एक डेव्हलपर Allan Riordan Boll यांनी 25 सप्टेंबर रोजी प्रकाशित केलेले Python उदाहरण Jev-शैलीच्या निर्णय विनंतीमध्ये प्रतिमांची जोडणी करते. ते प्रत्येक वेबकॅम फ्रेम लहान प्रश्नांसह व्हिजन मॉडेलकडे पाठवते आणि मॉडेलच्या पुढील टोकनच्या संभाव्यता होय/नाही मूल्य, पर्याय किंवा गुणांमध्ये रूपांतरित करते. हे उदाहरण स्वतंत्र रॅपर आहे; Jevचे व्हिजन वैशिष्ट्य किंवा Jevच्या मॉडेलची चाचणी नाही.
डेव्हलपरसाठी या तंत्राची व्याप्ती समजणे उपयुक्त आहे. व्हिजन मॉडेल वर्णन न लिहिता मर्यादित प्रश्नाचे उत्तर देऊ शकते; मात्र परत मिळणाऱ्या पर्यायांच्या संभाव्यता प्रॉम्प्ट, उपलब्ध टोकन पर्याय आणि मॉडेलवर अवलंबून असतात. ही पोस्ट तपासण्यासारखा कार्यरत नमुना देते, अचूकतेचा अभ्यास नाही.
मोठा बदल
- काय बदलले:एका डेव्हलपरने Jevशी संबंधित लहान-निर्णय स्वरूप सर्वसाधारण व्हिजन मॉडेल वापरून प्रतिमांवर लागू केले. प्रत्येक विनंतीला प्रतिमा जोडली जाते आणि एका अक्षराचे उत्तर दृश्य प्रश्नाचे सॉफ्टवेअरला हाताळता येईल अशा मूल्यामध्ये रूपांतर करते.
- हे महत्त्वाचे का:डेव्हलपर प्रत्येक प्रश्नासाठी वेगळा प्रतिमा-वर्गीकारक न बनवता मजकूरातून दृश्य निकष बदलू शकतात आणि प्रकारबद्ध निकाल मिळवू शकतात. हे उदाहरण दिसणारी माणसे व झाडे, घरातील किंवा बाहेरील दृश्य आणि प्रकाशमानता यांचा समावेश करते; मात्र हे निर्णय इतर कॅमेरे किंवा दृश्यांमध्ये किती विश्वासार्हपणे लागू होतात हे सिद्ध करत नाही.
- कशाकडे लक्ष द्यावे:निवडलेले मॉडेल आणि एंडपॉइंट कामासाठी आवश्यक पर्यायी-टोकन गुण पुरेशा सातत्याने परत करतात का, हा व्यावहारिक निर्णय आहे. वेबकॅमचा निकाल एखादी कृती घडवण्यापूर्वी प्रतिनिधिक प्रतिमांवर फ्रेमचा वेग आणि निर्णयांची गुणवत्ता एकत्र मोजली पाहिजे.
प्रतिमेवर आधारित निर्णय कसा काम करतो
TypeSafe AIच्या Jev क्विक स्टार्टमध्ये एक प्रकारबद्ध state आणि प्रकारबद्ध questionsप्रश्नांचा संच नोंदवला आहे: noul साठी होय/नाही मूल्याकरिता, choice नाव दिलेल्या पर्यायांकरिता आणि score क्रमबद्ध पातळ्यांकरिता. Bollची स्क्रिप्ट ही नावे वापरते आणि प्रतिमांच्या मार्गांचा किंवा base64 डेटा URLचा अॅरे असलेले attachments जोडते. हे फील्ड लेखकाने विनंती ऑब्जेक्टमध्ये केलेला विस्तार आहे; उद्धृत Jev क्विक स्टार्ट मजकूर स्थितीचे वर्णन करते, पण हे Jev API इनपुट म्हणून नोंदवत नाही.
प्रत्येक प्रश्नासाठी स्क्रिप्ट अक्षरांनी दर्शवलेले पर्याय असलेला प्रॉम्प्ट तयार करते, उदाहरणार्थ [A] true आणि [B] false. मॉडेलला सर्वोत्तम अक्षराने उत्तर देण्यास सांगून पहिल्या आउटपुट टोकनचे top_logprobsवाचते. परत मिळालेल्या लॉग संभाव्यतांचे घातांक काढते, सूचीतील अक्षरांमधील वजन सामान्यीकृत करते आणि त्यांना प्रश्नाच्या प्रकाराशी जोडते. choice सर्वाधिक वजनाचा पर्याय आणि त्याचे वितरण परत करते. noul यासाठीचे वजन परत करते true. score क्रमबद्ध पातळ्यांची भारित सरासरी परत करते. वगळलेल्या पर्याय-टोकनमध्ये अजूनही महत्त्वपूर्ण वजन असू शकते तेव्हा स्क्रिप्ट उत्तर नाकारते.
प्रत्येक प्रश्नासोबत प्रतिमा दिली जाते. सर्व उत्तरे एका मॉडेल कॉलमध्ये मिळवण्याऐवजी उदाहरण स्वतंत्र विनंत्या पाठवते. OpenAI मार्ग Responses APIसह input_image, top_logprobs आणि message.output_text.logprobsवापरतो; स्थानिक llama.cpp मार्ग Chat Completionsसह image_url कंटेंट घटक आणि लॉग संभाव्यता वापरतो. OpenAIचे प्रतिमा मार्गदर्शक base64 प्रतिमा डेटा URLचे वर्णन करते आणि त्याचा Responses संदर्भ लॉग-संभाव्यता आउटपुट तसेच प्रत्येक टोकन स्थानासाठी जास्तीत जास्त 20 पर्यायी नोंदी परत येऊ शकतात हे सांगतो. llama.cpp सर्व्हर दस्तऐवज त्याच्या चॅट इंटरफेसमधील प्रतिमा URLचे वर्णन करतात. ही स्रोत सामग्री विनंतीच्या नमुन्याला आधार देते; आम्ही उदाहरण दोन्हीपैकी कोणत्याही एंडपॉइंटवर चालवलेले नाही.
वेबकॅम उदाहरण काय मोजते
स्क्रिप्ट OpenCVने फ्रेम पकडते, JPEG म्हणून एन्कोड करते आणि चार प्रश्न विचारते: माणूस किंवा झाड दिसते का, दृश्य घरातील आहे की बाहेरील, आणि ते किती उजळ आहे. पूर्वदृश्य सुरू असताना पार्श्वभूमीतील कामगार एका वेळी एक फ्रेम तपासतो. कॅमेरा सेटअप Linux V4L2 वापरतो, त्यामुळे प्रकाशित फाइल बदलांशिवाय सर्वत्र चालणारा वेबकॅम सेटअप नाही. लेखाच्या मजकुरात प्रत्येक फ्रेमसाठी तीन प्रश्न म्हटले आहेत, परंतु प्रकाशित कोडमध्ये चार आहेत; येथे मोजणीसाठी कोड आधार मानला आहे.
Boll यांच्या मते सुमारे प्रति सेकंद एक मूल्यांकन केलेली फ्रेम RTX 3090 वर स्थानिकपणे चालवलेल्या Gemma 4 12B QAT मॉडेलसह आणि सुमारे प्रति सेकंद 0.2 फ्रेम होस्ट केलेल्या GPT-6 Lunaसह मिळतात. वारंवार जोडणी करणे होस्टेड निकालावर परिणाम करू शकते, असे ते सुचवतात. पोस्टमध्ये हार्डवेअर, नेटवर्क, प्रतिमेचा आकार, कॅशिंग, अचूकता किंवा विनंतीचा वेळ यांची नियंत्रित तुलना नाही. हे आकडे या लेखकाच्या सेटअप आणि कोडचे वर्णन करतात; मॉडेलच्या सर्वसाधारण वेगाची क्रमवारी नाही. OpenAI GPT-6 Luna प्रतिमा इनपुट स्वीकारते असे नमूद करते, आणि त्याचे मॉडेल मार्गदर्शन Luna उदाहरणात वापरलेली none रीझनिंग सेटिंग समर्थित करते असे सांगते.
स्क्रिप्टमध्ये बदल करणाऱ्या डेव्हलपरने प्रथम ठोस तपासण्या कराव्यात: मॉडेल प्रतिमा स्वीकारते आणि आवश्यक पहिल्या-टोकनचे पर्याय उपलब्ध करून देते याची खात्री करा; सर्व पर्याय-अक्षरे दिसतात का ते तपासा; नंतर अपेक्षित कॅमेरा किंवा डेटासेटवरील लेबल केलेल्या प्रतिमांवर निकाल तपासा. सामान्यीकृत वजन सूचीतील अक्षर-टोकनच्या तुलनेत असतात. ती स्वतः दृश्य निर्णय बरोबर असल्याची मोजलेली संभाव्यता नसतात. OpenAIचे जुने logprobs कुकबुक टोकन-संभाव्यतेची कल्पना स्पष्ट करते; मात्र ते संग्रहित म्हणून दर्शवले आहे आणि APIची उदाहरणे कालबाह्य असू शकतात.
प्रकारबद्ध निकाल मिळाल्यानंतर अनुप्रयोगाच्या कोडने काय करायचे हेही हा रॅपर स्पष्ट करतो. मॉडेल दिलेली प्रतिमा लिखित निकषानुसार तपासते. अनुप्रयोग फ्रेम निवडतो, गुण नसल्यास त्याचे हाताळण करतो आणि कोणता निकाल कृतीसाठी पुरेसा सुरक्षित आहे ते ठरवतो. Bollचे उदाहरण तक्ता छापते; स्वयंचलित कृती किंवा मोजून केलेली अंमलबजावणी नोंदवत नाही.
स्रोत आणि पुढील वाचन
- Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” 25 सप्टेंबर 2026: मूळ Python उदाहरण, वेबकॅम कार्यप्रवाह आणि लेखकाने नोंदवलेले फ्रेम दर. मजकुरात प्रत्येक फ्रेमला तीन प्रश्न म्हटले आहेत; कोडमध्ये चार आहेत. वेळेची नोंद स्वतंत्र किंवा नियंत्रित बेंचमार्क नाही.
- TypeSafe AI, Jev क्विक स्टार्ट: मजकूर स्थिती आणि
noul,choiceआणिscoreप्रश्नांचे प्रकार नोंदवते. लेखकाचे सानुकूलattachmentsफील्ड Jev API वैशिष्ट्य असल्याचे ते नोंदवत नाही. - OpenAI, Images and vision:
input_image, प्रतिमा URL आणि व्हिजन इनपुटसाठी base64 डेटा URLचे वर्णन करते. Responses API संदर्भ त्याचे वर्णन करतोmessage.output_text.logprobsआणि परत येणाऱ्या पर्यायांची मर्यादा स्पष्ट करतो. - OpenAI, GPT-6 Luna मॉडेल आणि मॉडेल मार्गदर्शन: प्रतिमा इनपुट आणि मॉडेलची
noneरीझनिंग सेटिंग निश्चित करते; मॉडेल मार्गदर्शनपॅरामीटरची सुसंगतता सांगते. ही कागदपत्रे ब्लॉग लेखकाचा फ्रेम-वेग तपासत नाहीत. - llama.cpp सर्व्हर दस्तऐवज: OpenAI-सुसंगत चॅट एंडपॉइंट आणि प्रतिमा URL इनपुटचे वर्णन करतात. वापरातील नेमक्या आवृत्ती आणि मॉडेलसोबत बॅकएंडचे समर्थन व परत येणारी टोकन यादी तपासणे आवश्यक आहे.
- OpenAI कुकबुक, Using logprobs: टोकन संभाव्यतेची पार्श्वभूमी समजावते. OpenAI ही कृती संग्रहित म्हणून दर्शवते आणि काही मॉडेल किंवा APIसाठी ती कालबाह्य असू शकते असे बजावते.



