AI-translated from English; not yet reviewed by a fluent editor.

# Jevसदृश व्हिजन रॅपर प्रतिमांवरील प्रश्नांचे प्रकारबद्ध पर्यायांमध्ये रूपांतर करतो

> एक स्वतंत्र Python उदाहरण व्हिजन मॉडेलच्या टोकन संभाव्यता वापरून प्रतिमांमधून प्रकारबद्ध निर्णय परत करते. वेबकॅमचे दर लेखकाने नोंदवले आहेत आणि अचूकता तपासलेली नाही.

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

एक [डेव्हलपर Allan Riordan Boll यांनी 25 सप्टेंबर रोजी प्रकाशित केलेले Python उदाहरण ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)Jev-शैलीच्या निर्णय विनंतीमध्ये प्रतिमांची जोडणी करते. ते प्रत्येक वेबकॅम फ्रेम लहान प्रश्नांसह व्हिजन मॉडेलकडे पाठवते आणि मॉडेलच्या पुढील टोकनच्या संभाव्यता होय/नाही मूल्य, पर्याय किंवा गुणांमध्ये रूपांतरित करते. हे उदाहरण स्वतंत्र रॅपर आहे; Jevचे व्हिजन वैशिष्ट्य किंवा Jevच्या मॉडेलची चाचणी नाही.

डेव्हलपरसाठी या तंत्राची व्याप्ती समजणे उपयुक्त आहे. व्हिजन मॉडेल वर्णन न लिहिता मर्यादित प्रश्नाचे उत्तर देऊ शकते; मात्र परत मिळणाऱ्या पर्यायांच्या संभाव्यता प्रॉम्प्ट, उपलब्ध टोकन पर्याय आणि मॉडेलवर अवलंबून असतात. ही पोस्ट तपासण्यासारखा कार्यरत नमुना देते, अचूकतेचा अभ्यास नाही.

## मोठा बदल

- **काय बदलले:**एका डेव्हलपरने Jevशी संबंधित लहान-निर्णय स्वरूप सर्वसाधारण व्हिजन मॉडेल वापरून प्रतिमांवर लागू केले. प्रत्येक विनंतीला प्रतिमा जोडली जाते आणि एका अक्षराचे उत्तर दृश्य प्रश्नाचे सॉफ्टवेअरला हाताळता येईल अशा मूल्यामध्ये रूपांतर करते.
- **हे महत्त्वाचे का:**डेव्हलपर प्रत्येक प्रश्नासाठी वेगळा प्रतिमा-वर्गीकारक न बनवता मजकूरातून दृश्य निकष बदलू शकतात आणि प्रकारबद्ध निकाल मिळवू शकतात. हे उदाहरण दिसणारी माणसे व झाडे, घरातील किंवा बाहेरील दृश्य आणि प्रकाशमानता यांचा समावेश करते; मात्र हे निर्णय इतर कॅमेरे किंवा दृश्यांमध्ये किती विश्वासार्हपणे लागू होतात हे सिद्ध करत नाही.
- **कशाकडे लक्ष द्यावे:**निवडलेले मॉडेल आणि एंडपॉइंट कामासाठी आवश्यक पर्यायी-टोकन गुण पुरेशा सातत्याने परत करतात का, हा व्यावहारिक निर्णय आहे. वेबकॅमचा निकाल एखादी कृती घडवण्यापूर्वी प्रतिनिधिक प्रतिमांवर फ्रेमचा वेग आणि निर्णयांची गुणवत्ता एकत्र मोजली पाहिजे.

## प्रतिमेवर आधारित निर्णय कसा काम करतो

[TypeSafe AIच्या Jev क्विक स्टार्टमध्ये](https://docs.typesafe.ai/introduction/quickstart) एक प्रकारबद्ध `state` आणि प्रकारबद्ध `questions`प्रश्नांचा संच नोंदवला आहे: `noul` साठी होय/नाही मूल्याकरिता, `choice` नाव दिलेल्या पर्यायांकरिता आणि `score` क्रमबद्ध पातळ्यांकरिता. Bollची स्क्रिप्ट ही नावे वापरते आणि प्रतिमांच्या मार्गांचा किंवा base64 डेटा URLचा अ‍ॅरे असलेले `attachments` जोडते. हे फील्ड लेखकाने विनंती ऑब्जेक्टमध्ये केलेला विस्तार आहे; उद्धृत Jev क्विक स्टार्ट मजकूर स्थितीचे वर्णन करते, पण हे Jev API इनपुट म्हणून नोंदवत नाही.

प्रत्येक प्रश्नासाठी स्क्रिप्ट अक्षरांनी दर्शवलेले पर्याय असलेला प्रॉम्प्ट तयार करते, उदाहरणार्थ `[A] true` आणि `[B] false`. मॉडेलला सर्वोत्तम अक्षराने उत्तर देण्यास सांगून पहिल्या आउटपुट टोकनचे `top_logprobs`वाचते. परत मिळालेल्या लॉग संभाव्यतांचे घातांक काढते, सूचीतील अक्षरांमधील वजन सामान्यीकृत करते आणि त्यांना प्रश्नाच्या प्रकाराशी जोडते. `choice` सर्वाधिक वजनाचा पर्याय आणि त्याचे वितरण परत करते. `noul` यासाठीचे वजन परत करते `true`. `score` क्रमबद्ध पातळ्यांची भारित सरासरी परत करते. वगळलेल्या पर्याय-टोकनमध्ये अजूनही महत्त्वपूर्ण वजन असू शकते तेव्हा स्क्रिप्ट उत्तर नाकारते.

प्रत्येक प्रश्नासोबत प्रतिमा दिली जाते. सर्व उत्तरे एका मॉडेल कॉलमध्ये मिळवण्याऐवजी उदाहरण स्वतंत्र विनंत्या पाठवते. OpenAI मार्ग Responses APIसह `input_image`, `top_logprobs` आणि `message.output_text.logprobs`वापरतो; स्थानिक llama.cpp मार्ग Chat Completionsसह `image_url` कंटेंट घटक आणि लॉग संभाव्यता वापरतो. [OpenAIचे प्रतिमा मार्गदर्शक](https://developers.openai.com/api/docs/guides/images-vision) base64 प्रतिमा डेटा URLचे वर्णन करते आणि त्याचा [Responses संदर्भ](https://developers.openai.com/api/reference/resources/responses/methods/create) लॉग-संभाव्यता आउटपुट तसेच प्रत्येक टोकन स्थानासाठी जास्तीत जास्त 20 पर्यायी नोंदी परत येऊ शकतात हे सांगतो. [llama.cpp सर्व्हर दस्तऐवज](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) त्याच्या चॅट इंटरफेसमधील प्रतिमा URLचे वर्णन करतात. ही स्रोत सामग्री विनंतीच्या नमुन्याला आधार देते; आम्ही उदाहरण दोन्हीपैकी कोणत्याही एंडपॉइंटवर चालवलेले नाही.

## वेबकॅम उदाहरण काय मोजते

स्क्रिप्ट OpenCVने फ्रेम पकडते, JPEG म्हणून एन्कोड करते आणि चार प्रश्न विचारते: माणूस किंवा झाड दिसते का, दृश्य घरातील आहे की बाहेरील, आणि ते किती उजळ आहे. पूर्वदृश्य सुरू असताना पार्श्वभूमीतील कामगार एका वेळी एक फ्रेम तपासतो. कॅमेरा सेटअप Linux V4L2 वापरतो, त्यामुळे प्रकाशित फाइल बदलांशिवाय सर्वत्र चालणारा वेबकॅम सेटअप नाही. लेखाच्या मजकुरात प्रत्येक फ्रेमसाठी तीन प्रश्न म्हटले आहेत, परंतु प्रकाशित कोडमध्ये चार आहेत; येथे मोजणीसाठी कोड आधार मानला आहे.

Boll यांच्या मते सुमारे **प्रति सेकंद एक मूल्यांकन केलेली फ्रेम** RTX 3090 वर स्थानिकपणे चालवलेल्या Gemma 4 12B QAT मॉडेलसह आणि सुमारे  **प्रति सेकंद 0.2 फ्रेम** होस्ट केलेल्या GPT-6 Lunaसह मिळतात. वारंवार जोडणी करणे होस्टेड निकालावर परिणाम करू शकते, असे ते सुचवतात. पोस्टमध्ये हार्डवेअर, नेटवर्क, प्रतिमेचा आकार, कॅशिंग, अचूकता किंवा विनंतीचा वेळ यांची नियंत्रित तुलना नाही. हे आकडे या लेखकाच्या सेटअप आणि कोडचे वर्णन करतात; मॉडेलच्या सर्वसाधारण वेगाची क्रमवारी नाही. [OpenAI GPT-6 Luna प्रतिमा इनपुट स्वीकारते असे नमूद करते](https://developers.openai.com/api/docs/models/gpt-6-luna), आणि त्याचे [मॉडेल मार्गदर्शन](https://developers.openai.com/api/docs/guides/latest-model) Luna उदाहरणात वापरलेली `none` रीझनिंग सेटिंग समर्थित करते असे सांगते.

स्क्रिप्टमध्ये बदल करणाऱ्या डेव्हलपरने प्रथम ठोस तपासण्या कराव्यात: मॉडेल प्रतिमा स्वीकारते आणि आवश्यक पहिल्या-टोकनचे पर्याय उपलब्ध करून देते याची खात्री करा; सर्व पर्याय-अक्षरे दिसतात का ते तपासा; नंतर अपेक्षित कॅमेरा किंवा डेटासेटवरील लेबल केलेल्या प्रतिमांवर निकाल तपासा. सामान्यीकृत वजन सूचीतील अक्षर-टोकनच्या तुलनेत असतात. ती स्वतः दृश्य निर्णय बरोबर असल्याची मोजलेली संभाव्यता नसतात. OpenAIचे [जुने logprobs कुकबुक ](https://developers.openai.com/cookbook/examples/using_logprobs)टोकन-संभाव्यतेची कल्पना स्पष्ट करते; मात्र ते संग्रहित म्हणून दर्शवले आहे आणि APIची उदाहरणे कालबाह्य असू शकतात.

प्रकारबद्ध निकाल मिळाल्यानंतर अनुप्रयोगाच्या कोडने काय करायचे हेही हा रॅपर स्पष्ट करतो. मॉडेल दिलेली प्रतिमा लिखित निकषानुसार तपासते. अनुप्रयोग फ्रेम निवडतो, गुण नसल्यास त्याचे हाताळण करतो आणि कोणता निकाल कृतीसाठी पुरेसा सुरक्षित आहे ते ठरवतो. Bollचे उदाहरण तक्ता छापते; स्वयंचलित कृती किंवा मोजून केलेली अंमलबजावणी नोंदवत नाही.

## स्रोत आणि पुढील वाचन

- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” 25 सप्टेंबर 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): मूळ Python उदाहरण, वेबकॅम कार्यप्रवाह आणि लेखकाने नोंदवलेले फ्रेम दर. मजकुरात प्रत्येक फ्रेमला तीन प्रश्न म्हटले आहेत; कोडमध्ये चार आहेत. वेळेची नोंद स्वतंत्र किंवा नियंत्रित बेंचमार्क नाही.
- [TypeSafe AI, Jev क्विक स्टार्ट](https://docs.typesafe.ai/introduction/quickstart): मजकूर स्थिती आणि `noul`, `choice`आणि `score`प्रश्नांचे प्रकार नोंदवते. लेखकाचे सानुकूल `attachments`फील्ड Jev API वैशिष्ट्य असल्याचे ते नोंदवत नाही.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): `input_image`, प्रतिमा URL आणि व्हिजन इनपुटसाठी base64 डेटा URLचे वर्णन करते. [Responses API संदर्भ](https://developers.openai.com/api/reference/resources/responses/methods/create) त्याचे वर्णन करतो `message.output_text.logprobs`आणि परत येणाऱ्या पर्यायांची मर्यादा स्पष्ट करतो.
- [OpenAI, GPT-6 Luna मॉडेल आणि मॉडेल मार्गदर्शन](https://developers.openai.com/api/docs/models/gpt-6-luna): प्रतिमा इनपुट आणि मॉडेलची `none`रीझनिंग सेटिंग निश्चित करते; [मॉडेल मार्गदर्शन](https://developers.openai.com/api/docs/guides/latest-model)पॅरामीटरची सुसंगतता सांगते. ही कागदपत्रे ब्लॉग लेखकाचा फ्रेम-वेग तपासत नाहीत.
- [llama.cpp सर्व्हर दस्तऐवज](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): OpenAI-सुसंगत चॅट एंडपॉइंट आणि प्रतिमा URL इनपुटचे वर्णन करतात. वापरातील नेमक्या आवृत्ती आणि मॉडेलसोबत बॅकएंडचे समर्थन व परत येणारी टोकन यादी तपासणे आवश्यक आहे.
- [OpenAI कुकबुक, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): टोकन संभाव्यतेची पार्श्वभूमी समजावते. OpenAI ही कृती संग्रहित म्हणून दर्शवते आणि काही मॉडेल किंवा APIसाठी ती कालबाह्य असू शकते असे बजावते.

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — स्वतंत्र मूळ Python कोड आणि लेखकाने नोंदवलेली वेबकॅम निरीक्षणे. आसपासच्या मजकुरात तीन प्रश्न म्हटले असले, तरी कोड चार प्रश्न ठरवतो; नियंत्रित बेंचमार्क किंवा स्वतंत्र अचूकता अभ्यास नाही.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — मजकूर स्थिती, प्रश्नांचे प्रकार आणि विनंतीच्या मजकुराचे उदाहरण नोंदवते. ब्लॉग लेखक स्वतःच्या Jevसदृश विनंती ऑब्जेक्टमध्ये जोडण्या करतो; हे क्विक स्टार्ट त्या फील्डचे वर्णन करत नाही.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — प्रतिमा इनपुट आणि base64 डेटा URLचे वर्णन करते. विनंतीच्या नमुन्याला आधार देते, लेखकाने नोंदवलेल्या वेगाला नाही.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — प्रतिमा इनपुट, message.output_text.logprobs आणि प्रत्येक टोकन स्थानासाठी जास्तीत जास्त 20 (कधी कमी) top log probabilitiesचे वर्णन करते.
- [OpenAI: GPT-6 Luna आणि मॉडेल मार्गदर्शन](https://developers.openai.com/api/docs/models/gpt-6-luna) — प्रतिमा इनपुट व none रीझनिंग प्रयत्न नमूद करते; OpenAIचे मॉडेल मार्गदर्शन प्रयत्नाच्या पातळीनुसार logprob पॅरामीटरच्या मर्यादा स्पष्ट करते.
- [llama.cpp सर्व्हर README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI-सुसंगत चॅट एंडपॉइंट आणि image_url इनपुटचे वर्णन करते. नेमकी बॅकएंड/मॉडेल आवृत्ती येथे स्वतंत्रपणे चालवून तपासलेली नाही.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — टोकन संभाव्यतेची पार्श्वभूमी देते. OpenAI हे कुकबुक उदाहरण संग्रहित आणि सध्याच्या मॉडेल किंवा APIसाठी कदाचित कालबाह्य असल्याचे दर्शवते.
