دنیا ٹھہری نہیں ہے۔RSS
BIG CHANGE.

Markdown ایڈیشن

AI-translated from English; not yet reviewed by a fluent editor.

# Jev جیسا وژن ریپر تصویری سوالات کو متعین نوعیت کے انتخاب میں بدلتا ہے

> ایک آزاد Python مثال وژن ماڈل کے ٹوکن امکانات سے تصاویر کے متعین نوعیت کے فیصلے واپس کرتی ہے۔ ویب کیم کی رفتار مصنف کی بتائی ہوئی ہے اور درستگی آزمائی نہیں گئی۔

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

ایک [ڈویلپر Allan Riordan Boll کی 25 ستمبر کو شائع کردہ Python مثال ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)Jev طرز کی فیصلہ درخواست میں تصاویر منسلک کرتی ہے۔ یہ ہر ویب کیم فریم مختصر سوالات کے ساتھ وژن ماڈل کو بھیجتی ہے، پھر ماڈل کے اگلے ٹوکن کے امکانات کو ہاں/نہیں کی قدر، انتخاب یا اسکور میں بدلتی ہے۔ یہ ایک آزاد ریپر ہے، Jev کی وژن خصوصیت یا Jev ماڈل کا ٹیسٹ نہیں۔

ڈویلپرز کے لیے اس طریقے کی حد سمجھنا مفید ہے۔ وژن ماڈل وضاحت لکھے بغیر محدود سوال کا جواب دے سکتا ہے، لیکن واپس آنے والے انتخابی امکانات prompt، دستیاب متبادل ٹوکنز اور ماڈل پر منحصر ہوتے ہیں۔ یہ تحریر جانچنے کے لیے ایک کام کرنے کا طریقہ دیتی ہے، درستگی کا مطالعہ نہیں۔

## بڑی تبدیلی

- **کیا بدلا:**ایک ڈویلپر نے Jev سے وابستہ چھوٹے فیصلے کے فارمیٹ کو عمومی وژن ماڈلز کے ذریعے تصاویر پر لاگو کیا ہے۔ ہر درخواست کے ساتھ تصویر منسلک ہوتی ہے، جبکہ ایک حرف کا جواب بصری سوال کو ایسی قدر میں بدل دیتا ہے جسے سافٹ ویئر سنبھال سکتا ہے۔
- **یہ کیوں اہم ہے:**ڈویلپر ہر سوال کے لیے الگ تصویری درجہ بند بنائے بغیر متن میں بصری معیار بدل سکتے ہیں اور متعین نوعیت کا نتیجہ حاصل کر سکتے ہیں۔ یہ مثال نظر آنے والے افراد اور پودوں، اندرونی یا بیرونی منظر، اور روشنی کو دیکھتی ہے؛ یہ ثابت نہیں کرتی کہ یہ فیصلے دوسرے کیمروں یا مناظر میں کتنی قابلِ اعتماد طور پر لاگو ہوں گے۔
- **کس بات پر نظر رکھیں:**عملی سوال یہ ہے کہ منتخب ماڈل اور endpoint کام کے لیے درکار متبادل ٹوکن اسکور کافی مستقل طور پر واپس کرتے ہیں یا نہیں۔ ویب کیم کا نتیجہ کسی عمل کو شروع کرنے سے پہلے نمائندہ تصاویر پر فریم کی رفتار اور فیصلے کے معیار کو ایک ساتھ ناپنا چاہیے۔

## تصویر پر مبنی فیصلہ کیسے کام کرتا ہے

[TypeSafe AI کی Jev فوری آغاز گائیڈ](https://docs.typesafe.ai/introduction/quickstart) ایک متعین نوعیت کی `state` اور متعین نوعیت کے `questions` سوالات درج کرتی ہے: `noul` ہاں/نہیں قدر کے لیے، `choice` نام والے متبادل کے لیے، اور `score` ترتیب وار سطحوں کے لیے۔ Boll کی اسکرپٹ یہ نام استعمال کرتی ہے اور تصویر کے راستوں یا base64 ڈیٹا URL کی فہرست، یعنی `attachments` شامل کرتی ہے۔ یہ فیلڈ درخواست کے آبجیکٹ میں مصنف کی اپنی توسیع ہے؛ حوالہ دی گئی Jev فوری آغاز گائیڈ متنی حالت بیان کرتی ہے مگر اسے Jev API ان پٹ کے طور پر درج نہیں کرتی۔

ہر سوال کے لیے اسکرپٹ حروف کے نشان والے انتخابوں والا prompt بناتی ہے، مثلاً `[A] true` اور `[B] false`۔ یہ ماڈل سے بہترین حرف میں جواب مانگتی ہے اور پہلے آؤٹ پٹ ٹوکن کا `top_logprobs` پڑھتی ہے۔ یہ واپس آنے والے لاگ امکانات کا exponent لیتی، درج حروف کے درمیان وزن معمول پر لاتی، اور انہیں سوال کی نوعیت سے ملاتی ہے۔ `choice` سب سے زیادہ وزن والا انتخاب اور اس کی تقسیم واپس کرتا ہے۔ `noul` کا وزن واپس کرتا ہے `true`۔ `score` ترتیب وار سطحوں کی وزنی اوسط واپس کرتا ہے۔ اگر چھوڑے گئے انتخابی ٹوکنز میں اب بھی قابلِ ذکر وزن ہو سکتا ہو تو اسکرپٹ جواب مسترد کر دیتی ہے۔

ہر سوال کے ساتھ تصویر دی جاتی ہے۔ مثال تمام جواب ایک ہی ماڈل کال میں لینے کے بجائے الگ درخواستیں بھیجتی ہے۔ OpenAI راستہ Responses API کے ساتھ `input_image`, `top_logprobs` اور `message.output_text.logprobs`استعمال کرتا ہے؛ مقامی llama.cpp راستہ Chat Completions کے ساتھ `image_url` مواد کی شے اور لاگ امکانات استعمال کرتا ہے۔ [OpenAI کی تصویری گائیڈ](https://developers.openai.com/api/docs/guides/images-vision) base64 تصویری ڈیٹا URL بیان کرتی ہے، جبکہ اس کا [Responses حوالہ](https://developers.openai.com/api/reference/resources/responses/methods/create) لاگ امکان آؤٹ پٹ اور ہر ٹوکن مقام پر زیادہ سے زیادہ 20 متبادل واپس آنے کی وضاحت کرتا ہے۔ [llama.cpp سرور کی دستاویزات](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) اپنے چیٹ انٹرفیس میں تصویری URL بیان کرتی ہیں۔ یہ ذرائع درخواست کے طریقے کی تائید کرتے ہیں؛ ہم نے یہ مثال دونوں میں سے کسی endpoint پر نہیں چلائی۔

## ویب کیم کی مثال کیا ناپتی ہے

اسکرپٹ OpenCV سے ایک فریم لیتی، اسے JPEG کے طور پر encode کرتی، اور چار سوال پوچھتی ہے: کیا کوئی شخص یا پودا نظر آتا ہے، منظر اندرونی ہے یا بیرونی، اور روشنی کتنی ہے۔ پیش منظر جاری رہنے کے دوران پس منظر کا عمل ایک وقت میں ایک فریم جانچتا ہے۔ کیمرے کی ترتیب Linux V4L2 استعمال کرتی ہے، اس لیے شائع شدہ فائل بغیر تبدیلی کے ہر جگہ قابلِ استعمال ویب کیم ترتیب نہیں۔ مضمون کا متن فی فریم تین سوال کہتا ہے، مگر شائع شدہ کوڈ میں چار ہیں؛ یہاں گنتی کی بنیاد کوڈ ہے۔

Boll کے مطابق تقریباً **ہر سیکنڈ ایک فریم جانچا گیا** RTX 3090 پر مقامی طور پر چلائے گئے Gemma 4 12B QAT ماڈل کے ساتھ، اور تقریباً  **ہر سیکنڈ 0.2 فریم** میزبان GPT-6 Luna کے ساتھ ملے۔ وہ تجویز کرتے ہیں کہ بار بار کنکشن بنانا میزبان نتیجے میں حصہ ڈال سکتا ہے۔ پوسٹ ہارڈویئر، نیٹ ورک، تصویر کے سائز، کیشنگ، درستگی یا درخواست کے وقت کا کنٹرول شدہ موازنہ نہیں دیتی۔ یہ اعداد مصنف کے سیٹ اپ اور کوڈ کی وضاحت ہیں، ماڈلز کی عمومی رفتار کی درجہ بندی نہیں۔ [OpenAI کے مطابق GPT-6 Luna تصویری ان پٹ قبول کرتا ہے](https://developers.openai.com/api/docs/models/gpt-6-luna)، اور اس کی [ماڈل گائیڈ](https://developers.openai.com/api/docs/guides/latest-model) کہتی ہے کہ Luna مثال میں استعمال شدہ `none` reasoning ترتیب کی حمایت کرتا ہے۔

اسکرپٹ میں ترمیم کرنے والے ڈویلپر کے لیے پہلی جانچیں واضح ہیں: تصدیق کریں کہ ماڈل تصویری ان پٹ قبول کرتا اور پہلے ٹوکن کے درکار متبادل فراہم کرتا ہے؛ دیکھیں کہ انتخاب کے تمام حروف آتے ہیں؛ پھر مطلوبہ کیمرے یا ڈیٹاسیٹ کی لیبل والی تصاویر پر فیصلوں کو جانچیں۔ معمول پر لائے گئے وزن درج حروف والے ٹوکنز کے مقابلے میں ہیں۔ وہ بذاتِ خود اس بات کے ناپے ہوئے امکانات نہیں کہ بصری فیصلہ درست ہے۔ OpenAI کی [پرانی logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)ٹوکن امکانات کا تصور بیان کرتی ہے مگر آرکائیو شدہ ہے اور API مثالیں پرانی ہو سکتی ہیں۔

یہ ریپر یہ بھی واضح کرتا ہے کہ متعین نوعیت کے نتیجے کے بعد ایپلیکیشن کوڈ کی کیا ذمہ داری ہے۔ ماڈل فراہم کردہ تصویر کو تحریری معیار پر پرکھتا ہے۔ ایپلیکیشن فریم چنتی، غائب اسکور سنبھالتی، اور طے کرتی ہے کہ کوئی نتیجہ عمل کے لیے کافی محفوظ ہے یا نہیں۔ Boll کی مثال جدول دکھاتی ہے؛ خودکار عمل یا ناپی ہوئی تعیناتی کی اطلاع نہیں دیتی۔

## ذرائع اور مزید مطالعہ

- [Allan Riordan Boll، “A Jev-like wrapper for LLMs, including vision models”، 25 ستمبر 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): اصل Python مثال، ویب کیم کا طریقۂ کار، اور مصنف کی بتائی ہوئی فریم رفتار۔ متن فی فریم تین سوال کہتا ہے؛ کوڈ چار متعین کرتا ہے۔ اوقات آزادانہ یا کنٹرول شدہ benchmark نہیں ہیں۔
- [TypeSafe AI، Jev فوری آغاز گائیڈ](https://docs.typesafe.ai/introduction/quickstart): متنی حالت اور سوال کی اقسام `noul`, `choice` اور `score`درج کرتی ہے۔ یہ مصنف کے حسبِ ضرورت `attachments`فیلڈ کو Jev API خصوصیت نہیں بتاتی۔
- [OpenAI، Images and vision](https://developers.openai.com/api/docs/guides/images-vision): `input_image`, تصویری URL اور وژن ان پٹ کے لیے base64 ڈیٹا URL بیان کرتی ہے۔ [Responses API حوالہ](https://developers.openai.com/api/reference/resources/responses/methods/create)اس کی وضاحت کرتا ہے `message.output_text.logprobs`اور واپس آنے والے متبادلوں کی حد بیان کرتا ہے۔
- [OpenAI، GPT-6 Luna ماڈل اور ماڈل گائیڈ](https://developers.openai.com/api/docs/models/gpt-6-luna): تصویری ان پٹ اور ماڈل کی `none`reasoning ترتیب کی تصدیق کرتی ہے؛ [ماڈل گائیڈ](https://developers.openai.com/api/docs/guides/latest-model)پیرامیٹر مطابقت بیان کرتی ہے۔ یہ دستاویزات بلاگ مصنف کی بتائی ہوئی رفتار کی تصدیق نہیں کرتیں۔
- [llama.cpp سرور کی دستاویزات](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): OpenAI سے مطابقت رکھنے والا چیٹ endpoint اور تصویری URL ان پٹ بیان کرتی ہیں۔ عین استعمال شدہ ورژن اور ماڈل کے ساتھ backend کی معاونت اور واپس آنے والی ٹوکن فہرست کی جانچ ضروری ہے۔
- [OpenAI cookbook، Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): ٹوکن امکانات کی پس منظر وضاحت۔ OpenAI اس نسخے کو آرکائیو شدہ قرار دیتا اور خبردار کرتا ہے کہ بعض ماڈل یا API معلومات پرانی ہو سکتی ہیں۔

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — اصل آزاد Python کوڈ اور مصنف کے بتائے ہوئے ویب کیم مشاہدات۔ آس پاس کے متن میں فی فریم تین سوال ہیں، لیکن کوڈ چار متعین کرتا ہے؛ کوئی کنٹرول شدہ benchmark یا آزاد درستگی کا مطالعہ نہیں۔
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — متنی حالت، سوال کی اقسام، اور درخواست کے متن کی مثال بیان کرتی ہے۔ بلاگ مصنف اپنے Jev جیسے درخواست آبجیکٹ میں منسلکات شامل کرتا ہے؛ یہ فوری آغاز اس فیلڈ کو درج نہیں کرتی۔
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — تصویری ان پٹ اور base64 ڈیٹا URL بیان کرتی ہے۔ درخواست کے طریقے کی حمایت کرتی ہے، مصنف کی بتائی ہوئی رفتار کی نہیں۔
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — تصویری ان پٹ، message.output_text.logprobs، اور ہر ٹوکن مقام کے لیے زیادہ سے زیادہ 20 (بعض اوقات اس سے کم) اعلیٰ لاگ امکانات بیان کرتی ہے۔
- [OpenAI: GPT-6 Luna اور ماڈل گائیڈ](https://developers.openai.com/api/docs/models/gpt-6-luna) — تصویری ان پٹ اور none reasoning effort درج کرتی ہے؛ OpenAI ماڈل گائیڈ کوشش کے درجے کے مطابق logprob پیرامیٹر کی حدود بتاتی ہے۔
- [llama.cpp سرور README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI سے مطابقت رکھنے والا چیٹ endpoint اور image_url ان پٹ بیان کرتی ہے۔ یہاں عین backend/model ورژن کو آزادانہ طور پر چلا کر نہیں آزمایا گیا۔
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — ٹوکن امکانات کا پس منظر بیان کرتی ہے۔ OpenAI اس Cookbook مثال کو آرکائیو شدہ اور موجودہ ماڈل یا API کے لیے ممکنہ طور پر پرانا قرار دیتا ہے۔