ایک ڈویلپر Allan Riordan Boll کی 25 ستمبر کو شائع کردہ Python مثال Jev طرز کی فیصلہ درخواست میں تصاویر منسلک کرتی ہے۔ یہ ہر ویب کیم فریم مختصر سوالات کے ساتھ وژن ماڈل کو بھیجتی ہے، پھر ماڈل کے اگلے ٹوکن کے امکانات کو ہاں/نہیں کی قدر، انتخاب یا اسکور میں بدلتی ہے۔ یہ ایک آزاد ریپر ہے، Jev کی وژن خصوصیت یا Jev ماڈل کا ٹیسٹ نہیں۔
ڈویلپرز کے لیے اس طریقے کی حد سمجھنا مفید ہے۔ وژن ماڈل وضاحت لکھے بغیر محدود سوال کا جواب دے سکتا ہے، لیکن واپس آنے والے انتخابی امکانات prompt، دستیاب متبادل ٹوکنز اور ماڈل پر منحصر ہوتے ہیں۔ یہ تحریر جانچنے کے لیے ایک کام کرنے کا طریقہ دیتی ہے، درستگی کا مطالعہ نہیں۔
بڑی تبدیلی
- کیا بدلا:ایک ڈویلپر نے Jev سے وابستہ چھوٹے فیصلے کے فارمیٹ کو عمومی وژن ماڈلز کے ذریعے تصاویر پر لاگو کیا ہے۔ ہر درخواست کے ساتھ تصویر منسلک ہوتی ہے، جبکہ ایک حرف کا جواب بصری سوال کو ایسی قدر میں بدل دیتا ہے جسے سافٹ ویئر سنبھال سکتا ہے۔
- یہ کیوں اہم ہے:ڈویلپر ہر سوال کے لیے الگ تصویری درجہ بند بنائے بغیر متن میں بصری معیار بدل سکتے ہیں اور متعین نوعیت کا نتیجہ حاصل کر سکتے ہیں۔ یہ مثال نظر آنے والے افراد اور پودوں، اندرونی یا بیرونی منظر، اور روشنی کو دیکھتی ہے؛ یہ ثابت نہیں کرتی کہ یہ فیصلے دوسرے کیمروں یا مناظر میں کتنی قابلِ اعتماد طور پر لاگو ہوں گے۔
- کس بات پر نظر رکھیں:عملی سوال یہ ہے کہ منتخب ماڈل اور endpoint کام کے لیے درکار متبادل ٹوکن اسکور کافی مستقل طور پر واپس کرتے ہیں یا نہیں۔ ویب کیم کا نتیجہ کسی عمل کو شروع کرنے سے پہلے نمائندہ تصاویر پر فریم کی رفتار اور فیصلے کے معیار کو ایک ساتھ ناپنا چاہیے۔
تصویر پر مبنی فیصلہ کیسے کام کرتا ہے
TypeSafe AI کی Jev فوری آغاز گائیڈ ایک متعین نوعیت کی state اور متعین نوعیت کے questions سوالات درج کرتی ہے: noul ہاں/نہیں قدر کے لیے، choice نام والے متبادل کے لیے، اور score ترتیب وار سطحوں کے لیے۔ Boll کی اسکرپٹ یہ نام استعمال کرتی ہے اور تصویر کے راستوں یا base64 ڈیٹا URL کی فہرست، یعنی attachments شامل کرتی ہے۔ یہ فیلڈ درخواست کے آبجیکٹ میں مصنف کی اپنی توسیع ہے؛ حوالہ دی گئی Jev فوری آغاز گائیڈ متنی حالت بیان کرتی ہے مگر اسے Jev API ان پٹ کے طور پر درج نہیں کرتی۔
ہر سوال کے لیے اسکرپٹ حروف کے نشان والے انتخابوں والا prompt بناتی ہے، مثلاً [A] true اور [B] false۔ یہ ماڈل سے بہترین حرف میں جواب مانگتی ہے اور پہلے آؤٹ پٹ ٹوکن کا top_logprobs پڑھتی ہے۔ یہ واپس آنے والے لاگ امکانات کا exponent لیتی، درج حروف کے درمیان وزن معمول پر لاتی، اور انہیں سوال کی نوعیت سے ملاتی ہے۔ choice سب سے زیادہ وزن والا انتخاب اور اس کی تقسیم واپس کرتا ہے۔ noul کا وزن واپس کرتا ہے true۔ score ترتیب وار سطحوں کی وزنی اوسط واپس کرتا ہے۔ اگر چھوڑے گئے انتخابی ٹوکنز میں اب بھی قابلِ ذکر وزن ہو سکتا ہو تو اسکرپٹ جواب مسترد کر دیتی ہے۔
ہر سوال کے ساتھ تصویر دی جاتی ہے۔ مثال تمام جواب ایک ہی ماڈل کال میں لینے کے بجائے الگ درخواستیں بھیجتی ہے۔ OpenAI راستہ Responses API کے ساتھ input_image, top_logprobs اور message.output_text.logprobsاستعمال کرتا ہے؛ مقامی llama.cpp راستہ Chat Completions کے ساتھ image_url مواد کی شے اور لاگ امکانات استعمال کرتا ہے۔ OpenAI کی تصویری گائیڈ base64 تصویری ڈیٹا URL بیان کرتی ہے، جبکہ اس کا Responses حوالہ لاگ امکان آؤٹ پٹ اور ہر ٹوکن مقام پر زیادہ سے زیادہ 20 متبادل واپس آنے کی وضاحت کرتا ہے۔ llama.cpp سرور کی دستاویزات اپنے چیٹ انٹرفیس میں تصویری URL بیان کرتی ہیں۔ یہ ذرائع درخواست کے طریقے کی تائید کرتے ہیں؛ ہم نے یہ مثال دونوں میں سے کسی endpoint پر نہیں چلائی۔
ویب کیم کی مثال کیا ناپتی ہے
اسکرپٹ OpenCV سے ایک فریم لیتی، اسے JPEG کے طور پر encode کرتی، اور چار سوال پوچھتی ہے: کیا کوئی شخص یا پودا نظر آتا ہے، منظر اندرونی ہے یا بیرونی، اور روشنی کتنی ہے۔ پیش منظر جاری رہنے کے دوران پس منظر کا عمل ایک وقت میں ایک فریم جانچتا ہے۔ کیمرے کی ترتیب Linux V4L2 استعمال کرتی ہے، اس لیے شائع شدہ فائل بغیر تبدیلی کے ہر جگہ قابلِ استعمال ویب کیم ترتیب نہیں۔ مضمون کا متن فی فریم تین سوال کہتا ہے، مگر شائع شدہ کوڈ میں چار ہیں؛ یہاں گنتی کی بنیاد کوڈ ہے۔
Boll کے مطابق تقریباً ہر سیکنڈ ایک فریم جانچا گیا RTX 3090 پر مقامی طور پر چلائے گئے Gemma 4 12B QAT ماڈل کے ساتھ، اور تقریباً ہر سیکنڈ 0.2 فریم میزبان GPT-6 Luna کے ساتھ ملے۔ وہ تجویز کرتے ہیں کہ بار بار کنکشن بنانا میزبان نتیجے میں حصہ ڈال سکتا ہے۔ پوسٹ ہارڈویئر، نیٹ ورک، تصویر کے سائز، کیشنگ، درستگی یا درخواست کے وقت کا کنٹرول شدہ موازنہ نہیں دیتی۔ یہ اعداد مصنف کے سیٹ اپ اور کوڈ کی وضاحت ہیں، ماڈلز کی عمومی رفتار کی درجہ بندی نہیں۔ OpenAI کے مطابق GPT-6 Luna تصویری ان پٹ قبول کرتا ہے، اور اس کی ماڈل گائیڈ کہتی ہے کہ Luna مثال میں استعمال شدہ none reasoning ترتیب کی حمایت کرتا ہے۔
اسکرپٹ میں ترمیم کرنے والے ڈویلپر کے لیے پہلی جانچیں واضح ہیں: تصدیق کریں کہ ماڈل تصویری ان پٹ قبول کرتا اور پہلے ٹوکن کے درکار متبادل فراہم کرتا ہے؛ دیکھیں کہ انتخاب کے تمام حروف آتے ہیں؛ پھر مطلوبہ کیمرے یا ڈیٹاسیٹ کی لیبل والی تصاویر پر فیصلوں کو جانچیں۔ معمول پر لائے گئے وزن درج حروف والے ٹوکنز کے مقابلے میں ہیں۔ وہ بذاتِ خود اس بات کے ناپے ہوئے امکانات نہیں کہ بصری فیصلہ درست ہے۔ OpenAI کی پرانی logprobs cookbook ٹوکن امکانات کا تصور بیان کرتی ہے مگر آرکائیو شدہ ہے اور API مثالیں پرانی ہو سکتی ہیں۔
یہ ریپر یہ بھی واضح کرتا ہے کہ متعین نوعیت کے نتیجے کے بعد ایپلیکیشن کوڈ کی کیا ذمہ داری ہے۔ ماڈل فراہم کردہ تصویر کو تحریری معیار پر پرکھتا ہے۔ ایپلیکیشن فریم چنتی، غائب اسکور سنبھالتی، اور طے کرتی ہے کہ کوئی نتیجہ عمل کے لیے کافی محفوظ ہے یا نہیں۔ Boll کی مثال جدول دکھاتی ہے؛ خودکار عمل یا ناپی ہوئی تعیناتی کی اطلاع نہیں دیتی۔
ذرائع اور مزید مطالعہ
- Allan Riordan Boll، “A Jev-like wrapper for LLMs, including vision models”، 25 ستمبر 2026: اصل Python مثال، ویب کیم کا طریقۂ کار، اور مصنف کی بتائی ہوئی فریم رفتار۔ متن فی فریم تین سوال کہتا ہے؛ کوڈ چار متعین کرتا ہے۔ اوقات آزادانہ یا کنٹرول شدہ benchmark نہیں ہیں۔
- TypeSafe AI، Jev فوری آغاز گائیڈ: متنی حالت اور سوال کی اقسام
noul,choiceاورscoreدرج کرتی ہے۔ یہ مصنف کے حسبِ ضرورتattachmentsفیلڈ کو Jev API خصوصیت نہیں بتاتی۔ - OpenAI، Images and vision:
input_image, تصویری URL اور وژن ان پٹ کے لیے base64 ڈیٹا URL بیان کرتی ہے۔ Responses API حوالہاس کی وضاحت کرتا ہےmessage.output_text.logprobsاور واپس آنے والے متبادلوں کی حد بیان کرتا ہے۔ - OpenAI، GPT-6 Luna ماڈل اور ماڈل گائیڈ: تصویری ان پٹ اور ماڈل کی
nonereasoning ترتیب کی تصدیق کرتی ہے؛ ماڈل گائیڈپیرامیٹر مطابقت بیان کرتی ہے۔ یہ دستاویزات بلاگ مصنف کی بتائی ہوئی رفتار کی تصدیق نہیں کرتیں۔ - llama.cpp سرور کی دستاویزات: OpenAI سے مطابقت رکھنے والا چیٹ endpoint اور تصویری URL ان پٹ بیان کرتی ہیں۔ عین استعمال شدہ ورژن اور ماڈل کے ساتھ backend کی معاونت اور واپس آنے والی ٹوکن فہرست کی جانچ ضروری ہے۔
- OpenAI cookbook، Using logprobs: ٹوکن امکانات کی پس منظر وضاحت۔ OpenAI اس نسخے کو آرکائیو شدہ قرار دیتا اور خبردار کرتا ہے کہ بعض ماڈل یا API معلومات پرانی ہو سکتی ہیں۔



