AI-translated from English; not yet reviewed by a fluent editor.
# غلاف رؤية شبيه بـJev يحوّل أسئلة الصور إلى خيارات محددة الأنواع
> يستخدم مثال مستقل بلغة Python احتمالات رموز نموذج الرؤية لإرجاع قرارات محددة الأنواع من الصور. ومعدلات كاميرا الويب منقولة عن الكاتب، فيما لم تُختبر الدقة.
By BIG CHANGE Editorial
Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

AI-generated conceptual illustration by BIG CHANGE.
مثال بلغة [Python نشره المطور Allan Riordan Boll في 25 سبتمبر](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) يوسّع طلب اتخاذ القرار على طريقة Jev بإضافة صور. ويرسل كل إطار من كاميرا الويب إلى نموذج للرؤية مصحوباً بأسئلة قصيرة، ثم يحوّل احتمالات الرمز التالي في مخرجات النموذج إلى قيمة نعم/لا أو خيار أو درجة. وهذا غلاف مستقل، وليس ميزة رؤية في Jev ولا اختباراً لنموذج Jev.
تكمن الفائدة للمطورين في حدود هذه التقنية. إذ يمكن لنموذج الرؤية الإجابة عن سؤال مقيّد من دون كتابة وصف، لكن احتمالات الخيارات المعادة تعتمد على صياغة الطلب والرموز البديلة المتاحة والنموذج. ويقدم المنشور نمطاً عملياً يمكن فحصه، لا دراسة للدقة.
## التغيير الأبرز
- **ما الذي تغيّر:** طبّق مطور تنسيق القرارات الصغيرة المرتبط بـJev على الصور باستخدام نماذج رؤية عامة. وتُرفق الصورة بكل طلب، بينما تحوّل إجابة من حرف واحد سؤالاً بصرياً إلى قيمة يمكن للبرنامج التعامل معها.
- **لماذا يهم ذلك:** يستطيع المطورون تغيير المعيار البصري نصياً والحصول على نتيجة محددة النوع من دون إنشاء مصنف صور منفصل لكل سؤال. ويغطي هذا المثال ظهور أشخاص أو نباتات، ومكان المشهد، ومستوى السطوع؛ لكنه لا يثبت مدى موثوقية نقل هذه الأحكام إلى كاميرات أو مشاهد أخرى.
- **ما الذي ينبغي متابعته:** يتمثل القرار العملي في معرفة ما إذا كان النموذج ونقطة النهاية المختاران يعيدان درجات الرموز البديلة المطلوبة باتساق يكفي للمهمة. وينبغي قياس معدل الإطارات وجودة القرار معاً، على صور ممثلة، قبل أن تؤدي نتيجة كاميرا الويب إلى إجراء ما.
## كيف يعمل القرار المستند إلى الصورة
[دليل البدء السريع لـJev من TypeSafe AI](https://docs.typesafe.ai/introduction/quickstart) يوثّق حالة `state` ومجموعة من الأسئلة المحددة الأنواع `questions`، وهي الأنواع التالية: `noul` لقيمة نعم/لا، `choice` للخيارات المسماة و `score` للمستويات المرتبة. ويستخدم سكريبت Boll هذه الأسماء ويضيف مصفوفة `attachments` تحتوي مسارات الصور أو عناوين URL لبيانات الصور بترميز base64. وهذا الحقل إضافة من Boll إلى كائن الطلب؛ فدليل Jev المذكور يصف حالة النص ولا يوثق الحقل بوصفه مدخلاً لواجهة Jev البرمجية.
يبني السكريبت لكل سؤال موجّهاً يتضمن خيارات بحروف، مثل `[A] true` و `[B] false`. ويطلب من النموذج الإجابة بأفضل حرف، ثم يقرأ أول حقل لاحتمالات الرمز التالي `top_logprobs`. ويرفع قيم الاحتمالات اللوغاريتمية المعادة إلى الأس، ويطبّع الأوزان بين الحروف المذكورة، ثم يعيد ربطها بنوع السؤال. ويعيد النوع `choice` الخيار ذا الوزن الأعلى وتوزيعه. أما `noul` فيعيد الوزن الخاص بـ `true`. أما `score` فيعيد متوسطاً مرجحاً للمستويات المرتبة. ويرفض السكريبت الإجابة إذا كان من الممكن أن تحمل رموز خيارات محذوفة وزناً مؤثراً.
تُرفق الصورة بكل سؤال. ويرسل المثال طلبات منفصلة بدلاً من الحصول على جميع الإجابات في استدعاء واحد للنموذج. ويستخدم مسار OpenAI واجهة Responses API مع `input_image`، `top_logprobs` و `message.output_text.logprobs`؛ أما مساره المحلي عبر llama.cpp فيستخدم Chat Completions مع `image_url` بوصفه عنصراً للمحتوى، إضافةً إلى احتمالات الرموز. [دليل OpenAI للصور والرؤية](https://developers.openai.com/api/docs/guides/images-vision) يوثق عناوين URL لبيانات الصور بترميز base64، كما يوثق [مرجع Responses API](https://developers.openai.com/api/reference/resources/responses/methods/create) مخرجات الاحتمالات اللوغاريتمية والحد الأقصى البالغ 20 خياراً معاداً لكل موضع رمز. ويوثق [دليل خادم llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) عناوين URL للصور في واجهة المحادثة. تدعم هذه المصادر نمط الطلب؛ ولم ننفذ المثال على أي من نقطتي النهاية.
## ما الذي يقيسه مثال كاميرا الويب
يلتقط السكريبت إطاراً باستخدام OpenCV، ويرمّزه بصيغة JPEG، ويطرح أربعة أسئلة: هل يظهر شخص أو نبات؟ وهل المكان داخلي أم خارجي؟ وما مستوى سطوعه؟ ويقيّم عامل في الخلفية إطاراً واحداً كل مرة بينما تستمر المعاينة. ويستخدم إعداد الكاميرا Linux V4L2، لذا لا يمكن تشغيل الملف المنشور على كاميرات الويب المختلفة بلا تعديلات. ويذكر نص المقال ثلاثة أسئلة لكل إطار، لكن الشيفرة المنشورة تتضمن أربعة؛ واعتمدنا الشيفرة أساساً لهذا العدد.
ويذكر Boll معدلًا يقارب **إطاراً واحداً مُقيّماً في الثانية** عند تشغيل نموذج Gemma 4 12B QAT محلياً على بطاقة RTX 3090، ونحو **0.2 إطار في الثانية** باستخدام GPT-6 Luna المستضاف. ويرى أن تكرار الاتصالات قد يسهم في النتيجة المستضافة. ولا يقدم المنشور مقارنة مضبوطة للأجهزة أو الشبكة أو حجم الصور أو التخزين المؤقت أو الدقة أو توقيت الطلبات. وتصف هذه الأرقام إعداد الكاتب وشيفرته، ولا تمثل ترتيباً عاماً لسرعة النماذج. [تدرج OpenAI نموذج GPT-6 Luna ضمن النماذج التي تقبل الصور](https://developers.openai.com/api/docs/models/gpt-6-luna)، وتوضح [إرشادات النماذج](https://developers.openai.com/api/docs/guides/latest-model) أن Luna يدعم إعداد الاستدلال `none` المستخدم في المثال.
وعلى المطور الذي يكيّف السكريبت إجراء فحوص محددة أولاً: التأكد من أن النموذج يقبل الصور ويتيح درجات البدائل المطلوبة للرمز الأول؛ والتحقق من ظهور جميع حروف الخيارات؛ ثم تقييم القرارات المعادة باستخدام صور معنونة من الكاميرا أو مجموعة البيانات المقصودة. والأوزان المطبّعة نسبية إلى رموز الحروف المدرجة. وهي ليست، بمفردها، احتمالات مقاسة لصحة الحكم البصري. وتشرح وصفة OpenAI الأقدم حول [logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) فكرة احتمالات الرموز، لكنها مؤرشفة وقد تتضمن أمثلة لواجهات API قديمة.
يوضح هذا الغلاف أيضاً ما يتركه الناتج المحدد النوع لشيفرة التطبيق. إذ يحكم النموذج على الصورة المقدمة وفق المعيار المكتوب. ويختار التطبيق الإطارات، ويتعامل مع الدرجات المفقودة، ويقرر إن كانت أي نتيجة آمنة بما يكفي لاتخاذ إجراء. ويطبع مثال Boll جدولاً؛ ولا يعرض إجراءً آلياً أو تجربة تشغيل مقاسة.
## المصادر ومزيد من القراءة
- [Allan Riordan Boll، «غلاف شبيه بـJev للنماذج اللغوية الكبيرة، بما فيها نماذج الرؤية»، 25 سبتمبر 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): مثال Python الأصلي، وسير عمل كاميرا الويب، ومعدلات الإطارات التي أبلغ عنها الكاتب. يذكر النص ثلاثة أسئلة لكل إطار؛ وتعرّف الشيفرة أربعة. وهذه التوقيتات ليست معياراً مستقلاً أو مضبوطاً.
- [TypeSafe AI، دليل البدء السريع لـJev](https://docs.typesafe.ai/introduction/quickstart): يوثّق حالة النص وأنواع الأسئلة `noul`، `choice` و`score`. ولا يوثّق الحقل المخصص الذي أضافه الكاتب `attachments` بوصفه ميزة في واجهة Jev البرمجية.
- [OpenAI، الصور والرؤية](https://developers.openai.com/api/docs/guides/images-vision): يوثق `input_image`، عناوين الصور وبياناتها بترميز base64 للمدخلات البصرية. [مرجع Responses API](https://developers.openai.com/api/reference/resources/responses/methods/create) يصف `message.output_text.logprobs` وقيود عدد البدائل المعادة.
- [OpenAI، نموذج GPT-6 Luna وإرشادات النماذج](https://developers.openai.com/api/docs/models/gpt-6-luna): يؤكد قبول الصور وإعداد الاستدلال `none` للنموذج؛ وتفصّل [إرشادات النماذج](https://developers.openai.com/api/docs/guides/latest-model) توافق المعلمات. ولا تتحقق هذه الوثائق من معدل المعالجة الذي أبلغ عنه كاتب المدونة.
- [توثيق خادم llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): يشرح نقطة نهاية المحادثة المتوافقة مع OpenAI ومدخل image\_url. وما زال يلزم التحقق من دعم الواجهة الخلفية وقائمة الرموز المعادة على الإصدار والنموذج المستخدمين تحديداً.
- [وصفة OpenAI، استخدام logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): شرح خلفي لاحتمالات الرموز. وتصف OpenAI هذه الوصفة بأنها مؤرشفة وتحذر من أن بعض النماذج أو واجهات API قديمة.
## Sources
- [Allan Riordan Boll: غلاف شبيه بـJev للنماذج اللغوية الكبيرة، بما فيها نماذج الرؤية](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — مثال Python مستقل أصلي وملاحظات الكاتب عن كاميرا الويب. تحدد الشيفرة أربعة أسئلة رغم أن النص المصاحب يقول ثلاثة؛ ولا يتضمن المثال معياراً مضبوطاً أو دراسة مستقلة للدقة.
- [TypeSafe AI: دليل البدء السريع لـJev](https://docs.typesafe.ai/introduction/quickstart) — يوثق حالة النص وأنواع الأسئلة ونموذج جسم الطلب. ويضيف كاتب المدونة مرفقات إلى كائن طلبه الخاص الشبيه بـJev؛ ولا يوثق هذا الدليل ذلك الحقل.
- [OpenAI: الصور والرؤية](https://developers.openai.com/api/docs/guides/images-vision) — يوثق مدخلات الصور وعناوين URL لبياناتها بترميز base64. ويدعم نمط الطلب، لا معدل المعالجة الذي أبلغ عنه الكاتب.
- [OpenAI: إنشاء استجابة نموذج](https://developers.openai.com/api/reference/resources/responses/methods/create) — يوثق مدخلات الصور، وmessage.output_text.logprobs، وما يصل إلى 20 من أعلى الاحتمالات اللوغاريتمية لكل موضع رمز، وقد يكون العدد أقل.
- [OpenAI: GPT-6 Luna وإرشادات النماذج](https://developers.openai.com/api/docs/models/gpt-6-luna) — يسرد مدخلات الصور وجهد الاستدلال none؛ وتوضح إرشادات OpenAI حدود معلمات logprobs بحسب جهد الاستدلال.
- [README لخادم llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — يوثق نقطة نهاية المحادثة المتوافقة مع OpenAI ومدخل image_url. ولم تُختبر الواجهة الخلفية والنموذج بإصدار محدد بصورة مستقلة هنا.
- [OpenAI Cookbook: استخدام logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — خلفية عن احتمالات الرموز. وتضع OpenAI مثال الوصفة في الأرشيف وتحذر من أنه قد يكون قديماً لبعض النماذج أو واجهات API الحالية.
نشرة BIG CHANGE البريدية
الصورة الأوسع. على وتيرتك.
قصص حديثة عن الذكاء الاصطناعي والروبوتات، وتحولات تستحق المتابعة، وأفكار عملية للتطبيق. اختر موجزًا يوميًا أو خلاصة أسبوعية أو رؤية شهرية.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
خصوصيتك، خيارك.
يساعد التخزين الضروري على حماية الموقع وتذكّر خياراتك. تظل Google Analytics الاختيارية متوقفة حتى تسمح بها. يمكنك قراءة كل قصة باستخدام التخزين الضروري فقط. تفاصيل الخصوصية