உலகம் நின்றுவிடவில்லை.RSS
BIG CHANGE.

Markdown பதிப்பு

AI-translated from English; not yet reviewed by a fluent editor.

# Jev போன்ற பார்வைச் சுற்றி, படக் கேள்விகளை வகைசார் தேர்வுகளாக மாற்றுகிறது

> தனித்த Python எடுத்துக்காட்டு, பார்வை மாதிரியின் டோக்கன் நிகழ்தகவுகளைப் பயன்படுத்தி படங்களிலிருந்து வகைசார் முடிவுகளைத் தருகிறது. வெப்கேம் வேகங்கள் ஆசிரியர் தெரிவித்தவை; துல்லியம் சோதிக்கப்படவில்லை.

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

ஒரு [டெவலப்பர் Allan Riordan Boll செப்டம்பர் 25 அன்று வெளியிட்ட Python எடுத்துக்காட்டு ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)Jev பாணி முடிவு கோரிக்கையில் பட இணைப்புகளைச் சேர்க்கிறது. ஒவ்வொரு வெப்கேம் ஃபிரேமையும் சுருக்கமான கேள்விகளுடன் பார்வை மாதிரிக்கு அனுப்பி, மாதிரியின் அடுத்த டோக்கன் நிகழ்தகவுகளை ஆம்/இல்லை மதிப்பு, தேர்வு அல்லது மதிப்பெண்ணாக மாற்றுகிறது. இது தனித்த சுற்றி; Jev பார்வை அம்சமோ Jev மாதிரியின் சோதனையோ அல்ல.

டெவலப்பர்களுக்கு இந்த உத்தியின் வரம்பைப் புரிந்துகொள்வது பயனுள்ளது. விளக்கத்தை எழுதாமலேயே பார்வை மாதிரி கட்டுப்படுத்தப்பட்ட கேள்விக்குப் பதிலளிக்கலாம்; ஆனால் திரும்பும் தேர்வு நிகழ்தகவுகள் prompt, கிடைக்கக்கூடிய டோக்கன் மாற்றுகள், மாதிரி ஆகியவற்றைப் பொறுத்தவை. இந்தப் பதிவு ஆய்வு செய்யக்கூடிய செயல்முறையை அளிக்கிறது; துல்லிய ஆய்வை அல்ல.

## முக்கிய மாற்றம்

- **என்ன மாறியது:**ஒரு டெவலப்பர் Jev-உடன் தொடர்புடைய சிறு முடிவு வடிவத்தைப் பொதுவான பார்வை மாதிரிகளைப் பயன்படுத்திப் படங்களுக்கு விரிவாக்கியுள்ளார். ஒவ்வொரு கோரிக்கையிலும் படம் இணைக்கப்படுகிறது; ஒற்றை எழுத்துப் பதில் பார்வைக் கேள்வியை மென்பொருள் கையாளக்கூடிய மதிப்பாக மாற்றுகிறது.
- **இது ஏன் முக்கியம்:**ஒவ்வொரு கேள்விக்கும் தனிப் பட வகைப்படுத்தியை உருவாக்காமல், டெவலப்பர்கள் உரையில் பார்வை அளவுகோலை மாற்றி வகைசார் முடிவைப் பெறலாம். இந்த எடுத்துக்காட்டு மனிதர் அல்லது செடி தெரிவது, இடம் உள்ளகமா வெளிப்புறமா, வெளிச்சம் எவ்வளவு என்பவற்றை உள்ளடக்குகிறது; வேறு கேமராக்கள் அல்லது காட்சிகளிலும் அந்தத் தீர்ப்புகள் நம்பகமாகப் பொருந்துமா என்பதை இது நிறுவவில்லை.
- **கவனிக்க வேண்டியது:**தேர்ந்தெடுத்த மாதிரியும் endpoint-மும் பணிக்குத் தேவையான மாற்று-டோக்கன் மதிப்பெண்களைப் போதிய நிலைத்தன்மையுடன் தருகின்றனவா என்பதே நடைமுறை முடிவு. வெப்கேம் முடிவு ஒரு செயலைத் தூண்டுவதற்கு முன், பிரதிநிதித்துவப் படங்களில் ஃபிரேம் செயல்திறனையும் முடிவுத் தரத்தையும் ஒன்றாக அளவிட வேண்டும்.

## பட முடிவு எவ்வாறு செயல்படுகிறது

[TypeSafe AI-இன் Jev விரைவு தொடக்க வழிகாட்டி](https://docs.typesafe.ai/introduction/quickstart) ஒரு வகைசார் `state` மற்றும் வகைசார் `questions` கேள்வித் தொகுப்பை ஆவணப்படுத்துகிறது: `noul` ஆம்/இல்லை மதிப்புக்கு, `choice` பெயரிடப்பட்ட மாற்றுகளுக்கு, `score` வரிசைப்படுத்தப்பட்ட நிலைகளுக்கு. Boll-இன் ஸ்கிரிப்ட் அந்தப் பெயர்களைப் பயன்படுத்தி, படப் பாதைகள் அல்லது base64 தரவு URL-களின் அணிவரிசையான `attachments` ஐச் சேர்க்கிறது. அந்தப் புலம் கோரிக்கைப் பொருளில் அவர் செய்த விரிவாக்கம்; மேற்கோள் காட்டப்பட்ட Jev விரைவு தொடக்கம் உரைநிலையை விளக்குகிறது, இதை Jev API உள்ளீடாக ஆவணப்படுத்தவில்லை.

ஒவ்வொரு கேள்விக்கும், உதாரணமாக `[A] true` மற்றும் `[B] false` போன்ற எழுத்து குறிக்கப்பட்ட தேர்வுகளுடன் ஸ்கிரிப்ட் prompt உருவாக்குகிறது. சிறந்த எழுத்தால் பதிலளிக்க மாதிரியைக் கேட்டு, முதல் வெளியீட்டு டோக்கனின் `top_logprobs`ஐ வாசிக்கிறது. திரும்பிய log நிகழ்தகவுகளை அடுக்குக்குறியாக்கி, பட்டியலிட்ட எழுத்துகளுக்கு இடையில் எடைகளைச் சீராக்கி, கேள்வி வகையுடன் பொருத்துகிறது. `choice` அதிக எடையுள்ள தேர்வையும் அதன் பகிர்வையும் தருகிறது. `noul` இதற்கான எடையைத் தருகிறது `true`. `score` வரிசைப்படுத்தப்பட்ட நிலைகளின் எடையிட்ட சராசரியைத் தருகிறது. விடுபட்ட தேர்வு டோக்கன்களுக்கும் குறிப்பிடத்தக்க எடை இருக்கலாம் என்றால் ஸ்கிரிப்ட் பதிலை நிராகரிக்கிறது.

ஒவ்வொரு கேள்வியுடனும் படம் வழங்கப்படுகிறது. ஒரே மாதிரி அழைப்பில் எல்லா பதில்களையும் பெறுவதற்குப் பதிலாக எடுத்துக்காட்டு தனித்தனி கோரிக்கைகளை அனுப்புகிறது. OpenAI பாதை Responses API-ஐ `input_image`, `top_logprobs` மற்றும் `message.output_text.logprobs`உடன் பயன்படுத்துகிறது; உள்ளூர் llama.cpp பாதை Chat Completions-ஐ `image_url` உள்ளடக்க உருப்படி மற்றும் log நிகழ்தகவுகளுடன் பயன்படுத்துகிறது. [OpenAI-இன் பட வழிகாட்டி](https://developers.openai.com/api/docs/guides/images-vision) base64 படத் தரவு URL-களை ஆவணப்படுத்துகிறது; அதன் [Responses குறிப்பு](https://developers.openai.com/api/reference/resources/responses/methods/create) log நிகழ்தகவு வெளியீட்டையும் ஒவ்வொரு டோக்கன் இடத்திலும் அதிகபட்சம் 20 மாற்றுகள் திரும்புவதையும் ஆவணப்படுத்துகிறது. [llama.cpp சேவையக ஆவணம்](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) அதன் உரையாடல் இடைமுகத்தில் பட URL-களை ஆவணப்படுத்துகிறது. இந்த ஆதாரங்கள் கோரிக்கை முறையை ஆதரிக்கின்றன; இரண்டு endpoint-களிலும் எடுத்துக்காட்டை இயக்கிப் பார்க்கவில்லை.

## வெப்கேம் எடுத்துக்காட்டு அளவிடுவது என்ன

ஸ்கிரிப்ட் OpenCV மூலம் ஒரு ஃபிரேமைப் பிடித்து JPEG ஆக குறியாக்கம் செய்து நான்கு கேள்விகளைக் கேட்கிறது: மனிதரோ செடியோ தெரிகிறதா, இடம் உள்ளகமா வெளிப்புறமா, வெளிச்சம் எவ்வளவு. முன்னோட்டம் தொடரும்போது பின்னணி செயலி ஒரு நேரத்தில் ஒரு ஃபிரேமை மதிப்பிடுகிறது. கேமரா அமைப்பு Linux V4L2-ஐப் பயன்படுத்துவதால், வெளியிடப்பட்ட கோப்பு மாற்றமின்றி எல்லா இடங்களிலும் பயன்படும் வெப்கேம் அமைப்பு அல்ல. கட்டுரையின் உரை ஒவ்வொரு ஃபிரேமுக்கும் மூன்று கேள்விகள் என்கிறது; வெளியிடப்பட்ட குறியீட்டில் நான்கு உள்ளன. இங்கு எண்ணிக்கைக்கு குறியீடே அடிப்படை.

Boll சுமார் **வினாடிக்கு ஒரு மதிப்பிடப்பட்ட ஃபிரேம்** RTX 3090-இல் உள்ளூரில் வழங்கப்பட்ட Gemma 4 12B QAT மாதிரியுடன் பெற்றதாகவும், சுமார்  **வினாடிக்கு 0.2 ஃபிரேம்கள்** hosted GPT-6 Luna-வில் பெற்றதாகவும் தெரிவிக்கிறார். மீண்டும் மீண்டும் இணைப்பது hosted முடிவில் பங்களிக்கலாம் என அவர் கூறுகிறார். வன்பொருள், நெட்வொர்க், பட அளவு, caching, துல்லியம் அல்லது கோரிக்கை நேரம் குறித்த கட்டுப்படுத்தப்பட்ட ஒப்பீட்டை பதிவு வழங்கவில்லை. இந்த எண்கள் ஆசிரியரின் அமைப்பையும் குறியீட்டையும் விவரிக்கின்றன; மாதிரிகளின் பொதுவான வேகத் தரவரிசை அல்ல. [GPT-6 Luna பட உள்ளீட்டை ஏற்கிறது என OpenAI குறிப்பிடுகிறது](https://developers.openai.com/api/docs/models/gpt-6-luna), அதன் [மாதிரி வழிகாட்டி](https://developers.openai.com/api/docs/guides/latest-model) Luna எடுத்துக்காட்டில் பயன்படுத்திய `none` reasoning அமைப்பை ஆதரிக்கிறது என்கிறது.

ஸ்கிரிப்டை மாற்றியமைக்கும் டெவலப்பர் முதலில் தெளிவான சோதனைகளைச் செய்ய வேண்டும்: மாதிரி பட உள்ளீட்டை ஏற்று முதல் டோக்கனுக்குத் தேவையான மாற்றுகளை வழங்குகிறதா என்பதை உறுதிப்படுத்தவும்; எல்லா தேர்வு எழுத்துகளும் உள்ளனவா பார்க்கவும்; பின்னர் இலக்கு கேமரா அல்லது தரவுத்தொகுப்பின் குறியிடப்பட்ட படங்களில் திரும்பிய முடிவுகளை மதிப்பிடவும். சீராக்கப்பட்ட எடைகள் பட்டியலிட்ட எழுத்து டோக்கன்களுடன் ஒப்பிடப்பட்டவை. அவை மட்டும் பார்வைத் தீர்ப்பு சரியானது என்பதற்கான அளவிடப்பட்ட நிகழ்தகவுகள் அல்ல. OpenAI-இன் [பழைய logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)டோக்கன் நிகழ்தகவு கருத்தை விளக்குகிறது; ஆனால் காப்பகமாகக் குறிக்கப்பட்டுள்ளதால் API எடுத்துக்காட்டுகள் காலாவதியாகியிருக்கலாம்.

வகைசார் முடிவு கிடைத்த பிறகு பயன்பாட்டுக் குறியீடு என்ன செய்ய வேண்டும் என்பதையும் இந்தச் சுற்றி தெளிவுபடுத்துகிறது. வழங்கிய படத்தை எழுதப்பட்ட அளவுகோலுடன் மாதிரி ஒப்பிடுகிறது. பயன்பாடு ஃபிரேம்களைத் தேர்ந்தெடுத்து, இல்லாத மதிப்பெண்களைக் கையாள்ந்து, எந்த முடிவு செயல்படப் போதிய பாதுகாப்பானது எனத் தீர்மானிக்கிறது. Boll-இன் எடுத்துக்காட்டு அட்டவணையை அச்சிடுகிறது; தானியக்கச் செயல் அல்லது அளவிடப்பட்ட பயன்பாட்டை அறிக்கையிடவில்லை.

## ஆதாரங்களும் மேலதிக வாசிப்பும்

- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” செப்டம்பர் 25, 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): மூல Python எடுத்துக்காட்டு, வெப்கேம் பணிச்சுற்று, ஆசிரியர் தெரிவித்த ஃபிரேம் வேகங்கள். உரை ஒவ்வொரு ஃபிரேமுக்கும் மூன்று கேள்விகள் என்கிறது; குறியீடு நான்கை வரையறுக்கிறது. நேர அளவீடுகள் சுயாதீனமான அல்லது கட்டுப்படுத்தப்பட்ட benchmark அல்ல.
- [TypeSafe AI, Jev விரைவு தொடக்கம்](https://docs.typesafe.ai/introduction/quickstart): உரைநிலையையும் `noul`, `choice` மற்றும் `score`கேள்வி வகைகளையும் ஆவணப்படுத்துகிறது. ஆசிரியரின் தனிப்பயன் `attachments`புலத்தை Jev API அம்சமாக ஆவணப்படுத்தவில்லை.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): `input_image`, பட URL-கள், பார்வை உள்ளீட்டுக்கான base64 தரவு URL-களை ஆவணப்படுத்துகிறது. [Responses API குறிப்பு](https://developers.openai.com/api/reference/resources/responses/methods/create) விளக்குகிறது `message.output_text.logprobs`மற்றும் திரும்பும் மாற்றுகளின் வரம்பை விவரிக்கிறது.
- [OpenAI, GPT-6 Luna மாதிரியும் மாதிரி வழிகாட்டியும்](https://developers.openai.com/api/docs/models/gpt-6-luna): பட உள்ளீட்டையும் மாதிரியின் `none`reasoning அமைப்பையும் உறுதிப்படுத்துகிறது; [மாதிரி வழிகாட்டி](https://developers.openai.com/api/docs/guides/latest-model)அளவுரு பொருந்துதலை விளக்குகிறது. இந்த ஆவணங்கள் வலைப்பதிவு ஆசிரியரின் செயல்திறனைச் சரிபார்க்கவில்லை.
- [llama.cpp சேவையக ஆவணம்](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): OpenAI-உடன் பொருந்தும் உரையாடல் endpoint மற்றும் பட URL உள்ளீட்டை விவரிக்கிறது. பயன்படுத்தும் துல்லியமான பதிப்பிலும் மாதிரியிலும் backend ஆதரவும் திரும்பும் டோக்கன் பட்டியலும் சரிபார்க்கப்பட வேண்டும்.
- [OpenAI cookbook, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): டோக்கன் நிகழ்தகவுகளுக்கான பின்னணி விளக்கம். இந்த செய்முறை காப்பகமாகக் குறிக்கப்பட்டுள்ளது என்றும் சில மாதிரிகள் அல்லது API-களுக்குப் பழையதாக இருக்கலாம் என்றும் OpenAI எச்சரிக்கிறது.

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — சுயாதீனமான அசல் Python குறியீடும் ஆசிரியர் தெரிவித்த வெப்கேம் அவதானிப்புகளும். சுற்றியுள்ள உரை மூன்று கேள்விகள் என்கிறது; குறியீடு நான்கை வரையறுக்கிறது. கட்டுப்படுத்தப்பட்ட benchmark அல்லது சுயாதீன துல்லிய ஆய்வு இல்லை.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — உரைநிலை, கேள்வி வகைகள், கோரிக்கை உடலின் எடுத்துக்காட்டை ஆவணப்படுத்துகிறது. வலைப்பதிவு ஆசிரியர் தனது Jev போன்ற கோரிக்கைப் பொருளில் இணைப்புகளைச் சேர்க்கிறார்; இந்த விரைவு தொடக்கம் அந்தப் புலத்தை ஆவணப்படுத்தவில்லை.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — பட உள்ளீடு மற்றும் base64 தரவு URL-களை ஆவணப்படுத்துகிறது. கோரிக்கை முறையை ஆதரிக்கிறது; ஆசிரியர் தெரிவித்த செயல்திறனை அல்ல.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — பட உள்ளீடுகள், message.output_text.logprobs, ஒவ்வொரு டோக்கன் இடத்திலும் அதிகபட்சம் 20 (சில நேரங்களில் குறைவாக) top log probabilities-ஐ ஆவணப்படுத்துகிறது.
- [OpenAI: GPT-6 Luna மற்றும் மாதிரி வழிகாட்டி](https://developers.openai.com/api/docs/models/gpt-6-luna) — பட உள்ளீடும் none reasoning effort-உம் குறிப்பிடுகிறது; OpenAI மாதிரி வழிகாட்டி முயற்சி அளவைப் பொறுத்த logprob அளவுரு வரம்புகளை விளக்குகிறது.
- [llama.cpp சேவையக README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — OpenAI-உடன் பொருந்தும் உரையாடல் endpoint மற்றும் image_url உள்ளீட்டை ஆவணப்படுத்துகிறது. துல்லியமான backend/மாதிரி பதிப்பு இங்கு சுயாதீனமாக இயக்கிச் சோதிக்கப்படவில்லை.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — டோக்கன் நிகழ்தகவுகளுக்கான பின்னணி விளக்கம். தற்போதைய மாதிரிகள் அல்லது API-களுக்கு இந்த Cookbook எடுத்துக்காட்டு பழையதாக இருக்கக்கூடும் என OpenAI காப்பகமாகக் குறிக்கிறது.