ஒரு டெவலப்பர் Allan Riordan Boll செப்டம்பர் 25 அன்று வெளியிட்ட Python எடுத்துக்காட்டு Jev பாணி முடிவு கோரிக்கையில் பட இணைப்புகளைச் சேர்க்கிறது. ஒவ்வொரு வெப்கேம் ஃபிரேமையும் சுருக்கமான கேள்விகளுடன் பார்வை மாதிரிக்கு அனுப்பி, மாதிரியின் அடுத்த டோக்கன் நிகழ்தகவுகளை ஆம்/இல்லை மதிப்பு, தேர்வு அல்லது மதிப்பெண்ணாக மாற்றுகிறது. இது தனித்த சுற்றி; Jev பார்வை அம்சமோ Jev மாதிரியின் சோதனையோ அல்ல.

டெவலப்பர்களுக்கு இந்த உத்தியின் வரம்பைப் புரிந்துகொள்வது பயனுள்ளது. விளக்கத்தை எழுதாமலேயே பார்வை மாதிரி கட்டுப்படுத்தப்பட்ட கேள்விக்குப் பதிலளிக்கலாம்; ஆனால் திரும்பும் தேர்வு நிகழ்தகவுகள் prompt, கிடைக்கக்கூடிய டோக்கன் மாற்றுகள், மாதிரி ஆகியவற்றைப் பொறுத்தவை. இந்தப் பதிவு ஆய்வு செய்யக்கூடிய செயல்முறையை அளிக்கிறது; துல்லிய ஆய்வை அல்ல.

முக்கிய மாற்றம்

  • என்ன மாறியது:ஒரு டெவலப்பர் Jev-உடன் தொடர்புடைய சிறு முடிவு வடிவத்தைப் பொதுவான பார்வை மாதிரிகளைப் பயன்படுத்திப் படங்களுக்கு விரிவாக்கியுள்ளார். ஒவ்வொரு கோரிக்கையிலும் படம் இணைக்கப்படுகிறது; ஒற்றை எழுத்துப் பதில் பார்வைக் கேள்வியை மென்பொருள் கையாளக்கூடிய மதிப்பாக மாற்றுகிறது.
  • இது ஏன் முக்கியம்:ஒவ்வொரு கேள்விக்கும் தனிப் பட வகைப்படுத்தியை உருவாக்காமல், டெவலப்பர்கள் உரையில் பார்வை அளவுகோலை மாற்றி வகைசார் முடிவைப் பெறலாம். இந்த எடுத்துக்காட்டு மனிதர் அல்லது செடி தெரிவது, இடம் உள்ளகமா வெளிப்புறமா, வெளிச்சம் எவ்வளவு என்பவற்றை உள்ளடக்குகிறது; வேறு கேமராக்கள் அல்லது காட்சிகளிலும் அந்தத் தீர்ப்புகள் நம்பகமாகப் பொருந்துமா என்பதை இது நிறுவவில்லை.
  • கவனிக்க வேண்டியது:தேர்ந்தெடுத்த மாதிரியும் endpoint-மும் பணிக்குத் தேவையான மாற்று-டோக்கன் மதிப்பெண்களைப் போதிய நிலைத்தன்மையுடன் தருகின்றனவா என்பதே நடைமுறை முடிவு. வெப்கேம் முடிவு ஒரு செயலைத் தூண்டுவதற்கு முன், பிரதிநிதித்துவப் படங்களில் ஃபிரேம் செயல்திறனையும் முடிவுத் தரத்தையும் ஒன்றாக அளவிட வேண்டும்.

பட முடிவு எவ்வாறு செயல்படுகிறது

TypeSafe AI-இன் Jev விரைவு தொடக்க வழிகாட்டி ஒரு வகைசார் state மற்றும் வகைசார் questions கேள்வித் தொகுப்பை ஆவணப்படுத்துகிறது: noul ஆம்/இல்லை மதிப்புக்கு, choice பெயரிடப்பட்ட மாற்றுகளுக்கு, score வரிசைப்படுத்தப்பட்ட நிலைகளுக்கு. Boll-இன் ஸ்கிரிப்ட் அந்தப் பெயர்களைப் பயன்படுத்தி, படப் பாதைகள் அல்லது base64 தரவு URL-களின் அணிவரிசையான attachments ஐச் சேர்க்கிறது. அந்தப் புலம் கோரிக்கைப் பொருளில் அவர் செய்த விரிவாக்கம்; மேற்கோள் காட்டப்பட்ட Jev விரைவு தொடக்கம் உரைநிலையை விளக்குகிறது, இதை Jev API உள்ளீடாக ஆவணப்படுத்தவில்லை.

ஒவ்வொரு கேள்விக்கும், உதாரணமாக [A] true மற்றும் [B] false போன்ற எழுத்து குறிக்கப்பட்ட தேர்வுகளுடன் ஸ்கிரிப்ட் prompt உருவாக்குகிறது. சிறந்த எழுத்தால் பதிலளிக்க மாதிரியைக் கேட்டு, முதல் வெளியீட்டு டோக்கனின் top_logprobsஐ வாசிக்கிறது. திரும்பிய log நிகழ்தகவுகளை அடுக்குக்குறியாக்கி, பட்டியலிட்ட எழுத்துகளுக்கு இடையில் எடைகளைச் சீராக்கி, கேள்வி வகையுடன் பொருத்துகிறது. choice அதிக எடையுள்ள தேர்வையும் அதன் பகிர்வையும் தருகிறது. noul இதற்கான எடையைத் தருகிறது true. score வரிசைப்படுத்தப்பட்ட நிலைகளின் எடையிட்ட சராசரியைத் தருகிறது. விடுபட்ட தேர்வு டோக்கன்களுக்கும் குறிப்பிடத்தக்க எடை இருக்கலாம் என்றால் ஸ்கிரிப்ட் பதிலை நிராகரிக்கிறது.

ஒவ்வொரு கேள்வியுடனும் படம் வழங்கப்படுகிறது. ஒரே மாதிரி அழைப்பில் எல்லா பதில்களையும் பெறுவதற்குப் பதிலாக எடுத்துக்காட்டு தனித்தனி கோரிக்கைகளை அனுப்புகிறது. OpenAI பாதை Responses API-ஐ input_image, top_logprobs மற்றும் message.output_text.logprobsஉடன் பயன்படுத்துகிறது; உள்ளூர் llama.cpp பாதை Chat Completions-ஐ image_url உள்ளடக்க உருப்படி மற்றும் log நிகழ்தகவுகளுடன் பயன்படுத்துகிறது. OpenAI-இன் பட வழிகாட்டி base64 படத் தரவு URL-களை ஆவணப்படுத்துகிறது; அதன் Responses குறிப்பு log நிகழ்தகவு வெளியீட்டையும் ஒவ்வொரு டோக்கன் இடத்திலும் அதிகபட்சம் 20 மாற்றுகள் திரும்புவதையும் ஆவணப்படுத்துகிறது. llama.cpp சேவையக ஆவணம் அதன் உரையாடல் இடைமுகத்தில் பட URL-களை ஆவணப்படுத்துகிறது. இந்த ஆதாரங்கள் கோரிக்கை முறையை ஆதரிக்கின்றன; இரண்டு endpoint-களிலும் எடுத்துக்காட்டை இயக்கிப் பார்க்கவில்லை.

வெப்கேம் எடுத்துக்காட்டு அளவிடுவது என்ன

ஸ்கிரிப்ட் OpenCV மூலம் ஒரு ஃபிரேமைப் பிடித்து JPEG ஆக குறியாக்கம் செய்து நான்கு கேள்விகளைக் கேட்கிறது: மனிதரோ செடியோ தெரிகிறதா, இடம் உள்ளகமா வெளிப்புறமா, வெளிச்சம் எவ்வளவு. முன்னோட்டம் தொடரும்போது பின்னணி செயலி ஒரு நேரத்தில் ஒரு ஃபிரேமை மதிப்பிடுகிறது. கேமரா அமைப்பு Linux V4L2-ஐப் பயன்படுத்துவதால், வெளியிடப்பட்ட கோப்பு மாற்றமின்றி எல்லா இடங்களிலும் பயன்படும் வெப்கேம் அமைப்பு அல்ல. கட்டுரையின் உரை ஒவ்வொரு ஃபிரேமுக்கும் மூன்று கேள்விகள் என்கிறது; வெளியிடப்பட்ட குறியீட்டில் நான்கு உள்ளன. இங்கு எண்ணிக்கைக்கு குறியீடே அடிப்படை.

Boll சுமார் வினாடிக்கு ஒரு மதிப்பிடப்பட்ட ஃபிரேம் RTX 3090-இல் உள்ளூரில் வழங்கப்பட்ட Gemma 4 12B QAT மாதிரியுடன் பெற்றதாகவும், சுமார் வினாடிக்கு 0.2 ஃபிரேம்கள் hosted GPT-6 Luna-வில் பெற்றதாகவும் தெரிவிக்கிறார். மீண்டும் மீண்டும் இணைப்பது hosted முடிவில் பங்களிக்கலாம் என அவர் கூறுகிறார். வன்பொருள், நெட்வொர்க், பட அளவு, caching, துல்லியம் அல்லது கோரிக்கை நேரம் குறித்த கட்டுப்படுத்தப்பட்ட ஒப்பீட்டை பதிவு வழங்கவில்லை. இந்த எண்கள் ஆசிரியரின் அமைப்பையும் குறியீட்டையும் விவரிக்கின்றன; மாதிரிகளின் பொதுவான வேகத் தரவரிசை அல்ல. GPT-6 Luna பட உள்ளீட்டை ஏற்கிறது என OpenAI குறிப்பிடுகிறது, அதன் மாதிரி வழிகாட்டி Luna எடுத்துக்காட்டில் பயன்படுத்திய none reasoning அமைப்பை ஆதரிக்கிறது என்கிறது.

ஸ்கிரிப்டை மாற்றியமைக்கும் டெவலப்பர் முதலில் தெளிவான சோதனைகளைச் செய்ய வேண்டும்: மாதிரி பட உள்ளீட்டை ஏற்று முதல் டோக்கனுக்குத் தேவையான மாற்றுகளை வழங்குகிறதா என்பதை உறுதிப்படுத்தவும்; எல்லா தேர்வு எழுத்துகளும் உள்ளனவா பார்க்கவும்; பின்னர் இலக்கு கேமரா அல்லது தரவுத்தொகுப்பின் குறியிடப்பட்ட படங்களில் திரும்பிய முடிவுகளை மதிப்பிடவும். சீராக்கப்பட்ட எடைகள் பட்டியலிட்ட எழுத்து டோக்கன்களுடன் ஒப்பிடப்பட்டவை. அவை மட்டும் பார்வைத் தீர்ப்பு சரியானது என்பதற்கான அளவிடப்பட்ட நிகழ்தகவுகள் அல்ல. OpenAI-இன் பழைய logprobs cookbook டோக்கன் நிகழ்தகவு கருத்தை விளக்குகிறது; ஆனால் காப்பகமாகக் குறிக்கப்பட்டுள்ளதால் API எடுத்துக்காட்டுகள் காலாவதியாகியிருக்கலாம்.

வகைசார் முடிவு கிடைத்த பிறகு பயன்பாட்டுக் குறியீடு என்ன செய்ய வேண்டும் என்பதையும் இந்தச் சுற்றி தெளிவுபடுத்துகிறது. வழங்கிய படத்தை எழுதப்பட்ட அளவுகோலுடன் மாதிரி ஒப்பிடுகிறது. பயன்பாடு ஃபிரேம்களைத் தேர்ந்தெடுத்து, இல்லாத மதிப்பெண்களைக் கையாள்ந்து, எந்த முடிவு செயல்படப் போதிய பாதுகாப்பானது எனத் தீர்மானிக்கிறது. Boll-இன் எடுத்துக்காட்டு அட்டவணையை அச்சிடுகிறது; தானியக்கச் செயல் அல்லது அளவிடப்பட்ட பயன்பாட்டை அறிக்கையிடவில்லை.

ஆதாரங்களும் மேலதிக வாசிப்பும்

  • Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” செப்டம்பர் 25, 2026: மூல Python எடுத்துக்காட்டு, வெப்கேம் பணிச்சுற்று, ஆசிரியர் தெரிவித்த ஃபிரேம் வேகங்கள். உரை ஒவ்வொரு ஃபிரேமுக்கும் மூன்று கேள்விகள் என்கிறது; குறியீடு நான்கை வரையறுக்கிறது. நேர அளவீடுகள் சுயாதீனமான அல்லது கட்டுப்படுத்தப்பட்ட benchmark அல்ல.
  • TypeSafe AI, Jev விரைவு தொடக்கம்: உரைநிலையையும் noul, choice மற்றும் scoreகேள்வி வகைகளையும் ஆவணப்படுத்துகிறது. ஆசிரியரின் தனிப்பயன் attachmentsபுலத்தை Jev API அம்சமாக ஆவணப்படுத்தவில்லை.
  • OpenAI, Images and vision: input_image, பட URL-கள், பார்வை உள்ளீட்டுக்கான base64 தரவு URL-களை ஆவணப்படுத்துகிறது. Responses API குறிப்பு விளக்குகிறது message.output_text.logprobsமற்றும் திரும்பும் மாற்றுகளின் வரம்பை விவரிக்கிறது.
  • OpenAI, GPT-6 Luna மாதிரியும் மாதிரி வழிகாட்டியும்: பட உள்ளீட்டையும் மாதிரியின் nonereasoning அமைப்பையும் உறுதிப்படுத்துகிறது; மாதிரி வழிகாட்டிஅளவுரு பொருந்துதலை விளக்குகிறது. இந்த ஆவணங்கள் வலைப்பதிவு ஆசிரியரின் செயல்திறனைச் சரிபார்க்கவில்லை.
  • llama.cpp சேவையக ஆவணம்: OpenAI-உடன் பொருந்தும் உரையாடல் endpoint மற்றும் பட URL உள்ளீட்டை விவரிக்கிறது. பயன்படுத்தும் துல்லியமான பதிப்பிலும் மாதிரியிலும் backend ஆதரவும் திரும்பும் டோக்கன் பட்டியலும் சரிபார்க்கப்பட வேண்டும்.
  • OpenAI cookbook, Using logprobs: டோக்கன் நிகழ்தகவுகளுக்கான பின்னணி விளக்கம். இந்த செய்முறை காப்பகமாகக் குறிக்கப்பட்டுள்ளது என்றும் சில மாதிரிகள் அல்லது API-களுக்குப் பழையதாக இருக்கலாம் என்றும் OpenAI எச்சரிக்கிறது.