Један Пајтон пример који је 25. септембра објавио програмер Allan Riordan Boll проширује Jev-сличан захтев за одлуку додавањем слика. Сваку слику са веб-камере шаље визијском моделу уз кратка питања, а вероватноће следећег токена модела претвара у вредност да/не, избор или оцену. Пример је независан омотач, а не Jev функција за визију нити тест Jev модела.
За програмере је корисно да знају границе ове технике. Визијски модел може да одговори на ограничено питање без писања описа, али враћене вероватноће опција зависе од упита, доступних алтернативних токена и модела. Објава показује образац који се може испитати, а не студију тачности.
Велика промена
- Шта се променило:Један програмер је применио на слике формат малих одлука повезан са Jev-ом, користећи опште визијске моделе. Слика се прилаже сваком захтеву, а одговор од једног слова претвара визуелно питање у вредност коју софтвер може да обради.
- Зашто је важно:Програмери могу текстом да мењају визуелни критеријум и добију типизован резултат без прављења посебног класификатора слика за свако питање. Овај пример обухвата видљивост људи и биљака, окружење у затвореном или на отвореном и осветљеност; он не показује колико поуздано те процене важе за друге камере или сцене.
- Шта пратити:Практично питање је да ли изабрани модел и крајња тачка довољно доследно враћају потребне оцене алтернативних токена за конкретан задатак. Пропусност кадрова и квалитет одлука треба мерити заједно на репрезентативним сликама пре него што резултат веб-камере покрене неку радњу.
Како функционише одлука на основу слике
TypeSafe AI Jev брзи почетни водич документује један типизовани state и скуп типизованих questions питања: noul за вредност да/не, choice за именоване алтернативе и score за уређене нивое. Boll-ова скрипта користи те називе и додаје низ путања слика или base64 URL-ова података, поље attachments. То поље је његово проширење објекта захтева; цитирани Jev брзи почетни водич описује текстуално стање, али га не документује као Jev API улаз.
За свако питање скрипта прави упит са опцијама означеним словима, као што су [A] true и [B] false. Тражи од модела да одговори најбољим словом и чита први излазни токен у top_logprobs. Степенује враћене логаритамске вероватноће, нормализује тежине међу наведеним словима и повезује их са типом питања. choice враћа опцију са највећом тежином и њену расподелу. noul враћа тежину за true. score враћа пондерисани просек уређених нивоа. Скрипта одбацује одговор ако изостављени токени опција и даље могу имати значајну тежину.
Слика се доставља уз свако питање. Пример шаље одвојене захтеве уместо да добије све одговоре у једном позиву моделу. OpenAI путања користи Responses API са input_image, top_logprobs и message.output_text.logprobs; локална llama.cpp путања користи Chat Completions са ставком садржаја image_url и логаритамским вероватноћама. OpenAI водич за слике документује base64 URL-ове података слика, а његова референца за Responses описује излаз логаритамских вероватноћа и највише 20 враћених алтернатива по позицији токена. Документација llama.cpp сервера описује URL-ове слика у интерфејсу за разговор. Ови извори подржавају образац захтева; пример нисмо покренули ни на једној од тих крајњих тачака.
Шта мери пример са веб-камером
Скрипта снима кадар помоћу OpenCV-а, кодира га као JPEG и поставља четири питања: да ли се види особа или биљка, да ли је окружење у затвореном или на отвореном и колико је осветљено. Позадински процес процењује један по један кадар док се преглед наставља. Подешавање камере користи Linux V4L2, па објављена датотека није преносиво подешавање веб-камере без измена. Текст чланка наводи три питања по кадру, али објављени код садржи четири; овде број заснивамо на коду.
Boll наводи око један процењени кадар у секунди са локално покренутим моделом Gemma 4 12B QAT на RTX 3090 и око 0,2 кадра у секунди са хостованим GPT-6 Luna моделом. Он сугерише да поновљена повезивања могу утицати на резултат хостованог модела. Објава не садржи контролисано поређење хардвера, мреже, величине слике, кеширања, тачности или времена захтева. Ови бројеви описују подешавање и код овог аутора, а не општу ранг-листу брзине модела. OpenAI наводи да GPT-6 Luna прихвата улазне слике, а његов водич за модел каже да Luna подржава none поставку reasoning коришћену у примеру.
Програмер који прилагођава скрипту прво треба конкретно да провери следеће: да ли модел прихвата слике и излаже потребне алтернативе првог токена; да ли се појављују сва слова опција; а затим да процени враћене одлуке на означеним сликама са намераване камере или скупа података. Нормализоване тежине су релативне у односу на наведене токене слова. Саме по себи, оне нису измерене вероватноће да је визуелна процена тачна. OpenAI-јев старији logprobs cookbook објашњава идеју вероватноћа токена, али је означен као архивиран и може садржати застареле API примере.
Овај омотач такође разјашњава шта типизовани резултат препушта коду апликације. Модел процењује достављену слику према писаном критеријуму. Апликација бира кадрове, обрађује недостајуће оцене и одлучује да ли је неки резултат довољно безбедан за покретање радње. Boll-ов пример приказује табелу; не наводи аутоматизовану радњу нити измерену примену.
Извори и додатна литература
- Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” 25. септембар 2026.: оригинални пример у Пајтону, ток рада са веб-камером и брзине кадрова које је навео аутор. Текст каже три питања по кадру; код дефинише четири. Времена нису независан нити контролисан бенчмарк.
- TypeSafe AI, Jev брзи почетни водич: документује текстуално стање и типове питања
noul,choiceиscore. Не документује прилагођено пољеattachmentsаутора као Jev API функцију. - OpenAI, Images and vision: документује
input_image, URL-ове слика и base64 URL-ове података за улаз слика. Референца Responses API-ја описујеmessage.output_text.logprobsи ограничење враћених алтернатива. - OpenAI, GPT-6 Luna модел и водич за модел: потврђује улаз слика и
noneпоставку reasoning-а; водич за модел наводи компатибилност параметара. Ови документи не потврђују проток који је пријавио аутор блога. - Документација llama.cpp сервера: описује OpenAI-компатибилну крајњу тачку за разговор и улаз URL-а слике. Подршку позадинског система и враћене листе токена треба проверити са тачном верзијом и моделом.
- OpenAI cookbook, Using logprobs: позадинско објашњење вероватноћа токена. OpenAI означава овај рецепт као архивиран и упозорава да неки модели или API-ји могу бити застарели.



