СВЕТ НЕ СТОЈИ У МЕСТУ.RSS
BIG CHANGE.

Markdown издање

AI-translated from English; not yet reviewed by a fluent editor.

# Jev-сличан визијски омотач претвара питања о сликама у типизоване изборе

> Независан пример у Пајтону користи вероватноће токена визијског модела да врати типизоване одлуке на основу слика. Брзине веб-камере пријављује аутор, а тачност није испитана.

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Један [Пајтон пример који је 25. септембра објавио програмер Allan Riordan Boll ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)проширује Jev-сличан захтев за одлуку додавањем слика. Сваку слику са веб-камере шаље визијском моделу уз кратка питања, а вероватноће следећег токена модела претвара у вредност да/не, избор или оцену. Пример је независан омотач, а не Jev функција за визију нити тест Jev модела.

За програмере је корисно да знају границе ове технике. Визијски модел може да одговори на ограничено питање без писања описа, али враћене вероватноће опција зависе од упита, доступних алтернативних токена и модела. Објава показује образац који се може испитати, а не студију тачности.

## Велика промена

- **Шта се променило:**Један програмер је применио на слике формат малих одлука повезан са Jev-ом, користећи опште визијске моделе. Слика се прилаже сваком захтеву, а одговор од једног слова претвара визуелно питање у вредност коју софтвер може да обради.
- **Зашто је важно:**Програмери могу текстом да мењају визуелни критеријум и добију типизован резултат без прављења посебног класификатора слика за свако питање. Овај пример обухвата видљивост људи и биљака, окружење у затвореном или на отвореном и осветљеност; он не показује колико поуздано те процене важе за друге камере или сцене.
- **Шта пратити:**Практично питање је да ли изабрани модел и крајња тачка довољно доследно враћају потребне оцене алтернативних токена за конкретан задатак. Пропусност кадрова и квалитет одлука треба мерити заједно на репрезентативним сликама пре него што резултат веб-камере покрене неку радњу.

## Како функционише одлука на основу слике

[TypeSafe AI Jev брзи почетни водич](https://docs.typesafe.ai/introduction/quickstart) документује један типизовани `state` и скуп типизованих `questions` питања: `noul` за вредност да/не, `choice` за именоване алтернативе и `score` за уређене нивое. Boll-ова скрипта користи те називе и додаје низ путања слика или base64 URL-ова података, поље `attachments`. То поље је његово проширење објекта захтева; цитирани Jev брзи почетни водич описује текстуално стање, али га не документује као Jev API улаз.

За свако питање скрипта прави упит са опцијама означеним словима, као што су `[A] true` и `[B] false`. Тражи од модела да одговори најбољим словом и чита први излазни токен у `top_logprobs`. Степенује враћене логаритамске вероватноће, нормализује тежине међу наведеним словима и повезује их са типом питања. `choice` враћа опцију са највећом тежином и њену расподелу. `noul` враћа тежину за `true`. `score` враћа пондерисани просек уређених нивоа. Скрипта одбацује одговор ако изостављени токени опција и даље могу имати значајну тежину.

Слика се доставља уз свако питање. Пример шаље одвојене захтеве уместо да добије све одговоре у једном позиву моделу. OpenAI путања користи Responses API са `input_image`, `top_logprobs` и `message.output_text.logprobs`; локална llama.cpp путања користи Chat Completions са ставком садржаја `image_url` и логаритамским вероватноћама. [OpenAI водич за слике](https://developers.openai.com/api/docs/guides/images-vision) документује base64 URL-ове података слика, а његова [референца за Responses](https://developers.openai.com/api/reference/resources/responses/methods/create) описује излаз логаритамских вероватноћа и највише 20 враћених алтернатива по позицији токена. [Документација llama.cpp сервера](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) описује URL-ове слика у интерфејсу за разговор. Ови извори подржавају образац захтева; пример нисмо покренули ни на једној од тих крајњих тачака.

## Шта мери пример са веб-камером

Скрипта снима кадар помоћу OpenCV-а, кодира га као JPEG и поставља четири питања: да ли се види особа или биљка, да ли је окружење у затвореном или на отвореном и колико је осветљено. Позадински процес процењује један по један кадар док се преглед наставља. Подешавање камере користи Linux V4L2, па објављена датотека није преносиво подешавање веб-камере без измена. Текст чланка наводи три питања по кадру, али објављени код садржи четири; овде број заснивамо на коду.

Boll наводи око **један процењени кадар у секунди** са локално покренутим моделом Gemma 4 12B QAT на RTX 3090 и око  **0,2 кадра у секунди** са хостованим GPT-6 Luna моделом. Он сугерише да поновљена повезивања могу утицати на резултат хостованог модела. Објава не садржи контролисано поређење хардвера, мреже, величине слике, кеширања, тачности или времена захтева. Ови бројеви описују подешавање и код овог аутора, а не општу ранг-листу брзине модела. [OpenAI наводи да GPT-6 Luna прихвата улазне слике](https://developers.openai.com/api/docs/models/gpt-6-luna), а његов [водич за модел](https://developers.openai.com/api/docs/guides/latest-model) каже да Luna подржава `none` поставку reasoning коришћену у примеру.

Програмер који прилагођава скрипту прво треба конкретно да провери следеће: да ли модел прихвата слике и излаже потребне алтернативе првог токена; да ли се појављују сва слова опција; а затим да процени враћене одлуке на означеним сликама са намераване камере или скупа података. Нормализоване тежине су релативне у односу на наведене токене слова. Саме по себи, оне нису измерене вероватноће да је визуелна процена тачна. OpenAI-јев [старији logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)објашњава идеју вероватноћа токена, али је означен као архивиран и може садржати застареле API примере.

Овај омотач такође разјашњава шта типизовани резултат препушта коду апликације. Модел процењује достављену слику према писаном критеријуму. Апликација бира кадрове, обрађује недостајуће оцене и одлучује да ли је неки резултат довољно безбедан за покретање радње. Boll-ов пример приказује табелу; не наводи аутоматизовану радњу нити измерену примену.

## Извори и додатна литература

- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” 25. септембар 2026.](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): оригинални пример у Пајтону, ток рада са веб-камером и брзине кадрова које је навео аутор. Текст каже три питања по кадру; код дефинише четири. Времена нису независан нити контролисан бенчмарк.
- [TypeSafe AI, Jev брзи почетни водич](https://docs.typesafe.ai/introduction/quickstart): документује текстуално стање и типове питања `noul`, `choice` и `score`. Не документује прилагођено поље `attachments` аутора као Jev API функцију.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): документује `input_image`, URL-ове слика и base64 URL-ове података за улаз слика. [Референца Responses API-ја](https://developers.openai.com/api/reference/resources/responses/methods/create) описује `message.output_text.logprobs` и ограничење враћених алтернатива.
- [OpenAI, GPT-6 Luna модел и водич за модел](https://developers.openai.com/api/docs/models/gpt-6-luna): потврђује улаз слика и `none` поставку reasoning-а; [водич за модел](https://developers.openai.com/api/docs/guides/latest-model) наводи компатибилност параметара. Ови документи не потврђују проток који је пријавио аутор блога.
- [Документација llama.cpp сервера](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): описује OpenAI-компатибилну крајњу тачку за разговор и улаз URL-а слике. Подршку позадинског система и враћене листе токена треба проверити са тачном верзијом и моделом.
- [OpenAI cookbook, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): позадинско објашњење вероватноћа токена. OpenAI означава овај рецепт као архивиран и упозорава да неки модели или API-ји могу бити застарели.

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — Независан оригинални Python код и ауторова запажања са веб-камере. Текст око кода каже три питања, док код дефинише четири; нема контролисаног бенчмарка ни независне студије тачности.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — Документује текстуално стање, типове питања и пример тела захтева. Аутор блога додаје прилоге свом Jev-сличном објекту захтева; овај водич то поље не документује.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — Документује улаз слика и base64 URL-ове података. Подржава образац захтева, не и брзину коју је аутор измерио.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — Документује улаз слика, message.output_text.logprobs и до 20 највиших логаритамских вероватноћа по позицији токена, понекад мање.
- [OpenAI: GPT-6 Luna и водич за модел](https://developers.openai.com/api/docs/models/gpt-6-luna) — Наводи улаз слика и none напор расуђивања; OpenAI-јев водич за модел објашњава ограничења logprob параметара у зависности од напора.
- [llama.cpp server README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — Документује OpenAI-компатибилну крајњу тачку за разговор и image_url улаз. Тачна верзија позадинског система/модела овде није независно испробана.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — Позадинско објашњење вероватноћа токена. OpenAI означава овај пример из Cookbooks као архивиран и можда застарео за тренутне моделе или API-је.