AI-translated from English; not yet reviewed by a fluent editor.

# Jev-sličan vizijski omotač pretvara pitanja o slikama u tipizovane izbore

> Nezavisan primer u Pajtonu koristi verovatnoće tokena vizijskog modela da vrati tipizovane odluke na osnovu slika. Brzine veb-kamere prijavljuje autor, a tačnost nije ispitana.

By BIG CHANGE Editorial

Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

![Conceptual charcoal illustration of a webcam clipped to a monitor and facing a leafy plant on a shelf.](https://bigchange.ai/api/media/file/jev-vision-webcam-plant-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Jedan [Pajton primer koji je 25. septembra objavio programer Allan Riordan Boll ](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html)proširuje Jev-sličan zahtev za odluku dodavanjem slika. Svaku sliku sa veb-kamere šalje vizijskom modelu uz kratka pitanja, a verovatnoće sledećeg tokena modela pretvara u vrednost da/ne, izbor ili ocenu. Primer je nezavisan omotač, a ne Jev funkcija za viziju niti test Jev modela.

Za programere je korisno da znaju granice ove tehnike. Vizijski model može da odgovori na ograničeno pitanje bez pisanja opisa, ali vraćene verovatnoće opcija zavise od upita, dostupnih alternativnih tokena i modela. Objava pokazuje obrazac koji se može ispitati, a ne studiju tačnosti.

## Velika promena

- **Šta se promenilo:**Jedan programer je primenio na slike format malih odluka povezan sa Jev-om, koristeći opšte vizijske modele. Slika se prilaže svakom zahtevu, a odgovor od jednog slova pretvara vizuelno pitanje u vrednost koju softver može da obradi.
- **Zašto je važno:**Programeri mogu tekstom da menjaju vizuelni kriterijum i dobiju tipizovan rezultat bez pravljenja posebnog klasifikatora slika za svako pitanje. Ovaj primer obuhvata vidljivost ljudi i biljaka, okruženje u zatvorenom ili na otvorenom i osvetljenost; on ne pokazuje koliko pouzdano te procene važe za druge kamere ili scene.
- **Šta pratiti:**Praktično pitanje je da li izabrani model i krajnja tačka dovoljno dosledno vraćaju potrebne ocene alternativnih tokena za konkretan zadatak. Propusnost kadrova i kvalitet odluka treba meriti zajedno na reprezentativnim slikama pre nego što rezultat veb-kamere pokrene neku radnju.

## Kako funkcioniše odluka na osnovu slike

[TypeSafe AI Jev brzi početni vodič](https://docs.typesafe.ai/introduction/quickstart) dokumentuje jedan tipizovani `state` i skup tipizovanih `questions` pitanja: `noul` za vrednost da/ne, `choice` za imenovane alternative i `score` za uređene nivoe. Boll-ova skripta koristi te nazive i dodaje niz putanja slika ili base64 URL-ova podataka, polje `attachments`. To polje je njegovo proširenje objekta zahteva; citirani Jev brzi početni vodič opisuje tekstualno stanje, ali ga ne dokumentuje kao Jev API ulaz.

Za svako pitanje skripta pravi upit sa opcijama označenim slovima, kao što su `[A] true` i `[B] false`. Traži od modela da odgovori najboljim slovom i čita prvi izlazni token u `top_logprobs`. Stepenuje vraćene logaritamske verovatnoće, normalizuje težine među navedenim slovima i povezuje ih sa tipom pitanja. `choice` vraća opciju sa najvećom težinom i njenu raspodelu. `noul` vraća težinu za `true`. `score` vraća ponderisani prosek uređenih nivoa. Skripta odbacuje odgovor ako izostavljeni tokeni opcija i dalje mogu imati značajnu težinu.

Slika se dostavlja uz svako pitanje. Primer šalje odvojene zahteve umesto da dobije sve odgovore u jednom pozivu modelu. OpenAI putanja koristi Responses API sa `input_image`, `top_logprobs` i `message.output_text.logprobs`; lokalna llama.cpp putanja koristi Chat Completions sa stavkom sadržaja `image_url` i logaritamskim verovatnoćama. [OpenAI vodič za slike](https://developers.openai.com/api/docs/guides/images-vision) dokumentuje base64 URL-ove podataka slika, a njegova [referenca za Responses](https://developers.openai.com/api/reference/resources/responses/methods/create) opisuje izlaz logaritamskih verovatnoća i najviše 20 vraćenih alternativa po poziciji tokena. [Dokumentacija llama.cpp servera](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) opisuje URL-ove slika u interfejsu za razgovor. Ovi izvori podržavaju obrazac zahteva; primer nismo pokrenuli ni na jednoj od tih krajnjih tačaka.

## Šta meri primer sa veb-kamerom

Skripta snima kadar pomoću OpenCV-a, kodira ga kao JPEG i postavlja četiri pitanja: da li se vidi osoba ili biljka, da li je okruženje u zatvorenom ili na otvorenom i koliko je osvetljeno. Pozadinski proces procenjuje jedan po jedan kadar dok se pregled nastavlja. Podešavanje kamere koristi Linux V4L2, pa objavljena datoteka nije prenosivo podešavanje veb-kamere bez izmena. Tekst članka navodi tri pitanja po kadru, ali objavljeni kod sadrži četiri; ovde broj zasnivamo na kodu.

Boll navodi oko **jedan procenjeni kadar u sekundi** sa lokalno pokrenutim modelom Gemma 4 12B QAT na RTX 3090 i oko  **0,2 kadra u sekundi** sa hostovanim GPT-6 Luna modelom. On sugeriše da ponovljena povezivanja mogu uticati na rezultat hostovanog modela. Objava ne sadrži kontrolisano poređenje hardvera, mreže, veličine slike, keširanja, tačnosti ili vremena zahteva. Ovi brojevi opisuju podešavanje i kod ovog autora, a ne opštu rang-listu brzine modela. [OpenAI navodi da GPT-6 Luna prihvata ulazne slike](https://developers.openai.com/api/docs/models/gpt-6-luna), a njegov [vodič za model](https://developers.openai.com/api/docs/guides/latest-model) kaže da Luna podržava `none` postavku reasoning korišćenu u primeru.

Programer koji prilagođava skriptu prvo treba konkretno da proveri sledeće: da li model prihvata slike i izlaže potrebne alternative prvog tokena; da li se pojavljuju sva slova opcija; a zatim da proceni vraćene odluke na označenim slikama sa nameravane kamere ili skupa podataka. Normalizovane težine su relativne u odnosu na navedene tokene slova. Same po sebi, one nisu izmerene verovatnoće da je vizuelna procena tačna. OpenAI-jev [stariji logprobs cookbook ](https://developers.openai.com/cookbook/examples/using_logprobs)objašnjava ideju verovatnoća tokena, ali je označen kao arhiviran i može sadržati zastarele API primere.

Ovaj omotač takođe razjašnjava šta tipizovani rezultat prepušta kodu aplikacije. Model procenjuje dostavljenu sliku prema pisanom kriterijumu. Aplikacija bira kadrove, obrađuje nedostajuće ocene i odlučuje da li je neki rezultat dovoljno bezbedan za pokretanje radnje. Boll-ov primer prikazuje tabelu; ne navodi automatizovanu radnju niti izmerenu primenu.

## Izvori i dodatna literatura

- [Allan Riordan Boll, “A Jev-like wrapper for LLMs, including vision models,” 25. septembar 2026.](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): originalni primer u Pajtonu, tok rada sa veb-kamerom i brzine kadrova koje je naveo autor. Tekst kaže tri pitanja po kadru; kod definiše četiri. Vremena nisu nezavisan niti kontrolisan benčmark.
- [TypeSafe AI, Jev brzi početni vodič](https://docs.typesafe.ai/introduction/quickstart): dokumentuje tekstualno stanje i tipove pitanja `noul`, `choice` i `score`. Ne dokumentuje prilagođeno polje `attachments` autora kao Jev API funkciju.
- [OpenAI, Images and vision](https://developers.openai.com/api/docs/guides/images-vision): dokumentuje `input_image`, URL-ove slika i base64 URL-ove podataka za ulaz slika. [Referenca Responses API-ja](https://developers.openai.com/api/reference/resources/responses/methods/create) opisuje `message.output_text.logprobs` i ograničenje vraćenih alternativa.
- [OpenAI, GPT-6 Luna model i vodič za model](https://developers.openai.com/api/docs/models/gpt-6-luna): potvrđuje ulaz slika i `none` postavku reasoning-a; [vodič za model](https://developers.openai.com/api/docs/guides/latest-model) navodi kompatibilnost parametara. Ovi dokumenti ne potvrđuju protok koji je prijavio autor bloga.
- [Dokumentacija llama.cpp servera](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): opisuje OpenAI-kompatibilnu krajnju tačku za razgovor i ulaz URL-a slike. Podršku pozadinskog sistema i vraćene liste tokena treba proveriti sa tačnom verzijom i modelom.
- [OpenAI cookbook, Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): pozadinsko objašnjenje verovatnoća tokena. OpenAI označava ovaj recept kao arhiviran i upozorava da neki modeli ili API-ji mogu biti zastareli.

## Sources

- [Allan Riordan Boll: A Jev-like wrapper for LLMs, including vision models](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — Nezavisan originalni Python kod i autorova zapažanja sa veb-kamere. Tekst oko koda kaže tri pitanja, dok kod definiše četiri; nema kontrolisanog benčmarka ni nezavisne studije tačnosti.
- [TypeSafe AI: Jev quick start](https://docs.typesafe.ai/introduction/quickstart) — Dokumentuje tekstualno stanje, tipove pitanja i primer tela zahteva. Autor bloga dodaje priloge svom Jev-sličnom objektu zahteva; ovaj vodič to polje ne dokumentuje.
- [OpenAI: Images and vision](https://developers.openai.com/api/docs/guides/images-vision) — Dokumentuje ulaz slika i base64 URL-ove podataka. Podržava obrazac zahteva, ne i brzinu koju je autor izmerio.
- [OpenAI: Create a model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — Dokumentuje ulaz slika, message.output_text.logprobs i do 20 najviših logaritamskih verovatnoća po poziciji tokena, ponekad manje.
- [OpenAI: GPT-6 Luna i vodič za model](https://developers.openai.com/api/docs/models/gpt-6-luna) — Navodi ulaz slika i none napor rasuđivanja; OpenAI-jev vodič za model objašnjava ograničenja logprob parametara u zavisnosti od napora.
- [llama.cpp server README](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — Dokumentuje OpenAI-kompatibilnu krajnju tačku za razgovor i image_url ulaz. Tačna verzija pozadinskog sistema/modela ovde nije nezavisno isprobana.
- [OpenAI Cookbook: Using logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — Pozadinsko objašnjenje verovatnoća tokena. OpenAI označava ovaj primer iz Cookbooks kao arhiviran i možda zastareo za trenutne modele ili API-je.
