Jedan Pajton primer koji je 25. septembra objavio programer Allan Riordan Boll proširuje Jev-sličan zahtev za odluku dodavanjem slika. Svaku sliku sa veb-kamere šalje vizijskom modelu uz kratka pitanja, a verovatnoće sledećeg tokena modela pretvara u vrednost da/ne, izbor ili ocenu. Primer je nezavisan omotač, a ne Jev funkcija za viziju niti test Jev modela.

Za programere je korisno da znaju granice ove tehnike. Vizijski model može da odgovori na ograničeno pitanje bez pisanja opisa, ali vraćene verovatnoće opcija zavise od upita, dostupnih alternativnih tokena i modela. Objava pokazuje obrazac koji se može ispitati, a ne studiju tačnosti.

Velika promena

  • Šta se promenilo:Jedan programer je primenio na slike format malih odluka povezan sa Jev-om, koristeći opšte vizijske modele. Slika se prilaže svakom zahtevu, a odgovor od jednog slova pretvara vizuelno pitanje u vrednost koju softver može da obradi.
  • Zašto je važno:Programeri mogu tekstom da menjaju vizuelni kriterijum i dobiju tipizovan rezultat bez pravljenja posebnog klasifikatora slika za svako pitanje. Ovaj primer obuhvata vidljivost ljudi i biljaka, okruženje u zatvorenom ili na otvorenom i osvetljenost; on ne pokazuje koliko pouzdano te procene važe za druge kamere ili scene.
  • Šta pratiti:Praktično pitanje je da li izabrani model i krajnja tačka dovoljno dosledno vraćaju potrebne ocene alternativnih tokena za konkretan zadatak. Propusnost kadrova i kvalitet odluka treba meriti zajedno na reprezentativnim slikama pre nego što rezultat veb-kamere pokrene neku radnju.

Kako funkcioniše odluka na osnovu slike

TypeSafe AI Jev brzi početni vodič dokumentuje jedan tipizovani state i skup tipizovanih questions pitanja: noul za vrednost da/ne, choice za imenovane alternative i score za uređene nivoe. Boll-ova skripta koristi te nazive i dodaje niz putanja slika ili base64 URL-ova podataka, polje attachments. To polje je njegovo proširenje objekta zahteva; citirani Jev brzi početni vodič opisuje tekstualno stanje, ali ga ne dokumentuje kao Jev API ulaz.

Za svako pitanje skripta pravi upit sa opcijama označenim slovima, kao što su [A] true i [B] false. Traži od modela da odgovori najboljim slovom i čita prvi izlazni token u top_logprobs. Stepenuje vraćene logaritamske verovatnoće, normalizuje težine među navedenim slovima i povezuje ih sa tipom pitanja. choice vraća opciju sa najvećom težinom i njenu raspodelu. noul vraća težinu za true. score vraća ponderisani prosek uređenih nivoa. Skripta odbacuje odgovor ako izostavljeni tokeni opcija i dalje mogu imati značajnu težinu.

Slika se dostavlja uz svako pitanje. Primer šalje odvojene zahteve umesto da dobije sve odgovore u jednom pozivu modelu. OpenAI putanja koristi Responses API sa input_image, top_logprobs i message.output_text.logprobs; lokalna llama.cpp putanja koristi Chat Completions sa stavkom sadržaja image_url i logaritamskim verovatnoćama. OpenAI vodič za slike dokumentuje base64 URL-ove podataka slika, a njegova referenca za Responses opisuje izlaz logaritamskih verovatnoća i najviše 20 vraćenih alternativa po poziciji tokena. Dokumentacija llama.cpp servera opisuje URL-ove slika u interfejsu za razgovor. Ovi izvori podržavaju obrazac zahteva; primer nismo pokrenuli ni na jednoj od tih krajnjih tačaka.

Šta meri primer sa veb-kamerom

Skripta snima kadar pomoću OpenCV-a, kodira ga kao JPEG i postavlja četiri pitanja: da li se vidi osoba ili biljka, da li je okruženje u zatvorenom ili na otvorenom i koliko je osvetljeno. Pozadinski proces procenjuje jedan po jedan kadar dok se pregled nastavlja. Podešavanje kamere koristi Linux V4L2, pa objavljena datoteka nije prenosivo podešavanje veb-kamere bez izmena. Tekst članka navodi tri pitanja po kadru, ali objavljeni kod sadrži četiri; ovde broj zasnivamo na kodu.

Boll navodi oko jedan procenjeni kadar u sekundi sa lokalno pokrenutim modelom Gemma 4 12B QAT na RTX 3090 i oko 0,2 kadra u sekundi sa hostovanim GPT-6 Luna modelom. On sugeriše da ponovljena povezivanja mogu uticati na rezultat hostovanog modela. Objava ne sadrži kontrolisano poređenje hardvera, mreže, veličine slike, keširanja, tačnosti ili vremena zahteva. Ovi brojevi opisuju podešavanje i kod ovog autora, a ne opštu rang-listu brzine modela. OpenAI navodi da GPT-6 Luna prihvata ulazne slike, a njegov vodič za model kaže da Luna podržava none postavku reasoning korišćenu u primeru.

Programer koji prilagođava skriptu prvo treba konkretno da proveri sledeće: da li model prihvata slike i izlaže potrebne alternative prvog tokena; da li se pojavljuju sva slova opcija; a zatim da proceni vraćene odluke na označenim slikama sa nameravane kamere ili skupa podataka. Normalizovane težine su relativne u odnosu na navedene tokene slova. Same po sebi, one nisu izmerene verovatnoće da je vizuelna procena tačna. OpenAI-jev stariji logprobs cookbook objašnjava ideju verovatnoća tokena, ali je označen kao arhiviran i može sadržati zastarele API primere.

Ovaj omotač takođe razjašnjava šta tipizovani rezultat prepušta kodu aplikacije. Model procenjuje dostavljenu sliku prema pisanom kriterijumu. Aplikacija bira kadrove, obrađuje nedostajuće ocene i odlučuje da li je neki rezultat dovoljno bezbedan za pokretanje radnje. Boll-ov primer prikazuje tabelu; ne navodi automatizovanu radnju niti izmerenu primenu.

Izvori i dodatna literatura