AI-translated from English; not yet reviewed by a fluent editor.
# Ginagawang mga pagpipiliang may takdang uri ng Jev-like vision wrapper ang mga tanong tungkol sa larawan
> Gumagamit ang isang independiyenteng Python na halimbawa ng token probability ng vision model para magbalik ng mga desisyong may takdang uri mula sa mga larawan. Iniulat ng may-akda ang bilis nito sa webcam; hindi pa nasusubok ang katumpakan.
By BIG CHANGE Editorial
Published: 2026-09-26T10:09:47.074Z
Updated: 2026-09-26T10:09:47.074Z
Canonical: https://bigchange.ai/blog/jev-like-llm-vision-wrapper-logprobs

AI-generated conceptual illustration by BIG CHANGE.
Isang [halimbawa sa Python na inilathala noong Setyembre 25 ng developer na si Allan Riordan Boll](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) ang nagpapalawak sa Jev-style na decision request upang tumanggap ng mga kalakip na larawan. Ipinapadala nito ang bawat frame ng webcam sa vision model kasama ng maiikling tanong, saka ginagawang yes/no na value, pagpipilian o score ang mga posibilidad ng susunod na token ng modelo. Independiyenteng wrapper ang halimbawang ito, hindi vision feature ng Jev o pagsubok sa modelo ng Jev.
Para sa mga developer, mahalagang maunawaan ang hangganan ng pamamaraang ito. Maaaring sagutin ng vision model ang tanong na may mahigpit na limitasyon nang hindi gumagawa ng paglalarawan, pero nakadepende ang mga probabilidad ng bawat opsyon sa prompt, mga token na maaaring piliin at modelo. Nagbibigay ang post ng pattern na maaaring siyasatin, hindi pag-aaral ng katumpakan.
## Ang malaking pagbabago
- **Ano ang nagbago:** Inangkop ng isang developer sa mga larawan ang format ng maliliit na desisyong iniuugnay sa Jev, gamit ang pangkalahatang vision model. Kalakip ang larawan sa bawat request, habang ginagawang value na kayang gamitin ng software ng isang sagot na iisang letra ang biswal na tanong.
- **Bakit ito mahalaga:** Maaaring baguhin ng mga developer sa text ang biswal na pamantayan at tumanggap ng resultang may takdang uri nang hindi gumagawa ng hiwalay na image classifier para sa bawat tanong. Saklaw ng halimbawang ito ang nakikitang tao, halaman, kung nasa loob o labas, at liwanag ng eksena; hindi nito pinatutunayan kung gaano kaaasahan ang mga paghatol kapag ginamit sa ibang kamera o eksena.
- **Ano ang dapat bantayan:** Ang praktikal na tanong ay kung palagian bang ibinabalik ng napiling modelo at endpoint ang kinakailangang mga score ng alternatibong token para sa gawain. Dapat sukatin nang magkasama ang dami ng frame kada segundo at kalidad ng desisyon sa mga larawang kumakatawan sa aktuwal na gamit bago pagbatayan ng kilos ang resulta ng webcam.
## Paano gumagana ang paghatol sa larawan
[Sa gabay sa mabilis na pagsisimula ng Jev ng TypeSafe AI](https://docs.typesafe.ai/introduction/quickstart) inilalarawan ang isang `state` at hanay ng uri ng tanong na may takdang `questions`: `noul` para sa yes/no na value, `choice` para sa mga pinangalanang pagpipilian at `score` para sa nakaayos na mga antas. Ginagamit ng script ni Boll ang mga pangalang iyon at nagdaragdag ng array na `attachments` naglalaman ng mga path ng larawan o base64 data URL. Dagdag niya ang field na iyon sa request object; inilalarawan ng binanggit na mabilisang gabay ng Jev ang text state pero hindi nito idinadokumento ang field bilang input ng Jev API.
Para sa bawat tanong, bumubuo ang script ng prompt na may mga pagpipiliang may letra gaya ng `[A] true` at `[B] false`. Inuutusan nito ang modelo na sumagot gamit ang pinakamainam na letra at binabasa ang `top_logprobs` ng unang output token. Ini-exponentiate nito ang ibinalik na log probability, iniaayon ang mga timbang sa kabuuan ng mga nakalistang letra at ibinabalik ang mga ito sa uri ng tanong. Ibinabalik ng `choice` ang opsyong may pinakamataas na timbang at distribusyon nito. Ibinabalik ng `noul` ang timbang para sa `true`. Ibinabalik naman ng `score` ang weighted average ng nakaayos na mga antas. Tinatanggihan ng script ang tugon kapag maaari pa ring magkaroon ng malaking timbang ang mga opsyong token na hindi ibinalik.
Ibinibigay ang larawan sa bawat tanong. Hiwalay na request ang ipinapadala ng halimbawa sa halip na kunin ang lahat ng sagot sa iisang model call. Ginagamit ng OpenAI path nito ang Responses API kasama ang `input_image`, `top_logprobs` at `message.output_text.logprobs`; ginagamit naman ng lokal na llama.cpp path ang Chat Completions kasama ang content item na `image_url` at log probabilities. Inilalarawan sa [gabay ng OpenAI sa mga larawan](https://developers.openai.com/api/docs/guides/images-vision) ang base64 image data URL, at inilalarawan sa [sanggunian ng Responses](https://developers.openai.com/api/reference/resources/responses/methods/create) ang output ng log probability at pinakamataas na 20 alternatibong ibinabalik kada posisyon ng token. Inilalarawan sa [dokumentasyon ng server ng llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) ang mga URL ng larawan sa chat interface nito. Sinusuportahan ng mga sangguniang ito ang pattern ng request; hindi namin pinatakbo ang halimbawa sa alinmang endpoint.
## Ano ang sinusukat ng halimbawa sa webcam
Kumukuha ang script ng frame sa pamamagitan ng OpenCV, kino-convert ito sa JPEG at nagtatanong ng apat na bagay: kung may nakikitang tao o halaman, kung nasa loob o labas ng gusali ang eksena, at kung gaano ito kaliwanag. Sinusuri ng background worker ang tig-iisang frame habang tuloy ang preview. Linux V4L2 ang ginagamit sa setup ng kamera, kaya hindi magagamit ang inilathalang file sa lahat ng webcam nang walang pagbabago. Tatlong tanong kada frame ang sinasabi sa teksto ng artikulo, pero apat ang nasa inilathalang code; code ang pinagbatayan dito sa pagbibilang.
Iniulat ni Boll na humigit-kumulang **isang sinusuring frame kada segundo** ang nakukuha niya gamit ang Gemma 4 12B QAT model na pinapatakbo nang lokal sa RTX 3090, at humigit-kumulang **0.2 frame kada segundo** gamit ang GPT-6 Luna na naka-host. Iminumungkahi niyang maaaring makaapekto sa resulta ng naka-host na modelo ang paulit-ulit na pagkonekta. Walang kontroladong paghahambing sa post ng hardware, network, laki ng larawan, caching, katumpakan o oras ng request. Inilalarawan ng mga bilang ang setup at code ng may-akdang ito, hindi pangkalahatang ranggo ng bilis ng mga modelo. [Inililista ng OpenAI na tumatanggap ng input ng larawan ang GPT-6 Luna](https://developers.openai.com/api/docs/models/gpt-6-luna), at sinasabi sa [gabay nito para sa modelo](https://developers.openai.com/api/docs/guides/latest-model) na sinusuportahan ng Luna ang setting ng `none` reasoning na ginamit sa halimbawa.
Para sa developer na mag-aangkop ng script, malinaw ang mga unang pagsusuri: tiyaking tumatanggap ng input ng larawan ang modelo at inilalantad nito ang kinakailangang mga alternatibo para sa unang token; tiyaking lumalabas ang lahat ng letra ng opsyon; saka suriin ang mga ibinalik na desisyon gamit ang mga larawang may label mula sa nilalayong kamera o dataset. Kaugnay lamang sa mga nakalistang letra ang mga timbang na inayon sa kabuuan. Hindi sila, sa ganang sarili, mga nasukat na probabilidad na tama ang biswal na paghatol. Ipinapaliwanag ng [mas lumang logprobs cookbook ng OpenAI](https://developers.openai.com/cookbook/examples/using_logprobs) ang ideya ng token probability pero minarkahan na itong naka-archive at maaaring may mga halimbawang API na lipas na.
Nililinaw din ng wrapper kung ano ang ipinauubaya ng resultang may takdang uri sa code ng application. Hinahatulan ng modelo ang ibinigay na larawan ayon sa nakasulat na pamantayan. Ang application ang pumipili ng mga frame, humahawak sa nawawalang score at nagpapasiya kung ligtas nang aksiyunan ang resulta. Talahanayan ang inilalabas ng halimbawa ni Boll; hindi ito nag-uulat ng awtomatikong aksiyon o nasukat na deployment.
## Mga sanggunian at karagdagang babasahin
- [Allan Riordan Boll, “Isang Jev-like wrapper para sa mga LLM, kabilang ang mga vision model,” Setyembre 25, 2026](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html): orihinal na Python na halimbawa, workflow ng webcam at mga bilis ng frame na iniulat ng may-akda. Tatlong tanong kada frame ang sinasabi sa prosa; apat ang nasa code. Hindi independiyente o kontroladong benchmark ang mga oras na iniulat.
- [TypeSafe AI, mabilis na pagsisimula sa Jev](https://docs.typesafe.ai/introduction/quickstart): inilalarawan ang text state at mga uri ng tanong na `noul`, `choice` at `score` . Hindi nito idinadokumento bilang feature ng Jev API ang pasadyang field na `attachments`.
- [OpenAI, Mga larawan at vision](https://developers.openai.com/api/docs/guides/images-vision): inilalarawan ang `input_image`, mga URL ng larawan at base64 data URL bilang input para sa vision. [Sanggunian ng Responses API](https://developers.openai.com/api/reference/resources/responses/methods/create) ang naglalarawan sa `message.output_text.logprobs` at limitasyon sa mga ibinabalik na alternatibo.
- [OpenAI, modelo ng GPT-6 Luna at gabay para rito](https://developers.openai.com/api/docs/models/gpt-6-luna): kinukumpirma ang input ng larawan at setting nitong `none` sa reasoning; inilalarawan sa [gabay para sa modelo](https://developers.openai.com/api/docs/guides/latest-model) ang detalye tungkol sa pagiging tugma ng parameter. Hindi pinatutunayan ng mga dokumentong ito ang bilis na iniulat ng may-akda ng blog.
- [Dokumentasyon ng server ng llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md): inilalarawan ang chat endpoint na tugma sa OpenAI at input ng URL ng larawan. Kailangan pa ring suriin ang suporta ng backend at mga ibinabalik na token list gamit ang eksaktong bersiyon at modelong gagamitin.
- [OpenAI Cookbook, Paggamit ng logprobs](https://developers.openai.com/cookbook/examples/using_logprobs): paliwanag sa konteksto ng token probability. Minarkahan ng OpenAI na naka-archive ang recipe na ito at nagbabala itong maaaring luma na ang mga halimbawa nito para sa kasalukuyang modelo o API.
## Sources
- [Allan Riordan Boll: Isang Jev-like wrapper para sa mga LLM, kabilang ang mga vision model](https://allanrbo.blogspot.com/2026/09/a-jev-like-wrapper-for-llms-including.html) — Orihinal at independiyenteng Python code at mga obserbasyon ng may-akda sa webcam. Apat na tanong ang nasa code bagaman tatlo ang sinasabi sa nakapaligid na prosa; walang kontroladong benchmark o independiyenteng pag-aaral ng katumpakan.
- [TypeSafe AI: mabilis na pagsisimula sa Jev](https://docs.typesafe.ai/introduction/quickstart) — Inilalarawan ang text state, mga uri ng tanong at halimbawang request body. Nagdaragdag ng mga attachment ang may-akda ng blog sa sarili niyang Jev-like request object; hindi idinadokumento sa mabilisang gabay ang field na iyon.
- [OpenAI: Mga larawan at vision](https://developers.openai.com/api/docs/guides/images-vision) — Inilalarawan ang input ng larawan at mga base64 data URL. Sinusuportahan nito ang pattern ng request, hindi ang bilis na naobserbahan ng may-akda.
- [OpenAI: Gumawa ng model response](https://developers.openai.com/api/reference/resources/responses/methods/create) — Inilalarawan ang input ng larawan, message.output_text.logprobs at hanggang 20 nangungunang log probability kada posisyon ng token; kung minsan ay mas kaunti ang ibinabalik.
- [OpenAI: GPT-6 Luna at gabay para sa modelo](https://developers.openai.com/api/docs/models/gpt-6-luna) — Inililista ang input ng larawan at none reasoning effort; ipinapaliwanag sa gabay ng OpenAI para sa modelo ang mga limitasyon ng logprob parameter ayon sa effort.
- [README ng server ng llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) — Inilalarawan ang chat endpoint na tugma sa OpenAI at input na image_url. Hindi namin sinubukan nang hiwalay dito ang eksaktong backend/model version.
- [OpenAI Cookbook: Paggamit ng logprobs](https://developers.openai.com/cookbook/examples/using_logprobs) — Paliwanag sa konteksto ng token probability. Minarkahan ng OpenAI na naka-archive ang halimbawang cookbook na ito at posibleng luma na para sa mga kasalukuyang modelo o API.
Newsletter ng BIG CHANGE
Ang kabuuang larawan, sa sarili mong bilis.
Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Privacy mo, pasya mo.
Tumutulong ang kinakailangang storage na panatilihing ligtas ang site at tandaan ang mga pinili mo. Nananatiling naka-off ang opsyonal na Google Analytics hangga’t hindi mo ito pinapahintulutan. Mababasa mo ang lahat ng kuwento gamit lamang ang kinakailangang storage. Mga detalye tungkol sa privacy