HINDI TUMITIGIL ANG MUNDO.RSS
BIG CHANGE.

Markdown edition

AI-translated from English; not yet reviewed by a fluent editor.

# Mas malaking taya ni Jev: mga pasya ng AI sa software na ginagamit na natin

> Ipinagtatanggol ni Diogo Almeida, CEO ng TypeSafe, ang AI na nakasentro sa maliliit na pasya sa loob ng software. Sinusuri namin ang paglulunsad ni Jev, mga limitasyon nito, at kung anong ebidensiya ang magpapatunay na makabuluhan ang pagbabago.

By BIG CHANGE Editorial

Published: 2026-09-22T00:45:03.943Z
Updated: 2026-09-22T00:45:03.943Z
Canonical: https://bigchange.ai/blog/jev-typesafe-ai-decisions-software-diogo-almeida

![Pencil sketch of document cards passing through a small decision switch, constrained by a checklist, into two output trays.](https://bigchange.ai/api/media/file/jev-interview-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE. A decision switch inside a larger workflow; not a depiction of Jev’s internal architecture.

Binago ng isang customer ang address sa order. Humihingi rin ang mensahe ng refund, bumabanggit ng sirang pakete, at nagpapahiwatig na ito na ang ikatlong pagkakataong nagkaproblema. Isang gawain ang gawing kapaki-pakinabang na tugon ang mensaheng iyon. Iba naman ang pagpapasya kung aling mga rekord ang babaguhin, aling pangkat ang dapat makialam, at aling mga kilos ang nangangailangan ng pahintulot.

Tinutugunan ni Jev, ang modelong inilunsad ng TypeSafe AI para sa maagang access noong Setyembre 15, 2026, ang mga pasyang iyon. Gumagawa ito ng mga sagot para sa software na may takdang format at hangganan. Hinihikayat ng paglulunsad na pag-isipan muli kung gaano kalaking bahagi ng isang aplikasyon ang dapat umasa sa mahabang pakikipag-usap sa modelong pangkalahatang gamit. [Anunsiyo ng paglulunsad ng TypeSafe](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

Pinakamalawak na tinalakay ang argumento sa panayam noong Setyembre 21 ng Latent Space kay Diogo Almeida, kapwa tagapagtatag at CEO ng TypeSafe, na pinangunahan ni swyx. Sinuri namin ang kumpletong mga subtitle sa Ingles ng usapang tumagal nang dalawang oras at 22 minuto at tiningnan ang dokumentasyon ng produkto. Pagsusuri ito sa panayam at pampublikong ebidensiya; hindi kami nagsagawa ng malayang benchmark kay Jev. [Panoorin ang orihinal na panayam](https://www.youtube.com/watch?v=cFx9Z3ZXca0)

Sa pagbasa namin, ang pinakamahalagang mungkahi ni Jev ay tungkol sa yunit ng awtomasyon. Maaaring maawtomatisa ng isang kumpanya ang isang limitadong pasya sa loob ng kasalukuyang proseso bago nito responsableng ipagkatiwala ang buong proseso. Kung magiging sapat na mura ang paulit-ulit na paggamit sa pasya at sapat na malinaw ang pagsukat dito, maaaring magkaroon ng kapaki-pakinabang na kakayahan ang pamilyar na software pangnegosyo nang hindi nagiging sesyon ng chat ang bawat ugnayan.

Makaaapekto ito kapwa sa mga nagdidisenyo ng workflow at sa mga gumagamit nito. Kailangan pa ring magpasya ng isang tao kung aling mga kilos ang pinapayagan, ano ang maituturing na pagkakamali, at sino ang hahawak sa mga eksepsiyon. Magtatakda ang kalidad ng mga pasyang iyon kung makalilikha ang paraang ito ng maaasahang serbisyo o magpapabilis lamang ng mga pagkakamali.

## Ano talaga ang inilunsad ng TypeSafe

Tumatanggap ang dokumentadong interface ni Jev ng estado at isang hanay ng mga tanong na may takdang uri. Tatlo ang pangunahing primitive nito: Choice, na pumipili mula sa mga tinukoy na opsiyon; Score, na sumusukat batay sa rubric; at Noul, na nagpapahayag ng posibilidad ng isang pahayag sa iskala mula sero hanggang isa. Nagbabalik ang Choice at Score ng mga distribusyon at field para sa confidence. Walang hiwalay na field ng confidence ang Noul. Maaaring gumamit ng iisang ibinigay na estado ang mga tanong habang magkakahiwalay na sinusuri. [Dokumentasyon ng interface ng TypeSafe](https://docs.typesafe.ai/introduction)

Sa aplikasyon para sa serbisyo sa customer, maaaring gamitin ng developer ang mga primitive na ito upang pag-ibahin ang kahilingan sa pagpapalit ng address at pagkansela, tasahin ang pagkaapurahan, at tingnan kung may ebidensiya ng pinsala sa mensahe. Mga halimbawang kathang-isip ito, hindi resulta ng pag-deploy kay Jev. Ang aplikasyon pa rin ang magpapasya kung ano ang gagawin sa mga sagot.

Kapaki-pakinabang ang paghihiwalay na ito dahil magkaibang responsibilidad ang pagbibigay-kahulugan at ang pagkakaroon ng awtoridad. Maaaring mahinuha ng AI na gusto ng customer ng refund. Hindi ito dapat bigyan ng pahintulot na mag-isyu nito dahil lamang nakabuo ito ng gayong konklusyon. Maaaring suriin ng aplikasyon ang order, ipatupad ang limitasyon sa refund, at humingi ng pag-apruba kung kinakailangan.

Tinatawag ng TypeSafe na System One ang kategoryang ito ng modelo, hango sa pananalita tungkol sa mabilis at likas na pag-iisip. Ituring ang pangalan bilang paglalarawan sa nilalayong uri ng gawain. Hindi ito sertipikasyon ng kaisipang tulad ng tao o malinaw na hangganan sa pagitan ng madali at mahirap na gawain. Maaaring ikubli ng maikling tanong ang masalimuot na pasya, lalo na kung kulang ang kinakailangang impormasyon.

## Mas maliliit at nasusuring pasya ang pagbabagong pang-inhinyeriya

Iminumungkahi ni Almeida na hati-hatiin ang gawain: magtanong nang makitid ang saklaw, saka pagsama-samahin sa code ang mga sagot. [Panayam, 1:03:02](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=3782s)

Balikan ang halimbawa ng sirang order. Itinatago ng iisang utos na asikasuhin ang reklamo ang ilang magkakaibang pasya sa loob ng iisang tugon. Mas madaling siyasatin kung hiwalay na itatakda ng disenyo ang hinihinging aksiyon, kung matutukoy ang order, at kung sinusuportahan ng makukuhang ebidensiya ang pahayag tungkol sa pinsala. Dapat manatiling hiwalay sa mga pasyang iyon ang mga tuntunin ng patakaran.

Dahil dito, mas madaling imbestigahan ang pagkabigo. Kung ililipat ng sistema sa pangkat sa pagbabalik ng produkto ang kahilingan sa pagpapalit ng address, masusuri ng operator ang pasya sa pagruruta. Kung mali ang pagtatasa sa pinsala, maaaring subukan ang bahaging iyon gamit ang mga naunang kaso. Maaaring baguhin ng pagbabago sa patakaran ang isang hayag na tuntunin nang hindi kailangang muling isulat ng pangkat ang malawak na utos at umasa na palagi itong bibigyang-kahulugan nang pare-pareho ng modelo.

May kaakibat itong gastos. Mas maraming bahagi ang mangangahulugan ng mas maraming interface na kailangang panatilihin. Maaaring hindi maisama sa mga tanong ang kontekstong kailangan upang luminaw ang sagot. Maaaring umasa sa iisang mapanlinlang na ebidensiya ang dalawang pasyang mukhang magkahiwalay. Maaari pa ring maghatid ng hindi katanggap-tanggap na resulta ang workflow na binuo mula sa mga bahaging katanggap-tanggap nang paisa-isa.

Kabilang sa mga dokumentadong pattern ng TypeSafe ang sabay-sabay na pagtatanong ng ilang bagay, pagsasama ng mga score, at pagpapasa ng mga hindi tiyak na kaso para sa karagdagang pag-asikaso. Inilalarawan ng mga ito ang mga posibleng arkitektura, hindi patunay na maaari nang patakbuhin nang walang bantay ang proseso ng isang partikular na customer. [Mga pattern ng TypeSafe](https://docs.typesafe.ai/patterns)

Ang kapaki-pakinabang na pagsubok ay kung napapahusay ng paghahati-hati kapwa ang pagsusuri sa sanhi at ang mga kinalabasan. Mahalaga ang maipaliwanag kung aling hakbang ang pumalya. Nakasalalay naman ang katwiran sa negosyo sa pagbawas ng dalas at bigat ng mga pagkabigong iyon.

![Pencil diagram: an input document branches into three parallel questions, whose answers enter a rules box before action or review.](/api/media/file/jev-interview-inline-v1.png)

## Maaari pa ring mali ang sagot na may wastong format

Kailangang makitid ang pagbasa sa pahayag sa paglulunsad na “hindi maaaring mag-hallucinate” si Jev. Inuugnay ng TypeSafe ang garantiya nito sa pagtutugma sa pinapayagang output schema. Hindi nito pinatutunayan ang katotohanan ng napiling sagot. Ibinubukod mismo ng anunsiyo ng kumpanya ang garantiya sa schema at ang empirikal na pagsusuri. [Paliwanag ng TypeSafe tungkol sa type safety](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

Ipagpalagay na pinapayagan ng isang aplikasyon ang mga halagang `damaged`, `late` at `other`. Ang pagbabalik ng `damaged` ay ganap na wasto kahit nahuli lamang ang pakete. Maaari pa ring pumili ng maling kategorya ang modelong hindi makapag-imbento ng pang-apat na kategorya. Kung wala sa listahan ang kategoryang talagang kailangan, nagiging bahagi mismo ng problema ang schema.

Umiiral na rin sa inhinyeriya ang structured output. Ipinakilala ng OpenAI noong Agosto 2024 ang Structured Outputs na may schema constraints at tahasang binanggit na maaari pa ring magkamali ang modelo sa mga ibinalik na halaga. Kaya dapat suriin si Jev batay sa partikular na kombinasyon nito ng kalidad ng pasya, pag-uulat ng kawalang-katiyakan, latency, at gastos; hindi ito dapat bigyan ng papuri sa pag-imbento sa lahat ng structured AI output. [Orihinal na anunsiyo at mga limitasyon ng OpenAI](https://openai.com/index/introducing-structured-outputs-in-the-api/)

Binabago ng pagkakaibang ito ang plano ng pagsusuri para sa mga mamimili. Itinatanong ng schema test kung kayang tumanggap ng software ng sagot. Itinatanong ng fact test kung tumutugma ang sagot sa ebidensiya. Itinatanong ng policy test kung pinapayagan ang kalalabasang kilos. Hindi kapalit ng pagpasa sa iba ang pagpasa sa isa.

## Tungkol sa calibration ang pinakamahalagang hamon sa panayam

Sa 1:09, tinatanggihan ni Almeida ang palagay na perpekto ang calibration at kinikilala niyang nagkakamali ang mga modelo. [Panayam, 1:08:50](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=4130s)

Tungkol sa calibration kung paano inihahambing ang mga hinulaang posibilidad sa mga naobserbahang kinalabasan sa iba’t ibang pangkat ng hula. Kapaki-pakinabang ang modelong nakapagsesenyas ng kawalang-katiyakan kahit hindi tama ang bawat kasong may mataas na posibilidad. Tahasang pinananatili ng panimulang gabay ng TypeSafe ang pagkakaibang ito. [Paliwanag ng TypeSafe tungkol sa calibration](https://docs.typesafe.ai/introduction/machine-learning-primer)

Kailangan ding ibukod ang field ng confidence sa API. Inilalarawan ito ng TypeSafe bilang estadistikang hinango sa distribusyon ng mga sagot. Hindi ito katumbas ng hiwalay na pagsukat sa posibilidad na tama ang napiling sagot. Inirerekomenda ng dokumentasyon nitong pumili ng mga threshold batay sa gawain at mga kahihinatnan nito. [Dokumentasyon ng TypeSafe tungkol sa confidence](https://docs.typesafe.ai/confidence)

Mga praktikal na alalahanin ang mga ito. Ipagpalagay na mahusay ang isang modelong nagruruta sa maiikling mensaheng Ingles ngunit nahihirapan ito sa mahahabang reklamong may ilang kahilingan. Maaaring ikubli ng iisang pinagsama-samang score ang kahinaang iyon. Maaaring mangailangan ng mas masusing pagsusuri ang pasyang may mataas na confidence mula sa mas mahinang pangkat kaysa sa kaparehong numerong ipinakita para sa pamilyar na pangkat.

Dapat samakatuwid suriin ng pangkat ang mga kasong inaasahan nitong matatanggap, kabilang ang kulang na impormasyon, di-pamilyar na pananalita at sadyang nakalilitong input. Dapat nitong siyasatin ang mga pagkakamali ayon sa kategorya at ihambing ang gastos ng pagpapasuri sa kaso sa gastos ng maling pagkilos. Dapat maging mga pasyang pang-operasyon na sinusuportahan ng ebidensiya ang mga threshold, sa halip na mga numerong kinopya sa demonstrasyon.

Matagal nang umiiral ang pananaliksik sa calibration bago pa si Jev. Sinuri sa isang malawak na binabanggit na papel noong 2017 nina Chuan Guo at mga kasamahan ang mahinang calibration ng makabagong mga neural network at mga paraang mapabuti ito. Nagbibigay ng konteksto sa suliranin ang pananaliksik na iyon; hindi nito bineberipika ang modelo ng TypeSafe. [Sa Calibration ng mga Makabagong Neural Network](https://arxiv.org/abs/1706.04599)

## Kasama sa pagiging maaasahan ang mangyayari kapag nagbago ang serbisyo

Ibinubukod sa usapan ang robustness sa determinism at tinatalakay ang katatagan ng bersiyon nang walang pangkalahatang pangako ng pangmatagalang suporta. [Panayam, 41:24](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=2484s) at [49:40](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=2980s)

Magkakahiwalay na tanong ito sa pagbili. Itinatanong ng determinism kung pareho ang output sa magkaparehong input. Itinatanong ng robustness kung nagdudulot ng di-makatuwirang pagbabago sa asal ang di-mahalagang pagkakaiba, gaya ng ibang ID ng rekord. Maaaring paulit-ulit na magbigay ang modelo ng parehong maling sagot at maging deterministic pa rin. Maaari rin itong bahagyang magbago habang nananatiling maaasahan ang nakapaligid na workflow.

Hindi nalulutas ng alinman sa dalawang katangiang ito ang panganib sa buong siklo ng buhay. Kailangang malaman ng negosyo kung aling rebisyon ng modelo ang nagbunga ng pasya, kung mananatili itong available, at paano susuriin ang kapalit nito. Maaari pa ring baguhin ng pagbuti sa mga pagsusuri ng tagapaglaan ang asal sa workflow ng customer na maingat na inayos.

Makatuwirang panatilihin ang mga kinatawang kaso, itala ang mga bersiyon at ihambing ang mga kapalit bago ilipat ang mahahalagang gawain. Mahalaga rin ang alternatibong paraan: maaaring mawalan ng serbisyo kahit tumpak ang isang decision service. Kung walang ligtas na paraan ang aplikasyon upang ihinto o ilipat sa ibang lugar ang trabaho, nagiging bahagi ng kalidad ng pasya sa aktuwal na paggamit ang oras na nananatiling gumagana ang serbisyo.

Dito nagiging pag-asa sa operasyon ang kaakit-akit na API. Hindi nawawala ang pagbili, pagsubaybay at pagpaplano ng paglipat kapag bumilis ang modelo. Mas madaling mapabayaan ang mga ito dahil napakasimple tingnan ng bawat tawag sa API.

## Bakit kailangang lagyan ng konteksto ang mga bilang sa bilis at presyo

Kabilang sa ipinagmamalaking resulta ng TypeSafe sa workflow ang 193.6 na ulit na pagbilis at 444.6 na ulit na pagbaba ng gastos. Itinatakda ng anunsiyo ang mga ito bilang pinakamalalaking pakinabang mula sa mga workflow na ginawa ng kumpanya. Nagmula ang mga sagot na ginamit na sanggunian sa mga pagtatantiya ng posibilidad ng ibang modelo, hindi sa mga klasipikasyong malayang bineripika laban sa tiyak na katotohanan. Nagbabala rin ang kumpanya na pumapabor kay Jev ang maikling demonstrasyon nito at hindi pa natitiyak ang napapanatiling presyo sa pangmatagalan. [Mga paglilinaw ng TypeSafe tungkol sa pagsusuri](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

Dapat ilahad kasabay ng mga bilang ang mga paglilinaw na ito. Maaaring makapagbigay ng kaalaman ang pagsang-ayon sa modelong sanggunian, ngunit iba ang sinusukat nito sa kawastuhan batay sa nalutas nang kaso ng customer. Maaaring maging mahalaga sa mamimili ang workflow na dinisenyo ng vendor kahit hindi nito kinakatawan ang uri ng mga kahilingang natatanggap ng mamimiling iyon.

Dapat saklawin ng wastong paghahambing ang buong gawain: pangangalap ng konteksto, pagpapasya, pagpapatupad ng mga tuntunin, pag-asikaso sa mga eksepsiyon at pagbangon mula sa pagkabigo. Maaaring mas mababa ang gastos sa pagtawag sa modelo ngunit mas mataas ang kabuuang gastos kung napakaraming trabaho ang ipinapasa nito sa mga tagasuri. Maaaring maging matipid ang mas mabagal na tawag kung naiiwasan nito ang magastos na muling paggawa.

Dapat ding sukatin ang latency mula sa aktuwal na rehiyon ng aplikasyon. Hindi garantiya tungkol sa karanasan ng user sa ibang lugar ang demonstrasyong malapit sa imprastraktura ng serbisyo. Dapat siyasatin ng mga interactive na sistema ang mababagal na kahilingan at ang karaniwang bilis; maaaring mas mahalaga naman sa pagproseso sa background ang throughput at kabuuang gastos.

Ipinahihiwatig ng pangalan ni Jev ang ideyang maaaring magpalawak ng konsumo ang kahusayan. Para sa isang negosyo, nagbubukas ito ng tanong sa pagbabadyet: aling mga bagong pasya ang sulit nang suriin, at alin lamang ang naging sapat na mura upang suriin kahit hindi kailangan? Hindi mismong kinalabasan ang mas maraming tawag sa modelo.

## Ibang layunin sa pananaliksik, at hindi pa kumpleto ang ebidensiya

Iniuugnay ng argumento ni Almeida sa pananaliksik ang datos, pagpili ng gawain at RLCD sa pagpuna niya sa pag-optimize batay sa kagustuhan. [Panayam, 7:23](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=443s) at [22:12](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=1332s)

Daglat ang RLCD ng Reinforcement Learning for Calibrated Decisions. Inilalarawan ito ng TypeSafe bilang pagsasanay para makabuo ng kapaki-pakinabang na mga pasya at posibilidad, na kaibahan sa mga paraang nakabatay sa kagustuhan ng tao at beripikableng gantimpala. Salaysay ito ng kumpanya tungkol sa layunin nito. Hindi ito dapat mapagkamalang malayang pagberipika sa buong paraan ng pagsasanay. [Panimulang gabay ng TypeSafe tungkol sa AI](https://docs.typesafe.ai/introduction/machine-learning-primer)

Mahalagang siyasatin ang mas malawak na tanong habang sinusuri pa ang paraan: anong asal ang ginagantimpalaan ng layunin sa pagsasanay? Maaaring madaling gamitin ang modelong in-optimize para sa kapani-paniwalang paliwanag nang hindi inilalantad ang kawalang-katiyakan sa paraang magagamit ng code. Mapadadali ng interface na nakatuon sa pasya ang pag-asikaso sa kawalang-katiyakan, ngunit kailangan pa ring ihambing sa realidad ang mga output nito.

Iniuugnay ng TypeSafe ang alalahaning ito sa mode dropping: maaaring paliitin ng pag-optimize batay sa kagustuhan ang hanay ng malamang na output tungo sa mga tugong ginagantimpalaan ng mga tao. Paliwanag ito ng kumpanya sa isang posibleng paraan ng pagkabigo, hindi natuklasang hindi kapaki-pakinabang sa mga pasya ang bawat modelong sinanay batay sa kagustuhan. [Talakayan ng TypeSafe tungkol sa pag-optimize batay sa kagustuhan](https://docs.typesafe.ai/introduction/machine-learning-primer)

Lalong nagiging kawili-wili ang argumentong ito dahil sa karanasan ni Almeida. Kasamang may-akda siya ng papel tungkol sa InstructGPT na nagsuri sa pagsasanay ng mga language model upang sumunod sa mga tagubilin gamit ang puna ng tao. Mabeberipika ang pagiging may-akda niya; ibang usapin ang malalawak na pahayag tungkol sa mga pagkakamali ng bawat laboratoryo. [Papel tungkol sa InstructGPT](https://arxiv.org/abs/2203.02155)

Kabilang sa iisang argumento niya tungkol sa pagpili ng kapaki-pakinabang na gawain ang pagtutol niya sa paggasta sa pretraining at pagtatayo ng mga bagong laboratoryong walang tiyak na direksiyon. [Panayam, 1:49:32](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=6572s) at [2:03:10](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=7390s)

Para sa mamimili, mahalagang itanong kung ano ang magagawa ng produkto sa isang tinukoy na proseso. Maaaring ipaliwanag ng kasaysayan sa pananaliksik, paggasta sa komputasyon, at natatanging arkitektura ng modelo kung paano nakabuo ng produkto ang isang kumpanya. Hindi nito itinatakda kung magiging matipid ang pag-deploy nito sa negosyo ng iba.

Tinatalakay rin sa panayam ang pag-alis ni Almeida sa OpenAI, mga hamon sa maagang paggamit, at paglago sa pangunguna ng mga developer. [Panayam, 1:31:27](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=5487s) at [1:56:48](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=7008s)

Ipinaliliwanag ng mga alaala niya ang mga prayoridad ng kumpanya. Hindi ito nasuring ebidensiya ng paggamit ng produkto. Dapat hatulan sa huli ang developer platform batay sa tuluy-tuloy at kapaki-pakinabang na mga workload at sa suportang ibinibigay nito kapag pumalya ang mga iyon. Dapat mag-udyok ng pagsisiyasat ang sigla matapos ang paglulunsad, hindi ito kapalit ng gayong talaan.

## Maaaring higit pa sa bagong chat window ang mapala ng kasalukuyang software

Inaasahan ni Almeida ang mas mahusay na mga produktong SaaS at ang pag-atras ng AI sa likuran. [Panayam, 1:19:57](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=4797s)

Kapani-paniwalang direksiyong siyasatin ito dahil mayroon nang mga bahagi sa software kung saan maaaring baguhin ng kapaki-pakinabang na pasya ang susunod na hakbang. Maaaring matukoy ng aplikasyon sa pag-iiskedyul ang malabong kahilingan bago mag-book. Maaaring isaayos ng imbakan ng midya ang materyal para sa mananaliksik. Maaaring ibukod ng service desk ang karaniwang update sa reklamong nangangailangan ng pansin. Mga posibleng disenyo ito, hindi mga naiulat na pag-deploy ni Jev.

Maaaring halos walang magbago sa interface. Mapapansin ng mga user ang mas kaunting pagkakamali, mas kaunting paulit-ulit na klasipikasyon, o mas maikling paghihintay sa tamang tao. Maaaring mapunta ang bentahe sa negosyo sa mga kumpanyang nakauunawa na sa workflow at naisasama rito ang mas mahusay na mga pasya.

Haharap pa rin sa kompetisyon ang mga kasalukuyang negosyo ng software. Kung magiging abot-kaya sa maraming developer ang kaparehong pasya, maliit na lamang ang maibubukod ng mismong tawag sa modelo. Kailangang magbigay ang nakapaligid na produkto ng kapaki-pakinabang na access sa datos, maingat na disenyo ng ugnayan, at maaasahang paraan upang matapos ang gawain.

Nangangailangan ng higit na pag-iingat ang mga pahayag tungkol sa trabaho. Maaaring magbago ang bilang ng tauhan, lumaki ang dami ng serbisyo, o mailipat sa mga eksepsiyon ang trabaho kapag nabawasan ang pagsisikap sa isang gawain. Nakasalalay ang mga kinalabasang iyon sa organisasyon at demand para sa serbisyo nito. Hindi pinatutunayan ng panayam o paglulunsad para sa maagang access kung mapoprotektahan, mawawala, o malilikha ang tiyak na dami ng trabaho.

Para sa pangkalahatang-ideya ng industriya ng BIG CHANGE, ang nasusukat na pangyayari ay ang pagkakaroon ng isa pang paraan ng awtomasyon ng pagpapasya. Mga susunod na tanong na nangangailangan ng ibang ebidensiya ang malawakang paggamit, pagtaas ng produktibidad, at mga epekto sa pamilihan ng paggawa.

## Hindi gaanong nagagamit na datos, real-time na software, at mga limitasyon ng demonstrasyon

Tinatalakay sa panayam ang nakaimbak na datos, mga interactive na aplikasyon, beripikasyon, at demonstrasyon ng paggamit ng computer. [Panayam, 1:34:50](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=5690s)

Nagmumungkahi ng magkakaibang pagsusuri ang bawat kategorya. Maaaring maghintay nang kaunti ang pagproseso ng imbakan, ngunit kailangan nito ng plano para magsampol ng mga resulta at maiugnay ang mga ito sa orihinal na rekord. Kailangan ng real-time na interface ang mahuhulaang bilis ng pagtugon. Dapat subukan ang tagasuri ng ibang modelo sa mga pagkakamaling talagang nagagawa ng modelong iyon, kabilang ang mga kasong pareho silang nagkamali.

Isang bahagi lamang ng sistema ang pagpili ng kilos para makagamit ng computer. Kailangan din nito ng tumpak na representasyon ng interface, paraan para maisagawa ang kilos, at pagsusuring nagkumpirmang nangyari ang inaasahang pagbabago. Maaaring ipakita ng pulidong demonstrasyon na minsang naganap ang isang pagkakasunod-sunod; kailangan naman ng maaasahang awtomasyon ang paulit-ulit na pagsubok at pagbangon mula sa mga pagkaantala.

Kailangan ding mag-ingat sa mga laro. Maaaring tumugon sa mas maraming detalye ng estado ang tauhang kinokontrol ng modelo habang patuloy na ipinapatupad ng game engine ang mga posibleng kilos. Nakasalalay sa bilis ng pagtugon, pagkakapare-pareho, at disenyo ng karanasan kung mapabubuti nito ang paglalaro. Hindi kusang gagawing mas kawili-wili ang laro ng pagdaragdag ng hinuha sa bawat frame.

Iniiwasan ng mga pagkakaibang ito ang pagkakamali sa pag-uuri: dapat kilalanin ang kapaki-pakinabang na bahagi batay sa ginagampanan nito, nang hindi ipinalalagay na taglay rin nito ang lahat ng kakayahan ng mas malaking aplikasyong kinaroroonan nito.

Binabanggit sa panayam bilang mga posibilidad ang fine-tuning, paningin ng modelo, at mga karagdagang hugis ng modelo. [Panayam, 1:10:27](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=4227s) at [1:26:23](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=5183s)

Hindi dapat maging pag-asa sa plano ng paglulunsad ang usapan tungkol sa roadmap. Buuin ang produkto batay sa kasalukuyang interface, tukuyin kung ano ang kailangang ibigay ng hiwalay na bahagi at suriin ang bagong kakayahan kapag dumating na talaga ito. Nagbibigay ito ng puwang upang makinabang sa mga susunod na pagbuti nang hindi inilalahad ang haka-haka bilang feature ng produkto.

## Maaaring magkaiba ang paraan ng paghahati ng trabaho ng mga coding agent

Iminumungkahi ni Almeida ang mas murang paghawak sa estado at pinagsasaluhang konteksto para sa mga coding agent na lampas sa paikot na paggamit ng iisang modelo. [Panayam, 1:40:17](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=6017s) at [2:09:29](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=7769s)

Maaaring gumamit ang isang posibleng arkitektura ng mahusay na coding model upang bumuo ng pagbabago, mas maliliit na tawag sa pagpapasya upang uriin ang kaugnay na mga file, at karaniwang software upang pamahalaan ang mga nagresultang gawain. Maaaring siyasatin ng hiwalay na tagasuri ang huling patch. Panukalang disenyo ito, hindi rekomendasyong nasubukan sa benchmark o ebidensiyang napapalitan na ni Jev ang kasalukuyang coding agent.

Kaakit-akit ang piling paggamit ng konteksto. Kung iisang interface at ilang limitasyon lamang ang kailangan ng isang subtask, maaaring aksaya ang pagpapadala rito ng buong usapan. Makapagpapadali ang tahasang mga tala ng gawain sa pagtukoy kung aling mga katotohanan ang mahalaga, ano ang napagpasyahan na, at aling mga pagbabago ang nakabinbin pa.

Mapanganib na mapagkamalan ang mungkahi sa koordinasyon bilang garantiya na walang magkasabay na pagbabago. Maaaring kapwa maniwala ang dalawang agent na dapat silang sumulat sa iisang file. Hindi dapat ipalit ang probabilistikong modelo sa mga mekanismo ng software na pumipigil sa magkasalungat na pagsulat. Dapat pa ring ipatupad ng mga pahintulot, pagsusuri ng bersiyon, at lock ang tamang kalalabasan.

Gayundin, maaaring mapahusay ng mas murang pagkuha sa dating gawain ang pamamahala sa memorya nang hindi nalulutas ang lahat ng problemang tinatawag na tuluy-tuloy na pagkatuto. Magkakaibang kakayahan ang pag-alala sa naunang pagtatangka, pag-unawa kung bakit ito pumalya, at maaasahang pag-angkop sa bagong sitwasyon. Dapat suriin sa kapani-paniwalang pagtatasa ang mga natapos na gawain, pag-ulit ng dating pagkakamali, salungatan, at pakikialam ng tao—hindi lamang bilangin ang mga agent o tawag sa modelo.

## Dumadaloy ang kaligtasan sa buong sistema; hindi ito basta nawawala

Mas pinapaboran ni Almeida ang mga pananggalang sa antas ng aplikasyon kaysa pagtanggi ng modelo; kinukuwestiyon naman ni swyx ang mga kahihinatnan nito. [Panayam, 13:11](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=791s) at [1:42:29](https://www.youtube.com/watch?v=cFx9Z3ZXca0&t=6149s)

Tunay na suliranin sa disenyo kung paano hahawakan ng aplikasyong tumatakbo nang walang bantay ang pagtanggi, pagkabigo o hindi tiyak na resulta mula sa serbisyong inaasahan nito. Kailangan nito ng malinaw na paraan ng pagtugon. Hindi naman itinatakda ng obserbasyong ito kung saan dapat ilagay ang bawat pananggalang.

Dapat ipatupad ng aplikasyon ang mga pahintulot sa pag-access kahit natukoy nang tama ng modelo ang nilalayong kilos. Maaaring lubos nitong maunawaan ang kahilingang magtanggal ng rekord ngunit wala pa ring pahintulot na gawin iyon. Maaari ring wasto sa teknikal na aspeto ang kahilingan ngunit labag sa patakaran ng operator. Kailangan ng sapat na konteksto upang responsableng masagot ng decision service ang mga tanong na iyon, at dapat manatili sa aplikasyon ang kontrol sa mismong kilos.

Dahil dito, mas nagiging mahalaga ang malinaw na pagtatakda ng mga hangganan bago mag-deploy habang inililipat sa software ang mas maraming pasya. Kailangang magpasya ang mga pangkat kung anong ebidensiya ang kailangan, aling mga operasyon ang maaari pang bawiin, at paano makapagtututol o makapagtatama ng resulta ang isang tao. Hindi sapat na patunay ng kaligtasan ng buong sistema ang pag-aalis sa mahirap na pakikipag-ugnayan sa modelo.

## Ano ang magpapatunay na malaki ang pagbabago

Nagbibigay-daan ang paglulunsad sa malinaw na eksperimento. Pumili ng isang limitadong prosesong may nakikitang kinalabasan. Itala kung paano ito isinasagawa ngayon, pati ang mga pagkakamali at oras na ginugugol ng mga tao sa pagwawasto. Subukan ang bersiyong nakabatay sa pagpapasya sa mga kinatawang kaso bago ito bigyan ng awtoridad na kumilos.

Sukatin ang bahagi ng mga kasong natapos nang tama nang walang pakikialam, mga pagkakamaling nakalampas sa pagsusuri, dami ng trabahong ipinasa sa mga tao, at kabuuang gastos sa bawat natapos na kaso. Panatilihing available ang orihinal na ebidensiya upang masiyasat ng tagasuri kung bakit tinanggap ang resulta. Ulitin ang paghahambing kapag nagbago ang modelo, patakaran, o uri ng input.

Maaaring ihayag ng pagsusuring ito na bahagi lamang ng proseso ang handa na. Kapaki-pakinabang na resulta iyon. Maaaring maging sulit ang pag-awtomatisa sa karaniwang pag-uuri habang iniiwan sa bihasang operator ang mga malalabong kaso, nang hindi nangangailangan ng mas malawak na awtonomiya.

Nag-aalok ang paglulunsad ni Jev at panayam kay Almeida ng ambisyosong palagay tungkol sa pagpasok ng AI sa ekonomiya: maaaring gawing mas mahusay ng paulit-ulit at limitadong mga pasya ang software na inaasahan na ng mga tao. Dapat magmula sa mga sistemang gumagawa ng gayong trabaho sa paglipas ng panahon ang susunod na ebidensiya, kasama sa pagtutuos ang mga pagkakamali at eksepsiyon. Doon magiging pagbabagong aktuwal na mapapansin ng mga mambabasa ang kawili-wiling arkitektura ng modelo.

## Sources

- [Orihinal na panayam ng Latent Space](https://www.youtube.com/watch?v=cFx9Z3ZXca0) — Panayam ng Latent Space kay Diogo Almeida, inilathala noong Setyembre 21, 2026. May mga link na may timestamp sa buong pagsusuring ito.
- [Ipinapakilala ang mga modelong System One at si Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) — Setyembre 15, 2026. Anunsiyo ng maagang access kay Jev ng TypeSafe, kabilang ang mga pahayag sa pagganap at limitasyon ng pagsusuri.
- [Panimula](https://docs.typesafe.ai/introduction) — Dokumentasyon ng TypeSafe na nagpapaliwanag sa input state ng modelo at mga tanong na Choice, Score, at Noul.
- [Confidence](https://docs.typesafe.ai/confidence) — Dokumentasyon ng TypeSafe na nagbubukod sa confidence at posibilidad at nagpapaliwanag kung paano maaaring gumamit ng threshold ang mga aplikasyon.
- [Panimulang gabay sa AI](https://docs.typesafe.ai/introduction/machine-learning-primer) — Paliwanag ng TypeSafe sa layunin ng pagsasanay nito at kahulugan ng calibration sa iba’t ibang pangkat ng hula.
- [Mga pattern](https://docs.typesafe.ai/patterns) — Mga halimbawa ng TypeSafe sa pagsasama ng mga pasya ng modelo sa lohika ng aplikasyon.
- [Ipinapakilala ang Structured Outputs sa API](https://openai.com/index/introducing-structured-outputs-in-the-api/) — Agosto 6, 2024. Pagpapakilala ng OpenAI sa mga output na limitado ng schema at mga limitasyon ng mga ito.
- [Sa Calibration ng mga Makabagong Neural Network](https://arxiv.org/abs/1706.04599) — Pananaliksik noong 2017 nina Chuan Guo at mga kasamahan tungkol sa calibration ng neural network. Hindi sinusuri sa papel na ito si Jev.
- [Pagsasanay sa mga language model na sumunod sa mga tagubilin gamit ang puna ng tao](https://arxiv.org/abs/2203.02155) — Papel sa pananaliksik tungkol sa InstructGPT noong 2022, na kapwa isinulat ni Diogo Almeida, hinggil sa pagsunod sa tagubilin gamit ang puna ng tao.