AI-translated from English; not yet reviewed by a fluent editor.
# Tavus Griffin: ano ang ipinapakita ng resulta sa isang minutong video call
> Sa mga isang minutong tawag na pinatakbo ng Tavus, 26 sa 54 na tao ang naniwalang tao ang kausap nilang Griffin-Lite. Magkaibang tanong ang sinasagot ng pag-aaral, benchmark ng NVIDIA at limitadong preview.
By BIG CHANGE Editorial
Published: 2026-10-02T15:28:31.155Z
Updated: 2026-10-02T15:28:31.155Z
Canonical: https://bigchange.ai/blog/tavus-griffin-one-minute-video-call-study

AI-generated conceptual illustration by BIG CHANGE.
Ayon sa Tavus, 26 sa 54 na tao sa isang minutong video call gamit ang bago nitong modelong Griffin-Lite ang naniwalang totoong tao ang nakausap nila. Kapansin-pansin ang resultang ito mula sa pag-aaral na pinatakbo ng Tavus, pero iisang partikular na tawag at tanong lamang ang sinukat nito. Research preview pa rin ang Griffin-Lite para sa mga piling tester, at sinabi ng Tavus na gumagawa ito ng mga pananggalang sa disclosure bago ito magamit ng mga customer.
## Ang malaking pagbabago
- **Ano ang nagbago:** Inilipat ng Tavus ang pananaliksik nito sa video assistant tungo sa sistemang nakikinig, nanonood at bumubuo ng mukha at boses sa loob ng iisang pag-uusap. Sa maiikli nitong tawag na pinatakbo ng kumpanya, 26 sa 54 na tao ang naniwalang tao ang modelo.
- **Bakit ito mahalaga:** Para sa mga team na nagdidisenyo ng mga video agent, maaaring gawing mas madaling kausapin ang interface kapag maayos ang tiyempo ng usapan at makahulugan ang video. Ipinakikita rin ng pag-aaral kung bakit hindi dapat ipagpaliban ang pagsasabi sa mga tumatawag na AI ang kausap nila.
- **Ano ang dapat bantayan:** Limitado ang Griffin-Lite sa mga piling research tester. Sinabi ng Tavus na ginagawa pa ang mga feature para sa disclosure at iba pang hakbang pangkaligtasan; hindi pa inaanunsiyo ang magiging anyo at bisa ng mga ito, gayundin ang access ng mga customer at presyong partikular sa Griffin.
## Ano ang sinukat ng resultang 26 sa 54
Sa [salaysay ng pananaliksik ng Tavus noong Oktubre 1](https://www.tavus.io/griffin), sinabihan ang mga kalahok na itatambal sila sa isa pang kalahok para sa isang minutong video call tungkol sa mga inaabangan nila ngayong taon. Sa halip, isang AI persona ng Tavus na pinatatakbo ng Griffin-Lite ang naging kausap nila. Pagkatapos ng tawag, pinasagutan sa mga tao kung ano ang tingin nila sa usapan at kung naisip ba nilang hindi totoong tao ang kausap nila. Saka ibinunyag ng Tavus na AI ang kausap nila.
Sa 54 na kalahok ng Griffin-Lite, 26 ang nagsabing totoong tao ang kausap nila, o humigit-kumulang 48%. Ayon sa Tavus, gayon din ang protocol na ginamit nito sa nauna nitong sistemang Phoenix-4.5, Sparrow-2 at Raven-1; isa sa 41 kalahok sa grupong iyon ang nagsabing tao ang kausap niya. Magkaibang grupo iyon ng mga tumawag, hindi resulta ng paghahambing sa parehong mga tao bago at pagkatapos. Hindi ipinakikita ng anunsiyo kung magbabago ang tugong ito sa mas mahahabang tawag, ibang paksa o pang-araw-araw na paggamit kung saan alam ng mga tao na maaaring lumitaw ang isang AI agent.
Tinawag ng Tavus na pagpasa sa real-time video Turing test ang resulta. Paglalarawan iyon ng kumpanya sa isang minutong pag-aaral nito, hindi pangkalahatang sertipikasyon na nakikipag-usap ang sistema na parang tao. [independiyenteng ulat sa paglulunsad ng RuntimeWire](https://runtimewire.com/article/tavus-griffin-video-turing-test) ay tumuturing din sa 48% bilang maliit na resultang mula sa pag-aaral ng kumpanya at binabanggit na hindi pa magagamit ng mga customer ang preview. Ebidensiya ang pag-aaral tungkol sa paghatol ng mga kalahok sa itinakdang mga kondisyon nito; hindi ito rate ng panlilinlang na nakumpirma ng hiwalay na pag-aaral.
## Sinusukat ng hiwalay na benchmark ang kalidad ng pakikipag-ugnayan
Ang [leaderboard ng NVIDIA VideoFDB](https://research.nvidia.com/labs/amri/projects/video-fdb/) ay nagbibigay sa Griffin-Lite ng score na 3.83 sa 5 para sa generation at 3.73 para sa perception. Gumagamit ang benchmark ng mga clip mula sa totoong video call at tagahatol na language model na sumusunod sa isang rubric. Sinusukat ng generation kung angkop ang boses, mukha at gawi ng modelo sa pakikipag-usap; sinusukat naman ng perception ang mga tugon nito sa audio at video ng isang tao. Mas mataas ang Griffin-Lite kaysa sa mga nakalistang sistema sa dalawang kategorya ayon sa talahanayan ng NVIDIA, samantalang 3.92 at 4.20 ang mga score ng human reference.
Ibang gawain ang sinusukat ng mga score na ito kumpara sa pagtatanong sa mga tumatawag kung sa tingin nila ay tao ang kausap nila. Magkaiba rin ang mga sistemang pinaghahambingan at ang mga kondisyon: kasama sa talahanayan ng generation ang mga sistemang sunud-sunod na nag-uugnay ng speech at avatar, samantalang kasama sa talahanayan ng perception ang mga sistemang sinuri gamit ang audio at video o, sa magkakahiwalay na hanay, audio lamang. Sinusuportahan ng leaderboard ang resultang nakuha sa inilathalang rubric ng NVIDIA. Hindi nito pinatutunayan ang 48% na resulta sa pag-aaral ng tawag ng Tavus o ipinakikita kung paano gagana ang Griffin bilang produkto para sa customer service, pagtuturo o pangangalagang pangkalusugan.
## Ano ang sinasabi ng Tavus tungkol sa paggana ng sistema
Inilalarawan ng Tavus ang Griffin bilang disenyong may dalawang bahagi. Tumatanggap ang tuloy-tuloy na conversational model ng audio at video ng tumatawag, saka nagbibigay ng mga tagubilin kung ano ang sasabihin, kailan magsasalita at paano ito ipahahayag. Ginagawang boses at gumagalaw na tagpo ng mga streaming speech at video generator ang mga tagubiling iyon. Ayon sa kumpanya, nakikinig ang sistema habang nagsasalita, tumitigil kapag naaantala at tumutugon sa nakikita sa halip na maghintay na matapos ang bawat salitan sa usapan. Mga teknikal na paglalarawan at demonstrasyon ito ng Tavus; hindi pa nasubukan ng BIG CHANGE ang preview o sinukat ang paggana nito.
Mahalaga ang pagkakaibang ito dahil hindi buong pakikipag-ugnayan ang nabubuong mukha lamang. Maaaring maapektuhan ng sistemang tumutugon sa paghinto, tingin at pagsingit sa usapan kung mararamdaman ng tumatawag na nauunawaan siya o malalaman niyang software ang kausap niya. Nagbibigay ang resulta ng VideoFDB ng paghahambing na may score sa gawi sa pakikipag-usap sa ilalim ng benchmark protocol. Mas makitid na obserbasyon tungkol sa paghatol kung tao ang kausap ang ibinibigay ng pag-aaral ng Tavus sa mga tawag. Hindi mapapalitan ng alinman dito ang pampublikong ebidensiya tungkol sa tuloy-tuloy na pagiging maaasahan, disclosure sa aktuwal na deployment o may-alam na pagsang-ayon ng mga user.
## Access at ang susunod na pagpapasya
Ayon sa Tavus, [mga piling pinagkakatiwalaang tester lamang ang maaaring sumubok sa Griffin-Lite](https://www.tavus.io/griffin) bilang research preview at hindi ito magagamit ng mga customer ng Tavus. May form ang kumpanya para humiling ng access sa pagsubok. Wala pa ang Griffin sa pangkalahatang platform o pampublikong API nito, at walang inilalahad ang anunsiyo na presyong partikular sa Griffin. Hiwalay na kasalukuyang produkto pa rin ang mga dati nang modelong Phoenix, Raven at Sparrow ng Tavus.
Sinabi ng kumpanya na gumagawa ito ng mga feature para sa disclosure at iba pang hakbang pangkaligtasan bago ang mas malawak na release. Wala pa itong inilalathalang petsa, detalyadong disenyo ng disclosure o ebidensiyang gumagana ang mga hakbang na iyon. Kaya para sa sinumang nagsusuri ng real-time na video agent, tiyak ang agarang tanong: paano malalaman ng tumatawag kung sino o ano ang nasa kabilang panig, at paano ito titiyakin bago maging produkto para sa mga customer ang Griffin?
## Mga sanggunian at karagdagang babasahin
- [Tavus Research, “Introducing Griffin: The First Human Interaction Model”](https://www.tavus.io/griffin), Oktubre 1, 2026. Paglalarawan ng vendor sa sistema, protocol at resulta ng pag-aaral, availability at pahayag tungkol sa kaligtasan. Pinatakbo ng Tavus ang pag-aaral sa mga tawag at hindi ito nakumpirma ng hiwalay na pag-aaral sa mga sangguniang sinuri rito.
- [NVIDIA at David AI, “VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents”](https://research.nvidia.com/labs/amri/projects/video-fdb/), sinuri noong Oktubre 2, 2026. Pamamaraan ng benchmark operator at live leaderboard, kasama ang mga score ng Griffin-Lite para sa generation at perception. Hiwalay sa pag-aaral ng Tavus sa mga tawag ng tao ang mga score na hinatulan ng modelo.
- [Ryan Merket, RuntimeWire, “Tavus says Griffin fooled 48% of testers in one-minute video calls”](https://runtimewire.com/article/tavus-griffin-video-turing-test), Oktubre 1, 2026. Independiyenteng pag-uulat na tumutukoy sa laki ng sample at agwat sa access ng mga customer; hindi ito nag-uulat ng sarili nitong pag-uulit ng pag-aaral o aktuwal na pagsubok sa Griffin.
## Sources
- [Introducing Griffin: The First Human Interaction Model](https://www.tavus.io/griffin) — Pangunahing anunsiyo ng Tavus: paglalarawan ng modelo, isang minutong pag-aaral sa tao na pinatakbo ng kumpanya, research preview para sa mga piling tester, pagsisikap sa disclosure at kawalan ng access para sa mga customer. Iniuugnay sa vendor ang interpretasyon nitong pagpasa sa video Turing test; hindi ito itinuturing na pangkalahatang resulta.
- [VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents](https://research.nvidia.com/labs/amri/projects/video-fdb/) — Pamamaraan ng benchmark operator na NVIDIA/David AI at live leaderboard. 3.83 ang score ng Griffin-Lite sa generation at 3.73 sa perception; magkaibang kategoryang hinatulan ng modelo ang mga ito, hindi pag-aaral kung mapagkakamalang tao ang sistema.
- [Tavus says Griffin fooled 48% of testers in one-minute video calls](https://runtimewire.com/article/tavus-griffin-video-turing-test) — Independiyenteng pag-uulat sa paglulunsad at interpretasyon sa maliit na pag-aaral na pinatakbo ng kumpanya at sa kawalan ng access ng mga customer; hindi ito hiwalay na pag-uulit ng pag-aaral.
Newsletter ng BIG CHANGE
Ang kabuuang larawan, sa sarili mong bilis.
Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.
Ipinapadala nang 09:00 oras sa Belgrade: araw-araw, tuwing Lunes, o sa unang araw ng buwan. Darating ang una mong edisyon sa susunod na nakaiskedyul na pagpapadala pagkatapos mong magkumpirma.
Privacy mo, pasya mo.
Tumutulong ang kinakailangang storage na panatilihing ligtas ang site at tandaan ang mga pinili mo. Nananatiling naka-off ang opsyonal na Google Analytics hangga’t hindi mo ito pinapahintulutan. Mababasa mo ang lahat ng kuwento gamit lamang ang kinakailangang storage. Mga detalye tungkol sa privacy