Tavus 表示,與新款 Griffin-Lite 模型進行一分鐘視訊通話的 54 人中,有 26 人以為自己正與真人交談。這是 Tavus 自行進行的一項研究所得的醒目結果,但測量範圍僅限於特定通話和問題下的反應。Griffin-Lite 目前仍是只供部分測試者使用的研究預覽版;Tavus 表示,客戶使用前,公司仍在開發身分揭露防護措施。
重大變化
- 變化所在:Tavus 將視訊助理研究推進到一種新系統:在同一場對話中聆聽、觀看,並生成臉部影像和語音。在該公司自行進行的短時間通話中,54 人有 26 人以為模型是真人。
- 為何重要:對設計視訊代理的團隊而言,即時對話節奏和富有表現力的視訊,可能讓介面更容易互動。同一項研究也說明,不能把告知通話者對方是 AI 當成事後才處理的事項。
- 後續觀察:Griffin-Lite 目前僅開放給部分研究測試者。Tavus 表示,身分揭露功能及其他安全程序仍在開發;措施形式和效果、客戶何時能使用,以及 Griffin 專屬價格都尚未公布。
26/54 的結果測量了什麼
在Tavus于10 月 1 日發布的研究說明研究人員在通話前告訴參與者,他們將與另一位參與者進行一分鐘視訊通話,聊聊今年期待的事。實際上,對方是由 Griffin-Lite 驅動的 Tavus AI 虛擬角色。通話結束後,參與者為這次交流評分,並回答是否曾懷疑對方不是真人。之後 Tavus 才告知他們,通話對象是 AI。
在 54 名與 Griffin-Lite 通話的參與者中,26 人表示對方是真人,約占 48%。Tavus 表示,先前的 Phoenix-4.5、Sparrow-2 和 Raven-1 系統也使用相同流程;在那組 41 名參與者中,只有 1 人認為對方是真人。兩項結果來自不同的通話者群體,並非對同一批人進行的前後測。公告無法說明延長通話、改變話題,或日常使用者知道可能會遇到 AI 代理時,反應是否會不同。
Tavus 將結果稱為通過即時視訊圖靈測試。這是公司對一分鐘研究的描述,並非對類人對話能力的通用認證。RuntimeWire的獨立發布報道同樣將 48% 視為樣本數不多、且由公司自行進行的研究結果,並指出客戶仍無法使用預覽版。這項研究呈現參與者在所述條件下的判斷,並非經獨立重現驗證的欺瞞率。
另一項基準測試評量互動品質
NVIDIA的VideoFDB排行榜為 Griffin-Lite 的生成能力評為 5 分中的 3.83 分,感知能力則為 3.73 分。此基準使用真實視訊通話片段,並由依評分規準運作的語言模型擔任評審。生成能力評估模型的語音、臉部和對話行為是否恰當;感知能力評估模型如何回應他人的音訊和視訊。NVIDIA 表格中,Griffin-Lite 在兩項評測的分數都高於列出的系統;人類參照分數則分別為 3.92 和 4.20。
這些分數衡量的任務,不同於詢問通話者是否認為對方是真人。兩項測試的比較組和條件也不同:生成能力表格納入串接式語音轉虛擬角色系統;感知能力表格則包含以音訊和視訊評估的系統,也另列僅以音訊評估的結果。排行榜呈現模型依 NVIDIA 已發布規準所得的分數,不能驗證 Tavus 通話研究的 48% 數字,也不能說明 Griffin 作為客服、家教或醫療產品時的表現。
Tavus如何描述該系統
Tavus 將 Griffin 描述為雙部分架構。持續運作的對話模型接收通話者的音訊和視訊,並產生控制指令,決定回覆內容、發言時機和表達方式。串流語音與視訊生成器再依這些指令產生聲音和動態場景。公司表示,系統能邊說邊聽、被打斷時讓出發言機會,並依據視覺情境回應,而不用等每一輪對話結束。這些是 Tavus 對技術和示範的描述;BIG CHANGE 未取得預覽權限,也未測量系統表現。
這項差異很重要,因為生成一張臉並不代表完整的互動體驗。如果系統能回應停頓、視線和打斷,可能會影響通話者是否感到被理解,以及是否察覺自己正在與軟體交談。VideoFDB 依基準流程提供對話行為的量化比較;Tavus 的真人通話研究則觀察較窄的身分判斷問題。兩者都無法取代公開證據,例如長時間使用的可靠性、實際部署時的身分揭露方式,或使用者是否知情並同意。
使用權限與待解問題
Tavus稱,Griffin-Lite目前僅向少數受信任的測試者開放,作為研究預覽版使用,Tavus 客戶目前無法取得。公司提供測試申請表。Griffin 尚未納入一般平台或公開 API,公告也未列出 Griffin 專屬價格。Tavus 現有的 Phoenix、Raven 和 Sparrow 模型仍屬另一條既有產品線。
Tavus 表示,擴大開放前仍在開發身分揭露功能和其他安全程序,但尚未公布日期、詳細設計,或措施有效的證據。因此,評估即時視訊代理時,眼前需要回答的具體問題是:通話者如何知道對方是誰或什麼?Griffin 成為客戶產品前,又會如何確認身分揭露已做好?
資料來源與延伸閱讀
- Tavus Research,《推出Griffin:首個人機交互模型》,2026 年 10 月 1 日。廠商對系統的說明、研究流程和結果、可用情況及安全聲明。真人通話研究由Tavus開展;本次查閱的資料中沒有獨立重復研究。
- NVIDIA和David AI,《VideoFDB:評估對話智能體的全雙工視覺與語音能力》,于2026 年 10月2日查閱。基準測試機構的方法說明和實時排行榜,包括Griffin-Lite在生成和感知方面的分數。其模型評判分數與Tavus真人通話研究不同。
- Ryan Merket,RuntimeWire,《Tavus稱Griffin在一分鐘視頻通話中讓48%的測試者誤以為對方是真人》,2026 年 10 月 1 日。獨立報道說明了樣本量和客戶無法使用的問題;作者沒有報告獨立復測或親自測試Griffin。



