世界从未停止变化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# Tavus Griffin:一分钟视频通话结果说明了什么

> 在Tavus开展的一分钟通话中,54人有26人以为Griffin-Lite是一名真人。该研究、NVIDIA基准测试和有限预览版回答的是不同问题。

By BIG CHANGE Editorial

Published: 2026-10-02T15:28:31.155Z
Updated: 2026-10-02T15:28:31.155Z
Canonical: https://bigchange.ai/blog/tavus-griffin-one-minute-video-call-study

![A charcoal and ink illustration of one hollow translucent face mask mounted on a stand, with a restrained orange reflection.](https://bigchange.ai/api/media/file/tavus-griffin-identity-mask-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tavus称,在使用其新款Griffin-Lite模型进行的一分钟视频通话中,54人有26人以为自己正在与真人交谈。这是Tavus自行开展的一项研究中的显著结果,但它测量的是人们对特定通话和问题的反应。Griffin-Lite仍是只向部分测试者开放的研究预览版;Tavus称,在客户使用该模型之前,公司还在开发披露措施。

## 重大变化

- **变化所在:** Tavus将视频助手研究推进到一个新阶段:系统在同一场对话中听取并观察用户,同时生成面部画面和语音。在该公司自行开展的简短通话中,54人有26人以为模型是真人。
- **为何重要:** 对于设计视频智能体的团队而言,贴近实时的对话节奏和富有表现力的视频可能让界面更容易使用。同一项研究也说明,不能把告知通话对象正在与AI交流当作事后才考虑的环节。
- **后续观察:** Griffin-Lite目前仅向部分研究测试者开放。Tavus称,披露功能和更多安全措施正在开发中;这些措施的具体形式和效果、客户何时可以使用,以及Griffin的专属定价均尚未公布。

## 26/54这个结果测量了什么

在[Tavus于10月1日发布的研究说明](https://www.tavus.io/griffin)中,参与者被告知,他们将与另一名参与者进行一分钟视频通话,聊聊今年期待的事情。但他们的通话对象实际上是由Griffin-Lite驱动的Tavus AI虚拟形象。通话结束后,参与者对交流进行评分,并回答自己是否怀疑对方并非真人。随后Tavus告知他们通话对象是AI。

在54名与Griffin-Lite通话的参与者中,有26人表示对方是真人,约占48%。Tavus称,其先前的Phoenix-4.5、Sparrow-2和Raven-1系统也采用相同流程;在该组41名参与者中,只有1人认为对方是真人。这是两组不同来电者的结果,并非对同一批人进行的前后测。该公告无法说明通话时间更长、话题不同,或人们知道日常使用中可能会遇到AI智能体时,这种反应会如何变化。

Tavus将结果称为通过实时视频图灵测试。这是公司对其一分钟研究的描述,并非针对类人对话能力的通用认证。[RuntimeWire的独立发布报道](https://runtimewire.com/article/tavus-griffin-video-turing-test)同样将48%视为一项样本量较小、由公司开展的结果,并指出客户仍无法使用预览版。该研究为参与者在所述条件下的判断提供了证据,但并非经过独立重复验证的欺骗率。

## 另一项基准测试衡量交互质量

NVIDIA的[VideoFDB排行榜](https://research.nvidia.com/labs/amri/projects/video-fdb/)为Griffin-Lite的生成能力打出3.83分(满分5分),感知能力打出3.73分。该基准测试使用真实视频通话片段,并由依照评分标准工作的语言模型进行评判。生成能力评估模型语音、面部表现和对话行为是否恰当;感知能力评估模型对他人音频和视频的响应。NVIDIA表格中,Griffin-Lite在这两个评测方向上均高于所列系统;人类参照组得分分别为3.92和4.20。

这些分数衡量的任务与询问通话参与者是否认为对方是真人不同。两种评测的比较对象和条件也不一样:生成能力表格纳入了由多个模型串联生成语音和虚拟形象的系统;感知能力表格中,系统分别通过音频和视频评估,或另列只使用音频的结果。排行榜支持的是模型在NVIDIA已发布评分规则下的结果。它无法验证Tavus通话研究中48%的数字,也不能说明Griffin作为客户服务、辅导或医疗产品时的表现。

## Tavus如何描述该系统

Tavus将Griffin描述为由两个部分组成的系统。一个持续运行的对话模型接收来电者的音频和视频,并生成控制指令,决定说什么、何时开口以及如何表达。流式语音和视频生成器根据这些指令生成声音和动态画面。公司称,该系统可以边说边听,在被打断时让出发言机会,并根据视觉语境作出反应,而不必等每轮对话结束。这些是Tavus对其技术和演示的描述;BIG CHANGE没有访问预览版,也没有测量其表现。

这一差别很重要,因为生成一张脸并不等于完成了整场互动。如果系统能对停顿、目光和打断作出响应,可能改变通话者是否觉得自己被理解,或是否意识到自己在与软件交流。VideoFDB的结果是在基准测试流程下对对话行为进行评分;Tavus的真人通话研究则是对身份判断的较窄观察。两者都不能替代有关长期可靠性、实际部署时的身份披露,或用户是否知情并同意的公开证据。

## 访问情况与待解决的问题

Tavus称,[Griffin-Lite目前仅向少数受信任的测试者开放](https://www.tavus.io/griffin),作为研究预览版,Tavus客户暂时无法使用。公司提供了测试申请表。Griffin尚未加入其通用平台或公开API;公告也没有给出Griffin的专属价格。Tavus现有的Phoenix、Raven和Sparrow模型仍是另一条已提供的产品路径。

公司称,在扩大开放之前,正在开发披露功能和更多安全措施。目前公司尚未公布发布日期、详细的披露设计,也没有提供这些措施有效的证据。因此,对于评估实时视频智能体的人来说,眼下需要具体回答的问题是:来电者如何知道对方是谁或是什么,以及在Griffin成为客户产品之前,如何核实这类信息披露?

## 资料与延伸阅读

- [Tavus Research,《推出Griffin:首个人机交互模型》](https://www.tavus.io/griffin),2026年10月1日。厂商对系统的说明、研究流程和结果、可用情况及安全声明。真人通话研究由Tavus开展;本次查阅的资料中没有独立重复研究。
- [NVIDIA和David AI,《VideoFDB:评估对话智能体的全双工视觉与语音能力》](https://research.nvidia.com/labs/amri/projects/video-fdb/),于2026年10月2日查阅。基准测试机构的方法说明和实时排行榜,包括Griffin-Lite在生成和感知方面的分数。其模型评判分数与Tavus真人通话研究不同。
- [Ryan Merket,RuntimeWire,《Tavus称Griffin在一分钟视频通话中让48%的测试者误以为对方是真人》](https://runtimewire.com/article/tavus-griffin-video-turing-test),2026年10月1日。独立报道说明了样本量和客户无法使用的问题;作者没有报告独立复测或亲自测试Griffin。

## Sources

- [推出Griffin:首个人机交互模型](https://www.tavus.io/griffin) — Tavus的主要公告:模型说明、公司开展的一分钟真人研究、仅向部分研究测试者开放、披露工作以及客户尚不可用。文中将厂商所谓通过视频图灵测试的解释归因于Tavus,没有将其作为通用结论。
- [VideoFDB——评估对话智能体的全双工视觉与语音能力](https://research.nvidia.com/labs/amri/projects/video-fdb/) — NVIDIA/David AI基准测试机构的方法说明和实时排行榜。Griffin-Lite生成得分为3.83,感知得分为3.73;这两项由模型评判的测试与真人身份识别研究不同。
- [Tavus称Griffin在一分钟视频通话中让48%的测试者误以为对方是真人](https://runtimewire.com/article/tavus-griffin-video-turing-test) — 关于这项样本量较小、由公司开展的研究和客户访问限制的独立发布报道与解读;并非独立重复研究。
BIG CHANGE 新闻通讯

纵览全局,按自己的节奏。

关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。