Markdown版
AI-translated from English; not yet reviewed by a fluent editor.
# Tavus Griffinの1分間のビデオ通話実験が示すこと
> Tavusが実施した1分間の通話では、54人中26人がGriffin-Liteを人間だと思った。この研究、NVIDIAのベンチマーク、限定プレビューはそれぞれ異なる問いに答える。
By BIG CHANGE Editorial
Published: 2026-10-02T15:28:31.155Z
Updated: 2026-10-02T15:28:31.155Z
Canonical: https://bigchange.ai/blog/tavus-griffin-one-minute-video-call-study

AI-generated conceptual illustration by BIG CHANGE.
Tavusによると、新モデルGriffin-Liteを使った1分間のビデオ通話で、54人中26人が実際の人と話したと思った。Tavusが実施した研究として注目すべき結果だが、測定したのは特定の通話と質問への反応である。Griffin-Liteは現在も選ばれたテスター向けの研究プレビューで、顧客が利用する前に開示に関する安全策を開発中だとTavusは述べている。
## 大きな変化
- **何が変わったか:**Tavusは、映像アシスタント研究を、同じ会話中に相手の話を聞き、映像を見て、顔と声を生成するシステムへ進めた。企業が実施した短い通話では、54人中26人がモデルを人間だと思った。
- **なぜ重要か:**ビデオエージェントを設計するチームにとって、会話のタイミングや表情豊かな映像は、利用者が対話しやすいインターフェースにつながる可能性がある。同じ研究結果は、相手にAIと伝える対応を後回しにできないことも示している。
- **今後の注目点:**Griffin-Liteを使えるのは選ばれた研究テスターに限られる。Tavusは開示機能と追加の安全手順を開発中としているが、その具体的な内容や有効性、顧客への提供時期、Griffin専用の料金は未発表だ。
## 54人中26人という結果が測ったもの
詳しくは[Tavusの10月1日の研究報告](https://www.tavus.io/griffin)で、参加者は「今年楽しみにしていること」をテーマに、別の参加者と1分間のビデオ通話をすると説明された。実際の相手はGriffin-Liteを搭載したTavusのAIペルソナだった。通話後、参加者はやり取りを評価し、相手が本物でないのではと考えたかを尋ねられた。その後、Tavusは相手がAIだったと明かした。
Griffin-Liteとの通話に参加した54人のうち26人は、相手が実在の人物だったと答えた。割合にすると約48%だ。Tavusによると、以前のPhoenix-4.5、Sparrow-2、Raven-1のシステムにも同じ手順を用いたが、そのグループでは41人中1人が相手を人間だと答えた。参加者は別々の集団であり、同じ人を対象にした導入前後の比較ではない。この発表から、通話が長い場合、話題が異なる場合、AIエージェントの登場を想定できる日常利用で回答がどう変わるかは分からない。
Tavusはこの結果を、リアルタイム動画版チューリングテストの合格と呼んでいる。これは同社が1分間の研究について用いた表現であり、人間らしい会話を普遍的に認定するものではない。[RuntimeWireの独立した発表報道](https://runtimewire.com/article/tavus-griffin-video-turing-test)も、48%という数字を企業が実施した小規模な研究の結果と捉え、プレビューがまだ顧客に提供されていないと指摘している。この研究は、明示された条件のもとでの参加者の判断を示すもので、だまされる割合を独立に再現した結果ではない。
## 別のベンチマークが対話品質を評価する
NVIDIAの[VideoFDBランキング](https://research.nvidia.com/labs/amri/projects/video-fdb/)では、Griffin-Liteは生成で5点中3.83、知覚で3.73を獲得している。このベンチマークは実際のビデオ通話の映像クリップを使い、基準に沿って言語モデルが評価する。生成の評価対象は、モデルの声、顔、会話の振る舞いの適切さだ。知覚では、人の音声と映像に対する応答を評価する。NVIDIAの表ではGriffin-Liteは両方の項目で掲載システムを上回る一方、人間を基準としたスコアはそれぞれ3.92と4.20だ。
これらのスコアは、通話相手が人間だと思うかを尋ねる課題とは異なる。比較対象と条件も異なり、生成の表には音声からアバターを作る段階型システムが含まれる。知覚の表には音声と映像の両方で評価したシステムと、別枠で音声のみを評価したシステムがある。このランキングが裏付けるのは、NVIDIAが公表した評価基準における結果だ。Tavusの通話研究の48%を検証するものでも、カスタマーサービス、個別指導、医療製品としての性能を示すものでもない。
## Tavusが説明するシステムの仕組み
TavusはGriffinを二つの部分からなる設計として説明する。継続的に会話するモデルが相手の音声と映像を受け取り、何をいつ話すか、どう表現するかを制御する。ストリーミング音声・映像生成器が、その指示を声と動く映像に変換する。同社によると、このシステムは話しながら聞き、割り込まれたら発話を譲り、毎回のターンが終わるまで待つのではなく視覚的な状況に反応できる。これらはTavusによる技術説明とデモであり、BIG CHANGEはプレビューにアクセスしておらず、挙動も測定していない。
この違いが重要なのは、生成された顔だけで対話全体が決まるわけではないからだ。間、視線、割り込みに反応するシステムなら、通話相手が理解されたと感じるか、ソフトウェアと話していると気づくかが変わる可能性がある。VideoFDBの結果は、ベンチマーク手順に基づく対話行動の採点比較だ。Tavusの人間参加者による通話研究が観察したのは、より限定された本人確認の判断である。どちらも、長時間にわたる信頼性、実運用での開示、利用者の十分な同意について公開された根拠の代わりにはならない。
## 利用状況と今後の判断
Tavusによると、[Griffin-Liteを利用できるのは、選ばれた信頼できるテスターに限られる](https://www.tavus.io/griffin)研究プレビューであり、Tavusの顧客は利用できない。同社はテスト希望者向けの申請フォームを用意している。Griffinはまだ一般向けプラットフォームや公開APIでは提供されておらず、発表にはGriffin専用の料金も記載されていない。既存のPhoenix、Raven、Sparrowモデルは別の現行製品として提供が続いている。
同社は、より広く提供する前に開示機能と追加の安全手順に取り組んでいると述べる。日程、開示設計の詳細、対策が機能するという根拠は公表していない。リアルタイム動画エージェントを評価する人が今確認すべき点は具体的だ。Griffinが顧客向け製品になる前に、通話相手は画面の向こうに誰または何がいるかをどう知り、それをどう確認できるのか。
## 出典・参考資料
- [Tavus Research「Griffinの紹介:初の人間対話モデル」](https://www.tavus.io/griffin)、2026年10月1日。製品提供元によるシステム説明、研究手順と結果、利用状況、安全性に関する説明。人間との通話研究はTavusが実施したもので、今回確認した資料には独立した再現研究はない。
- [NVIDIAおよびDavid AI「VideoFDB:対話エージェントの全二重型視覚・音声能力を評価する」](https://research.nvidia.com/labs/amri/projects/video-fdb/)、2026年10月2日確認。ベンチマーク運営者による方法と最新のランキング。Griffin-Liteの生成・知覚スコアを含む。モデル評価者による採点は、Tavusの人間との通話研究とは別のもの。
- [Ryan Merket、RuntimeWire「Tavusによると、1分間のビデオ通話でテスターの48%がGriffinを人間だと思った」](https://runtimewire.com/article/tavus-griffin-video-turing-test)、2026年10月1日。標本数と顧客が利用できない状況を示す独立報道。独自の再現実験やGriffinの実機テストは報告していない。
## Sources
- [Griffinの紹介:初の人間対話モデル](https://www.tavus.io/griffin) — Tavusによる一次発表。モデルの説明、同社が実施した1分間の人間参加者研究、選抜制の研究プレビュー、開示対策の開発、顧客が利用できない現状を掲載。動画チューリングテスト合格という見方は提供元の解釈として扱い、普遍的な結果とはしていない。
- [VideoFDB:対話エージェントの全二重型視覚・音声能力を評価する](https://research.nvidia.com/labs/amri/projects/video-fdb/) — NVIDIAとDavid AIが運営するベンチマークの方法と最新ランキング。Griffin-Liteの生成スコアは3.83、知覚スコアは3.73。モデル評価者による別個の採点軸で、人間かどうかを調べる研究ではない。
- [Tavusによると、1分間のビデオ通話でテスターの48%がGriffinを人間だと思った](https://runtimewire.com/article/tavus-griffin-video-turing-test) — 小規模な企業実施の通話研究と、顧客が利用できない状況に関する独立した報道と見解。独立した再現ではない。
BIG CHANGEニュースレター
大局を、あなたのペースで。
AI とロボティクスの最新記事、注目すべき変化、活用できる実用的なアイデア。日刊ブリーフィング、週刊ダイジェスト、月刊展望から選べます。
ベオグラード時間 09:00 に送信:毎日、月曜日、または月初。確認後、次回の予定配信時に初回号が届きます。