Tavusによると、新モデルGriffin-Liteを使った1分間のビデオ通話で、54人中26人が実際の人と話したと思った。Tavusが実施した研究として注目すべき結果だが、測定したのは特定の通話と質問への反応である。Griffin-Liteは現在も選ばれたテスター向けの研究プレビューで、顧客が利用する前に開示に関する安全策を開発中だとTavusは述べている。

大きな変化

  • 何が変わったか:Tavusは、映像アシスタント研究を、同じ会話中に相手の話を聞き、映像を見て、顔と声を生成するシステムへ進めた。企業が実施した短い通話では、54人中26人がモデルを人間だと思った。
  • なぜ重要か:ビデオエージェントを設計するチームにとって、会話のタイミングや表情豊かな映像は、利用者が対話しやすいインターフェースにつながる可能性がある。同じ研究結果は、相手にAIと伝える対応を後回しにできないことも示している。
  • 今後の注目点:Griffin-Liteを使えるのは選ばれた研究テスターに限られる。Tavusは開示機能と追加の安全手順を開発中としているが、その具体的な内容や有効性、顧客への提供時期、Griffin専用の料金は未発表だ。

54人中26人という結果が測ったもの

詳しくはTavusの10月1日の研究報告で、参加者は「今年楽しみにしていること」をテーマに、別の参加者と1分間のビデオ通話をすると説明された。実際の相手はGriffin-Liteを搭載したTavusのAIペルソナだった。通話後、参加者はやり取りを評価し、相手が本物でないのではと考えたかを尋ねられた。その後、Tavusは相手がAIだったと明かした。

Griffin-Liteとの通話に参加した54人のうち26人は、相手が実在の人物だったと答えた。割合にすると約48%だ。Tavusによると、以前のPhoenix-4.5、Sparrow-2、Raven-1のシステムにも同じ手順を用いたが、そのグループでは41人中1人が相手を人間だと答えた。参加者は別々の集団であり、同じ人を対象にした導入前後の比較ではない。この発表から、通話が長い場合、話題が異なる場合、AIエージェントの登場を想定できる日常利用で回答がどう変わるかは分からない。

Tavusはこの結果を、リアルタイム動画版チューリングテストの合格と呼んでいる。これは同社が1分間の研究について用いた表現であり、人間らしい会話を普遍的に認定するものではない。RuntimeWireの独立した発表報道も、48%という数字を企業が実施した小規模な研究の結果と捉え、プレビューがまだ顧客に提供されていないと指摘している。この研究は、明示された条件のもとでの参加者の判断を示すもので、だまされる割合を独立に再現した結果ではない。

別のベンチマークが対話品質を評価する

NVIDIAのVideoFDBランキングでは、Griffin-Liteは生成で5点中3.83、知覚で3.73を獲得している。このベンチマークは実際のビデオ通話の映像クリップを使い、基準に沿って言語モデルが評価する。生成の評価対象は、モデルの声、顔、会話の振る舞いの適切さだ。知覚では、人の音声と映像に対する応答を評価する。NVIDIAの表ではGriffin-Liteは両方の項目で掲載システムを上回る一方、人間を基準としたスコアはそれぞれ3.92と4.20だ。

これらのスコアは、通話相手が人間だと思うかを尋ねる課題とは異なる。比較対象と条件も異なり、生成の表には音声からアバターを作る段階型システムが含まれる。知覚の表には音声と映像の両方で評価したシステムと、別枠で音声のみを評価したシステムがある。このランキングが裏付けるのは、NVIDIAが公表した評価基準における結果だ。Tavusの通話研究の48%を検証するものでも、カスタマーサービス、個別指導、医療製品としての性能を示すものでもない。

Tavusが説明するシステムの仕組み

TavusはGriffinを二つの部分からなる設計として説明する。継続的に会話するモデルが相手の音声と映像を受け取り、何をいつ話すか、どう表現するかを制御する。ストリーミング音声・映像生成器が、その指示を声と動く映像に変換する。同社によると、このシステムは話しながら聞き、割り込まれたら発話を譲り、毎回のターンが終わるまで待つのではなく視覚的な状況に反応できる。これらはTavusによる技術説明とデモであり、BIG CHANGEはプレビューにアクセスしておらず、挙動も測定していない。

この違いが重要なのは、生成された顔だけで対話全体が決まるわけではないからだ。間、視線、割り込みに反応するシステムなら、通話相手が理解されたと感じるか、ソフトウェアと話していると気づくかが変わる可能性がある。VideoFDBの結果は、ベンチマーク手順に基づく対話行動の採点比較だ。Tavusの人間参加者による通話研究が観察したのは、より限定された本人確認の判断である。どちらも、長時間にわたる信頼性、実運用での開示、利用者の十分な同意について公開された根拠の代わりにはならない。

利用状況と今後の判断

Tavusによると、Griffin-Liteを利用できるのは、選ばれた信頼できるテスターに限られる研究プレビューであり、Tavusの顧客は利用できない。同社はテスト希望者向けの申請フォームを用意している。Griffinはまだ一般向けプラットフォームや公開APIでは提供されておらず、発表にはGriffin専用の料金も記載されていない。既存のPhoenix、Raven、Sparrowモデルは別の現行製品として提供が続いている。

同社は、より広く提供する前に開示機能と追加の安全手順に取り組んでいると述べる。日程、開示設計の詳細、対策が機能するという根拠は公表していない。リアルタイム動画エージェントを評価する人が今確認すべき点は具体的だ。Griffinが顧客向け製品になる前に、通話相手は画面の向こうに誰または何がいるかをどう知り、それをどう確認できるのか。

出典・参考資料