Googleは9月24日、Gemini 3.8 LiveとともにLive Avatarの一般提供を開始した。音声と同時に、動いて話す顔を表示できるようになった。同社のライブ音声モデルは、会話中にカメラや画面の入力を受け取り、外部ツールを呼び出すこともできる。顧客対応エージェントを開発する人にとっての実務上の変化は、動画出力と文書化されたAPI経路が統合されたことだ。アバターによってサービス成果が向上することや、あらゆる環境で安定して動作することを、この発表が立証しているわけではない。

大きな変化

公開開始時の

ブログ投稿でGoogleは、ライブ音声や映像入力に応じ、言語を切り替え、ツールの実行中にホテルのチェックイン会話を続けるアバターを紹介している。いずれも企業によるデモだ。想定されるやり取りは示すが、誤り率、アクセシビリティの成果、顧客サービスの改善を測定した結果は示していない。Google Cloudの

発表によると、この機能はGemini EnterpriseとAPIで一般提供され、米国とEUのエンドポイントから利用できる。開発者は既成アバターを選べる。人物の参照画像からアバターを作成する機能は一部の企業顧客に限られ、Google Cloudを通じてアクセスを申請する必要がある。設定ガイドでは、顔や声のサンプルを処理するために必要な権利と同意を得る責任は顧客側にあるとしている。モデルページには

が記載され、提供地域はgemini-3.8-liveおよびusのマルチリージョンとeuでの利用が可能とされている。同ページは、通常の従量課金制とプロビジョンド・スループットの両方を利用方式として挙げる。一般提供をどこでも利用できるとみなす前に、各チームは自らの導入環境に適用されるエンドポイントと商用条件を確認する必要がある。us-central1会話の成否は引き続きアプリに左右される

GoogleはGemini 3.8 Liveを、ライブカメラ映像や画面共有を入力として受け取り、音声と動画を返す音声対音声のシステムと説明する。その

開発者向けガイドでは、エージェントが話し続けながら実行するツール呼び出しと、応答を待ってから続けるブロッキング呼び出しを区別している。アプリ側では、ツールを接続して利用を認可し、結果を処理し、エージェントが取れる行動を決める必要がある。検索中に顔が画面に表示され続けても、検索に成功した証拠にはならない。ガイドによると、ツールの応答には状態と再試行が妥当かどうかを含める必要があり、元の呼び出しIDと一致させなければならない。また開発者はツールの連続呼び出しに上限を設けるべきだ。こうした要件は、アカウント検索で結果が得られない場合や会話が中断された場合の処理に関わる。Googleによると、Gemini 3.8 Liveは97言語を切り替えられる。言語が変わっても唇の動きが同期するという発表上の主張は、ここでは独立に測定していない。

Googleは生成された音声と動画にSynthIDの透かしを付与し、独自アバターの作成を制限すると説明する。これらは企業が示す安全策であり、すべての視聴者がアバターを合成だと見抜けることや、悪用を防げることの証拠ではない。導入を評価するには、実際の利用者を対象に、同意、告知、ライブ映像・音声データの扱い、ツール呼び出しの失敗、中断時の動作、実測性能を確認する必要がある。公開された発表資料と文書には、そうした結果は含まれていない。

出典・関連資料

Google「Gemini 3.8 LiveとLive Avatarの紹介」