Google 於 9 月 24 日正式推出 Gemini 3.8 Live 的 Live Avatar。這項功能為公司的即時語音模型加入會說話的動畫臉孔;模型也能在對話期間接收相機或螢幕畫面,並呼叫外部工具。對打造面向客戶之代理系統的開發者而言,實際變化是可透過有文件說明的 API,整合影片輸出。這項公告並未證明虛擬形象能改善服務成果,或在各種情境下都能可靠運作。

重大變化

  • 有哪些改變:Google 的開發者指南為先前 Live 模型提供的語音輸出新增同步虛擬形象影片。開發者現在可透過單一串流 API 同時取得說話的臉孔與語音。
  • 為何重要:打造客服代理系統的團隊,可加入視覺化呈現,無須另外建立虛擬形象生成流程。應用程式仍須執行工具呼叫並處理失敗;動畫本身不能證明交易已成功完成。
  • 接下來觀察:眼前的設計選擇,是使用預設虛擬形象,還是自訂人物形象。Google 的設定指南限制只有特定客戶能使用自訂虛擬形象,並要求取得臉部或語音樣本的相關權利與同意。因此,若要使用品牌人物形象,還須另外確認存取權限及同意程序。

虛擬形象已開放;自訂人物形象另有審核門檻

在其推出公告中,Google 展示虛擬形象如何回應即時音訊與影像、切換語言,並在工具呼叫執行期間繼續進行飯店入住對話。這些是公司展示,說明預期的互動方式,但未提供錯誤率、無障礙成效或改善客服品質的實測證據。

Google 的Cloud 公告指出,這項功能已在 Gemini Enterprise 及 API 正式開放,並提供美國與歐盟端點。開發者可選用預設虛擬形象。若要以某人的參考照片建立形象,目前僅限特定企業客戶使用,且須透過 Google Cloud 申請存取權限。設定指南指出,客戶有責任取得處理臉部或語音樣本所需的權利與同意。

模型頁面列出模型 IDgemini-3.8-live,以及以下地區的服務可用性:us、eu多區域,還有us-central1地區。頁面也列出按量付費及預留吞吐量兩種支援的計費方式。團隊應先確認自身部署所用的端點與商業條款,再將「正式開放」視為普遍都能存取。

對話仍取決於應用程式本身

Google 將 Gemini 3.8 Live 描述為語音對語音系統,可接收即時相機影格或螢幕分享,並回傳語音與影片。其開發者指南區分兩種工具呼叫:一種是在代理繼續說話時執行,另一種則會暫停並等待回應。應用程式仍須連接並授權自己的工具、處理結果,並決定代理可採取哪些行動。查詢期間畫面上的臉孔持續顯示,不代表查詢已成功。

指南指出,工具回應應回報狀態並說明是否適合重試;回應必須對應原始呼叫 ID;開發者也應限制重複呼叫工具的次數。這些要求會影響代理如何處理查無帳戶資料或作業遭中斷等情況。Google 也表示 Gemini 3.8 Live 可切換 97 種語言。本次未獨立測量公告所稱的唇部動作在各語言間都能保持同步。

Google 表示,生成的音訊與影片帶有 SynthID 浮水印,並限制建立自訂人物形象。這些是所宣稱的防護措施,並不能證明每位觀眾都看得出虛擬形象是合成內容,或能防止濫用。評估實際部署時,仍須檢視同意與揭露方式、即時相機與語音資料的處理、工具呼叫失敗、遭中斷時的行為,以及實際使用者體驗到的效能。已發布的推出資料與文件並未提供這些結果。

來源與延伸閱讀

  • Google 的 Live Avatar 公告(2026 年 9 月 24 日)說明並展示公司預期的互動方式、多語言虛擬形象及 SynthID 等主張。其示範並非獨立效能測試。
  • Google Cloud 正式開放公告(2026 年 9 月 24 日)列明企業端可用情況、美國與歐盟端點、預設與須經核准的自訂虛擬形象,以及應用範例。文中的客戶說法屬宣傳性陳述,並非本文採用的成果測量。
  • Gemini 3.8 Live 開發者指南(2026 年 9 月 24 日更新)說明模型比較、串流格式與工具呼叫行為。內容描述 API 的預期行為,並非特定部署的效能實測。
  • Gemini 3.8 Live 模型頁面(2026 年 9 月 24 日更新)列出模型 ID、正式發布日期、服務地區與計費方式。各專案與端點是否可用,仍應分別確認。
  • 設定即時虛擬形象(2026 年 9 月 25 日查閱)說明預設虛擬形象的 API 設定,以及自訂人物形象的存取與同意要求。