Google 於 9 月 23 日推出兩款穩定版語音模型進入 Gemini API 與 AI Studio:Flash 適用於創意工作,Flash-Lite 適用於大量生成。Gemini Enterprise API 的存取功能稍後推出。

兩款模型每生成一分鐘音訊的費用,都低於 3.1 Flash TTS Preview;其標準費率將於 2027 年 1 月 1 日翻倍。遷移時也須改動應用程式傳送指令及儲存音訊的方式。

重大變化

  • 有哪些變化:新版本將逐字稿文字與表演指示分開,也支援重複使用語音。
  • 為何重要:語音工作流程須考量兩種遷移成本:現在所需的工程修改,以及排定調漲的生成費用。
  • 後續觀察重點:若用於配音、有聲書及語音代理程式,應以實際製作腳本測試不同語言的清晰度與說話者一致性。這些結果才能判斷,每分鐘較便宜的生成音訊是否也降低可用音訊的成本。

每分鐘輸出成本

Google 的定價表規定每秒使用 25 個音訊 token,即每分鐘 1,500 個。計算方式為輸出費率 × 1,500 ÷ 1,000,000;文字輸入費用另計。以下數值均為美元標準費率。

模型

列出的語言數

截至 2026 年 12 月 31 日,每百萬 token 輸入/輸出價格

目前每分鐘輸出成本

2027 年 1 月 1 日起每分鐘輸出成本

Gemini 3.8 Flash TTS

130

$0.50/$9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

101

$0.50/$6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1/$20

$0.03

未宣布價格調整

3.8 模型的 Batch 與 Flex 費率是 Standard 的一半;Priority 則為 Standard 的 1.8 倍。Google 的模型索引建議以兩款新版取代舊版 3.1 Preview。

提示詞與音訊檔案須調整

《Flash 遷移指南》指出,逐字稿文字會照原文唸出。持續有效的指示及說話者標籤應放在「speech_metadata」欄位中;舊指令如「Say cheerfully:」可能會被直接唸出。簡短事件例如「<laugh>」則維持行內。

每個多說話者對話輪次都必須指定與設定相符的說話者。單聲道回應現在會包含 WAV 標頭,取代舊版預設的原始 PCM 格式。請移除自行加上 WAV 標頭的程式碼,或明確要求輸出原始格式。

Flash-Lite 文件確認兩個級別採用共用結構,輸入上限為 8,192 token、輸出上限為 16,384 token。因此,應用程式可透過相同整合方式比較兩者。

語音複製與評估

Google 表示,系統提供超過 2,000 種現成語音、語音設計功能,以及以使用者有權使用的 30 秒語音樣本進行複製。複製語音須提供相符的口頭同意錄音。Google 表示,生成的音訊片段會帶有 SynthID,複製語音則附有 C2PA 憑證。

AI Studio 語音複製功能不適用於伊利諾州、德州、歐洲經濟區、英國、瑞士及印度。

Google 表示,Flash 在 Hume Voice Design Benchmark 的整體分數為 71.4,口音建模分數為 60.8;在 Hume Overall Quality Index 中,Flash 與 Lite 分居第一及第二。

Artificial Analysis另於 9 月 23 日將 Flash 列為 Arena Elo 1260.15,在 95 個模型中排名第 27。此分數衡量群眾偏好;本文查閱的列表無法證明各語言或長時間錄音的表現,也未採用同等的 Lite 獨立結果。

若要與另一組託管語音模型比較,請參閱我們的Qwen Audio 3.1 API 與價格分析。