Google 於 9 月 23 日推出兩款穩定版語音模型進入 Gemini API 與 AI Studio:Flash 適用於創意工作,Flash-Lite 適用於大量生成。Gemini Enterprise API 的存取功能稍後推出。
兩款模型每生成一分鐘音訊的費用,都低於 3.1 Flash TTS Preview;其標準費率將於 2027 年 1 月 1 日翻倍。遷移時也須改動應用程式傳送指令及儲存音訊的方式。
重大變化
- 有哪些變化:新版本將逐字稿文字與表演指示分開,也支援重複使用語音。
- 為何重要:語音工作流程須考量兩種遷移成本:現在所需的工程修改,以及排定調漲的生成費用。
- 後續觀察重點:若用於配音、有聲書及語音代理程式,應以實際製作腳本測試不同語言的清晰度與說話者一致性。這些結果才能判斷,每分鐘較便宜的生成音訊是否也降低可用音訊的成本。
每分鐘輸出成本
Google 的定價表規定每秒使用 25 個音訊 token,即每分鐘 1,500 個。計算方式為輸出費率 × 1,500 ÷ 1,000,000;文字輸入費用另計。以下數值均為美元標準費率。
模型 | 列出的語言數 | 截至 2026 年 12 月 31 日,每百萬 token 輸入/輸出價格 | 目前每分鐘輸出成本 | 2027 年 1 月 1 日起每分鐘輸出成本 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50/$9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50/$6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1/$20 | $0.03 | 未宣布價格調整 |
3.8 模型的 Batch 與 Flex 費率是 Standard 的一半;Priority 則為 Standard 的 1.8 倍。Google 的模型索引建議以兩款新版取代舊版 3.1 Preview。
提示詞與音訊檔案須調整
《Flash 遷移指南》指出,逐字稿文字會照原文唸出。持續有效的指示及說話者標籤應放在「speech_metadata」欄位中;舊指令如「Say cheerfully:」可能會被直接唸出。簡短事件例如「<laugh>」則維持行內。
每個多說話者對話輪次都必須指定與設定相符的說話者。單聲道回應現在會包含 WAV 標頭,取代舊版預設的原始 PCM 格式。請移除自行加上 WAV 標頭的程式碼,或明確要求輸出原始格式。
Flash-Lite 文件確認兩個級別採用共用結構,輸入上限為 8,192 token、輸出上限為 16,384 token。因此,應用程式可透過相同整合方式比較兩者。
語音複製與評估
Google 表示,系統提供超過 2,000 種現成語音、語音設計功能,以及以使用者有權使用的 30 秒語音樣本進行複製。複製語音須提供相符的口頭同意錄音。Google 表示,生成的音訊片段會帶有 SynthID,複製語音則附有 C2PA 憑證。
AI Studio 語音複製功能不適用於伊利諾州、德州、歐洲經濟區、英國、瑞士及印度。
Google 表示,Flash 在 Hume Voice Design Benchmark 的整體分數為 71.4,口音建模分數為 60.8;在 Hume Overall Quality Index 中,Flash 與 Lite 分居第一及第二。
Artificial Analysis另於 9 月 23 日將 Flash 列為 Arena Elo 1260.15,在 95 個模型中排名第 27。此分數衡量群眾偏好;本文查閱的列表無法證明各語言或長時間錄音的表現,也未採用同等的 Lite 獨立結果。
若要與另一組託管語音模型比較,請參閱我們的Qwen Audio 3.1 API 與價格分析。



