Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# Gemini 3.8 文字轉語音現在更便宜;2027 年 1 月 1 日起價格將翻倍
> Google 穩定版 Gemini 3.8 TTS 模型降低了生成音訊成本,但價格將於 1 月 1 日翻倍;遷移時也須調整提示詞及 WAV 處理方式。
By BIG CHANGE Editorial
Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

AI-generated conceptual illustration by BIG CHANGE.
[Google 於 9 月 23 日推出](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)兩款穩定版語音模型進入 Gemini API 與 AI Studio:Flash 適用於創意工作,Flash-Lite 適用於大量生成。Gemini Enterprise API 的存取功能稍後推出。
兩款模型每生成一分鐘音訊的費用,都低於 3.1 Flash TTS Preview;其標準費率將於 2027 年 1 月 1 日翻倍。遷移時也須改動應用程式傳送指令及儲存音訊的方式。
## 重大變化
- **有哪些變化:**新版本將逐字稿文字與表演指示分開,也支援重複使用語音。
- **為何重要:**語音工作流程須考量兩種遷移成本:現在所需的工程修改,以及排定調漲的生成費用。
- **後續觀察重點:**若用於配音、有聲書及語音代理程式,應以實際製作腳本測試不同語言的清晰度與說話者一致性。這些結果才能判斷,每分鐘較便宜的生成音訊是否也降低可用音訊的成本。
## 每分鐘輸出成本
[Google 的定價表](https://ai.google.dev/gemini-api/docs/pricing?hl=en)規定每秒使用 25 個音訊 token,即每分鐘 1,500 個。計算方式為輸出費率 × 1,500 ÷ 1,000,000;文字輸入費用另計。以下數值均為美元標準費率。
| 模型 | 列出的語言數 | 截至 2026 年 12 月 31 日,每百萬 token 輸入/輸出價格 | 目前每分鐘輸出成本 | 2027 年 1 月 1 日起每分鐘輸出成本 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50/$9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50/$6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1/$20 | $0.03 | 未宣布價格調整 |
3.8 模型的 Batch 與 Flex 費率是 Standard 的一半;Priority 則為 Standard 的 1.8 倍。Google 的[模型索引](https://ai.google.dev/gemini-api/docs/models)建議以兩款新版取代舊版 3.1 Preview。
## 提示詞與音訊檔案須調整
《[Flash 遷移指南](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)》指出,逐字稿文字會照原文唸出。持續有效的指示及說話者標籤應放在「`speech_metadata`」欄位中;舊指令如「Say cheerfully:」可能會被直接唸出。簡短事件例如「`<laugh>`」則維持行內。
每個多說話者對話輪次都必須指定與設定相符的說話者。單聲道回應現在會包含 WAV 標頭,取代舊版預設的原始 PCM 格式。請移除自行加上 WAV 標頭的程式碼,或明確要求輸出原始格式。
[Flash-Lite 文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)確認兩個級別採用共用結構,輸入上限為 8,192 token、輸出上限為 16,384 token。因此,應用程式可透過相同整合方式比較兩者。
## 語音複製與評估
Google 表示,系統提供超過 2,000 種現成語音、語音設計功能,以及以使用者有權使用的 30 秒語音樣本進行複製。複製語音須提供相符的口頭同意錄音。Google 表示,生成的音訊片段會帶有 SynthID,複製語音則附有 C2PA 憑證。
AI Studio 語音複製功能不適用於伊利諾州、德州、歐洲經濟區、英國、瑞士及印度。
Google 表示,Flash 在 Hume Voice Design Benchmark 的整體分數為 71.4,口音建模分數為 60.8;在 Hume Overall Quality Index 中,Flash 與 Lite 分居第一及第二。
[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)另於 9 月 23 日將 Flash 列為 Arena Elo 1260.15,在 95 個模型中排名第 27。此分數衡量群眾偏好;本文查閱的列表無法證明各語言或長時間錄音的表現,也未採用同等的 Lite 獨立結果。
若要與另一組託管語音模型比較,請參閱我們的[Qwen Audio 3.1 API 與價格分析](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)。
## Sources
- [Gemini 3.8 文字轉語音正式推出](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Google 的官方發布說明產品推出範圍、模型定位、語言數量、語音功能、同意規範、區域開放情況及 Google 公布的基準結果。品質主張均保留為 Google 的說法。
- [Gemini 3.8 Flash TTS 模型文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 現行請求結構、輸入及輸出上限、逐字稿處理、行內事件標記、多說話者驗證,以及預設輸出由原始 PCM 改為 WAV 的說明。
- [Gemini 3.8 Flash-Lite TTS 模型文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 現行文件介紹高吞吐量級別、所列的 101 種語言,以及與 3.8 共用的介面。
- [Gemini API 價格](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — 官方 Standard、Batch、Flex 及 Priority 費率,12 月 31 日優惠價格截止日期、1 月 1 日新費率,以及每秒 25 個音訊 token 的換算方式。
- [語音生成](https://ai.google.dev/gemini-api/docs/speech-generation) — 現行語音指南說明 3.8 語言表、逐字稿處理及遷移行為。其現行語言表無法確認舊版 Preview 支援的語言總數。
- [Gemini 模型](https://ai.google.dev/gemini-api/docs/models) — 現行模型索引將 3.1 Flash TTS 標示為舊版預覽模型,並建議改用 Gemini 3.8 Flash TTS 或 Flash-Lite TTS。
- [Gemini 3.8 Flash TTS 品質、速度與價格分析](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 推出當日發布的獨立列表,針對 Flash 型號報告 Arena Elo 1260.15,查閱時在 95 個模型中排名第 27。排名可能變動,且不代表多語言或長篇內容的驗證結果。
BIG CHANGE 電子報
掌握全貌,按照自己的步調。
關於人工智慧和機器人技術的近期報導、值得關注的轉變,以及可運用的實用想法。選擇每日快訊、每週摘要或每月觀點。
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.