AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 文字轉語音現在更便宜；2027 年 1 月 1 日起價格將翻倍

> Google 穩定版 Gemini 3.8 TTS 模型降低了生成音訊成本，但價格將於 1 月 1 日翻倍；遷移時也須調整提示詞及 WAV 處理方式。

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google 於 9 月 23 日推出](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)兩款穩定版語音模型進入 Gemini API 與 AI Studio：Flash 適用於創意工作，Flash-Lite 適用於大量生成。Gemini Enterprise API 的存取功能稍後推出。

兩款模型每生成一分鐘音訊的費用，都低於 3.1 Flash TTS Preview；其標準費率將於 2027 年 1 月 1 日翻倍。遷移時也須改動應用程式傳送指令及儲存音訊的方式。

## 重大變化

- **有哪些變化：**新版本將逐字稿文字與表演指示分開，也支援重複使用語音。
- **為何重要：**語音工作流程須考量兩種遷移成本：現在所需的工程修改，以及排定調漲的生成費用。
- **後續觀察重點：**若用於配音、有聲書及語音代理程式，應以實際製作腳本測試不同語言的清晰度與說話者一致性。這些結果才能判斷，每分鐘較便宜的生成音訊是否也降低可用音訊的成本。

## 每分鐘輸出成本

[Google 的定價表](https://ai.google.dev/gemini-api/docs/pricing?hl=en)規定每秒使用 25 個音訊 token，即每分鐘 1,500 個。計算方式為輸出費率 × 1,500 ÷ 1,000,000；文字輸入費用另計。以下數值均為美元標準費率。

| 模型 | 列出的語言數 | 截至 2026 年 12 月 31 日，每百萬 token 輸入／輸出價格 | 目前每分鐘輸出成本 | 2027 年 1 月 1 日起每分鐘輸出成本 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50／$9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50／$6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1／$20 | $0.03 | 未宣布價格調整 |

3.8 模型的 Batch 與 Flex 費率是 Standard 的一半；Priority 則為 Standard 的 1.8 倍。Google 的[模型索引](https://ai.google.dev/gemini-api/docs/models)建議以兩款新版取代舊版 3.1 Preview。

## 提示詞與音訊檔案須調整

《[Flash 遷移指南](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)》指出，逐字稿文字會照原文唸出。持續有效的指示及說話者標籤應放在「`speech_metadata`」欄位中；舊指令如「Say cheerfully:」可能會被直接唸出。簡短事件例如「`<laugh>`」則維持行內。

每個多說話者對話輪次都必須指定與設定相符的說話者。單聲道回應現在會包含 WAV 標頭，取代舊版預設的原始 PCM 格式。請移除自行加上 WAV 標頭的程式碼，或明確要求輸出原始格式。

[Flash-Lite 文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)確認兩個級別採用共用結構，輸入上限為 8,192 token、輸出上限為 16,384 token。因此，應用程式可透過相同整合方式比較兩者。

## 語音複製與評估

Google 表示，系統提供超過 2,000 種現成語音、語音設計功能，以及以使用者有權使用的 30 秒語音樣本進行複製。複製語音須提供相符的口頭同意錄音。Google 表示，生成的音訊片段會帶有 SynthID，複製語音則附有 C2PA 憑證。

AI Studio 語音複製功能不適用於伊利諾州、德州、歐洲經濟區、英國、瑞士及印度。

Google 表示，Flash 在 Hume Voice Design Benchmark 的整體分數為 71.4，口音建模分數為 60.8；在 Hume Overall Quality Index 中，Flash 與 Lite 分居第一及第二。

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)另於 9 月 23 日將 Flash 列為 Arena Elo 1260.15，在 95 個模型中排名第 27。此分數衡量群眾偏好；本文查閱的列表無法證明各語言或長時間錄音的表現，也未採用同等的 Lite 獨立結果。

若要與另一組託管語音模型比較，請參閱我們的[Qwen Audio 3.1 API 與價格分析](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)。

## Sources

- [Gemini 3.8 文字轉語音正式推出](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Google 的官方發布說明產品推出範圍、模型定位、語言數量、語音功能、同意規範、區域開放情況及 Google 公布的基準結果。品質主張均保留為 Google 的說法。
- [Gemini 3.8 Flash TTS 模型文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 現行請求結構、輸入及輸出上限、逐字稿處理、行內事件標記、多說話者驗證，以及預設輸出由原始 PCM 改為 WAV 的說明。
- [Gemini 3.8 Flash-Lite TTS 模型文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 現行文件介紹高吞吐量級別、所列的 101 種語言，以及與 3.8 共用的介面。
- [Gemini API 價格](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — 官方 Standard、Batch、Flex 及 Priority 費率，12 月 31 日優惠價格截止日期、1 月 1 日新費率，以及每秒 25 個音訊 token 的換算方式。
- [語音生成](https://ai.google.dev/gemini-api/docs/speech-generation) — 現行語音指南說明 3.8 語言表、逐字稿處理及遷移行為。其現行語言表無法確認舊版 Preview 支援的語言總數。
- [Gemini 模型](https://ai.google.dev/gemini-api/docs/models) — 現行模型索引將 3.1 Flash TTS 標示為舊版預覽模型，並建議改用 Gemini 3.8 Flash TTS 或 Flash-Lite TTS。
- [Gemini 3.8 Flash TTS 品質、速度與價格分析](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 推出當日發布的獨立列表，針對 Flash 型號報告 Arena Elo 1260.15，查閱時在 95 個模型中排名第 27。排名可能變動，且不代表多語言或長篇內容的驗證結果。
