AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS 现在更便宜，但价格将于 1 月 1 日翻倍

> Google 稳定版 Gemini 3.8 TTS 模型降低了生成音频成本，但标准价格将于 1 月 1 日翻倍，迁移还会改变提示词结构和 WAV 音频处理方式。

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google 于 9 月 23 日发布的产品](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)为 Gemini API 和 AI Studio 带来两款正式版语音模型：适用于创意工作的 Flash 和适用于高吞吐量的 Flash-Lite。Gemini Enterprise API 将于之后开放。

每生成一分钟音频，两个型号的成本都低于 3.1 Flash TTS 预览版。但它们的标准价格将于 2027 年 1 月 1 日翻倍。迁移还需要调整应用发送指令和保存音频的方式。

## 重大变化

- **变化内容：**新型号将转录文本与表演指令分开，并支持可重复使用的声音。
- **为何重要：**规划语音处理流程时，需要考虑两项迁移成本：现在的工程改造，以及按计划提高的生成费用。
- **关注事项：**对于配音、有声书和语音智能体，应使用真实制作脚本，跨语言比较语音的清晰度和说话人一致性。这些结果才能说明，更便宜的音频生成分钟数是否也能降低获得可用音频的成本。

## 每分钟输出成本

[Google 的定价表](https://ai.google.dev/gemini-api/docs/pricing?hl=en)规定每秒生成 25 个音频 token，即每分钟 1,500 个。计算方式为输出单价乘以 1,500，再除以 1,000,000；文本输入费用另计。以下均为标准价格，货币单位为美元。

| 模型 | 列出的语言数 | 截至 2026 年 12 月 31 日，每百万 token 输入/输出价格 | 当前每分钟输出成本 | 自 2027 年 1 月 1 日起，每分钟输出成本 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | 0.50 美元 / 9 美元 | 0.0135 美元 | 0.027 美元 |
| Gemini 3.8 Flash-Lite TTS | 101 | 0.50 美元 / 6 美元 | 0.009 美元 | 0.018 美元 |
| Gemini 3.1 Flash TTS 预览版 | — | 1 美元 / 20 美元 | 0.03 美元 | 未宣布变更 |

对于 3.8 型号，Batch 和 Flex 的价格是标准价的一半，Priority 则是标准价的 1.8 倍。Google 的[模型索引](https://ai.google.dev/gemini-api/docs/models)建议以这两个新型号之一替代旧版 3.1 预览版。

## 提示词和音频文件需要调整

该[Flash 迁移指南](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)称，转录文本会被逐字朗读。持续性指令和说话人标签应放在`speech_metadata`中；否则，“Say cheerfully:”这类旧指令可能会被朗读出来。`<laugh>`等简短事件标签仍应以内联形式保留。

多说话人对话中的每一轮都必须指定一个与配置相匹配的说话人。现在，单说话人的响应也带有 WAV 文件头，取代了过去默认使用的原始 PCM 格式。应删除自行添加 WAV 文件头的代码，或显式请求原始格式。

[Flash-Lite 文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)确认两个型号使用相同的请求结构，输入上限为 8,192 个 token，输出上限为 16,384 个 token。因此，应用可以通过同一套集成来比较两者。

## 声音复刻和评测

Google 介绍了 2,000 多种预设声音、声音设计功能，以及根据一段 30 秒、且用户有权使用的声音样本进行复刻。复刻还要求提供内容匹配的口头同意录音。Google 表示，生成的片段带有 SynthID，复刻声音则附有 C2PA 凭证。

AI Studio 的声音复刻功能不向伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度开放。

Google 报告称，Flash 在 Hume Voice Design Benchmark 的综合得分为 71.4，口音建模得分为 60.8。Google 称，Flash 和 Lite 在 Hume Overall Quality Index 中分别排名第一和第二。

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)在 9 月 23 日另行列出 Flash 的 Arena Elo 分数为 1260.15，在 95 个模型中排名第 27。这衡量的是群体偏好；本文查阅的排名没有证实它在不同语言或长时间录音方面的表现。本文未使用 Lite 的对应独立结果。

如果想与另一组托管语音模型比较，请参阅我们的[Qwen Audio 3.1 API 与定价分析](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)。

## Sources

- [Gemini 3.8 文本转语音：全新亮相](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Google 官方发布说明了上线范围、型号用途、语言总数、声音功能、同意控制措施及 Google 报告的基准测试结果。关于质量的说法均注明来自 Google。
- [Gemini 3.8 Flash TTS 模型文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 当前请求结构、输入与输出限制、转录文本处理、内联事件标签、多说话人校验，以及从默认原始 PCM 输出改为默认 WAV 输出的说明。
- [Gemini 3.8 Flash-Lite TTS 模型文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 当前对高吞吐量型号的介绍、列出的 101 种语言以及它与其他 3.8 型号共用的接口。
- [Gemini API 定价](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Google 官方标准、Batch、Flex 和 Priority 价格，12 月 31 日入门价格截止日期、1 月 1 日起的价格，以及每秒 25 个音频 token 的换算方式。
- [文本转语音生成](https://ai.google.dev/gemini-api/docs/speech-generation) — 当前语音指南记载 3.8 版语言表、转录文本处理和迁移行为。当前语言表无法证实旧预览版所支持的语言总数。
- [Gemini 模型](https://ai.google.dev/gemini-api/docs/models) — 当前模型索引将 3.1 Flash TTS 标为旧版预览型号，并建议更新至 Gemini 3.8 Flash TTS 或 Flash-Lite TTS。
- [Gemini 3.8 Flash TTS：质量、速度与价格分析](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 对确切 Flash 型号的独立上市日排名：在查阅时 Arena Elo 为 1260.15，在 95 个模型中排名第 27。排名可能变化，也不能证明其多语言或长文本表现。
