Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# Gemini 3.8 TTS 现在更便宜,但价格将于 1 月 1 日翻倍
> Google 稳定版 Gemini 3.8 TTS 模型降低了生成音频成本,但标准价格将于 1 月 1 日翻倍,迁移还会改变提示词结构和 WAV 音频处理方式。
By BIG CHANGE Editorial
Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

AI-generated conceptual illustration by BIG CHANGE.
[Google 于 9 月 23 日发布的产品](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)为 Gemini API 和 AI Studio 带来两款正式版语音模型:适用于创意工作的 Flash 和适用于高吞吐量的 Flash-Lite。Gemini Enterprise API 将于之后开放。
每生成一分钟音频,两个型号的成本都低于 3.1 Flash TTS 预览版。但它们的标准价格将于 2027 年 1 月 1 日翻倍。迁移还需要调整应用发送指令和保存音频的方式。
## 重大变化
- **变化内容:**新型号将转录文本与表演指令分开,并支持可重复使用的声音。
- **为何重要:**规划语音处理流程时,需要考虑两项迁移成本:现在的工程改造,以及按计划提高的生成费用。
- **关注事项:**对于配音、有声书和语音智能体,应使用真实制作脚本,跨语言比较语音的清晰度和说话人一致性。这些结果才能说明,更便宜的音频生成分钟数是否也能降低获得可用音频的成本。
## 每分钟输出成本
[Google 的定价表](https://ai.google.dev/gemini-api/docs/pricing?hl=en)规定每秒生成 25 个音频 token,即每分钟 1,500 个。计算方式为输出单价乘以 1,500,再除以 1,000,000;文本输入费用另计。以下均为标准价格,货币单位为美元。
| 模型 | 列出的语言数 | 截至 2026 年 12 月 31 日,每百万 token 输入/输出价格 | 当前每分钟输出成本 | 自 2027 年 1 月 1 日起,每分钟输出成本 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | 0.50 美元 / 9 美元 | 0.0135 美元 | 0.027 美元 |
| Gemini 3.8 Flash-Lite TTS | 101 | 0.50 美元 / 6 美元 | 0.009 美元 | 0.018 美元 |
| Gemini 3.1 Flash TTS 预览版 | — | 1 美元 / 20 美元 | 0.03 美元 | 未宣布变更 |
对于 3.8 型号,Batch 和 Flex 的价格是标准价的一半,Priority 则是标准价的 1.8 倍。Google 的[模型索引](https://ai.google.dev/gemini-api/docs/models)建议以这两个新型号之一替代旧版 3.1 预览版。
## 提示词和音频文件需要调整
该[Flash 迁移指南](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)称,转录文本会被逐字朗读。持续性指令和说话人标签应放在`speech_metadata`中;否则,“Say cheerfully:”这类旧指令可能会被朗读出来。`<laugh>`等简短事件标签仍应以内联形式保留。
多说话人对话中的每一轮都必须指定一个与配置相匹配的说话人。现在,单说话人的响应也带有 WAV 文件头,取代了过去默认使用的原始 PCM 格式。应删除自行添加 WAV 文件头的代码,或显式请求原始格式。
[Flash-Lite 文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)确认两个型号使用相同的请求结构,输入上限为 8,192 个 token,输出上限为 16,384 个 token。因此,应用可以通过同一套集成来比较两者。
## 声音复刻和评测
Google 介绍了 2,000 多种预设声音、声音设计功能,以及根据一段 30 秒、且用户有权使用的声音样本进行复刻。复刻还要求提供内容匹配的口头同意录音。Google 表示,生成的片段带有 SynthID,复刻声音则附有 C2PA 凭证。
AI Studio 的声音复刻功能不向伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度开放。
Google 报告称,Flash 在 Hume Voice Design Benchmark 的综合得分为 71.4,口音建模得分为 60.8。Google 称,Flash 和 Lite 在 Hume Overall Quality Index 中分别排名第一和第二。
[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)在 9 月 23 日另行列出 Flash 的 Arena Elo 分数为 1260.15,在 95 个模型中排名第 27。这衡量的是群体偏好;本文查阅的排名没有证实它在不同语言或长时间录音方面的表现。本文未使用 Lite 的对应独立结果。
如果想与另一组托管语音模型比较,请参阅我们的[Qwen Audio 3.1 API 与定价分析](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)。
## Sources
- [Gemini 3.8 文本转语音:全新亮相](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Google 官方发布说明了上线范围、型号用途、语言总数、声音功能、同意控制措施及 Google 报告的基准测试结果。关于质量的说法均注明来自 Google。
- [Gemini 3.8 Flash TTS 模型文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 当前请求结构、输入与输出限制、转录文本处理、内联事件标签、多说话人校验,以及从默认原始 PCM 输出改为默认 WAV 输出的说明。
- [Gemini 3.8 Flash-Lite TTS 模型文档](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 当前对高吞吐量型号的介绍、列出的 101 种语言以及它与其他 3.8 型号共用的接口。
- [Gemini API 定价](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Google 官方标准、Batch、Flex 和 Priority 价格,12 月 31 日入门价格截止日期、1 月 1 日起的价格,以及每秒 25 个音频 token 的换算方式。
- [文本转语音生成](https://ai.google.dev/gemini-api/docs/speech-generation) — 当前语音指南记载 3.8 版语言表、转录文本处理和迁移行为。当前语言表无法证实旧预览版所支持的语言总数。
- [Gemini 模型](https://ai.google.dev/gemini-api/docs/models) — 当前模型索引将 3.1 Flash TTS 标为旧版预览型号,并建议更新至 Gemini 3.8 Flash TTS 或 Flash-Lite TTS。
- [Gemini 3.8 Flash TTS:质量、速度与价格分析](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 对确切 Flash 型号的独立上市日排名:在查阅时 Arena Elo 为 1260.15,在 95 个模型中排名第 27。排名可能变化,也不能证明其多语言或长文本表现。
BIG CHANGE 新闻通讯
纵览全局,按自己的节奏。
关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.