Google 于 9 月 23 日发布的产品为 Gemini API 和 AI Studio 带来两款正式版语音模型:适用于创意工作的 Flash 和适用于高吞吐量的 Flash-Lite。Gemini Enterprise API 将于之后开放。

每生成一分钟音频,两个型号的成本都低于 3.1 Flash TTS 预览版。但它们的标准价格将于 2027 年 1 月 1 日翻倍。迁移还需要调整应用发送指令和保存音频的方式。

重大变化

  • 变化内容:新型号将转录文本与表演指令分开,并支持可重复使用的声音。
  • 为何重要:规划语音处理流程时,需要考虑两项迁移成本:现在的工程改造,以及按计划提高的生成费用。
  • 关注事项:对于配音、有声书和语音智能体,应使用真实制作脚本,跨语言比较语音的清晰度和说话人一致性。这些结果才能说明,更便宜的音频生成分钟数是否也能降低获得可用音频的成本。

每分钟输出成本

Google 的定价表规定每秒生成 25 个音频 token,即每分钟 1,500 个。计算方式为输出单价乘以 1,500,再除以 1,000,000;文本输入费用另计。以下均为标准价格,货币单位为美元。

模型

列出的语言数

截至 2026 年 12 月 31 日,每百万 token 输入/输出价格

当前每分钟输出成本

自 2027 年 1 月 1 日起,每分钟输出成本

Gemini 3.8 Flash TTS

130

0.50 美元 / 9 美元

0.0135 美元

0.027 美元

Gemini 3.8 Flash-Lite TTS

101

0.50 美元 / 6 美元

0.009 美元

0.018 美元

Gemini 3.1 Flash TTS 预览版

—

1 美元 / 20 美元

0.03 美元

未宣布变更

对于 3.8 型号,Batch 和 Flex 的价格是标准价的一半,Priority 则是标准价的 1.8 倍。Google 的模型索引建议以这两个新型号之一替代旧版 3.1 预览版。

提示词和音频文件需要调整

该Flash 迁移指南称,转录文本会被逐字朗读。持续性指令和说话人标签应放在speech_metadata中;否则,“Say cheerfully:”这类旧指令可能会被朗读出来。<laugh>等简短事件标签仍应以内联形式保留。

多说话人对话中的每一轮都必须指定一个与配置相匹配的说话人。现在,单说话人的响应也带有 WAV 文件头,取代了过去默认使用的原始 PCM 格式。应删除自行添加 WAV 文件头的代码,或显式请求原始格式。

Flash-Lite 文档确认两个型号使用相同的请求结构,输入上限为 8,192 个 token,输出上限为 16,384 个 token。因此,应用可以通过同一套集成来比较两者。

声音复刻和评测

Google 介绍了 2,000 多种预设声音、声音设计功能,以及根据一段 30 秒、且用户有权使用的声音样本进行复刻。复刻还要求提供内容匹配的口头同意录音。Google 表示,生成的片段带有 SynthID,复刻声音则附有 C2PA 凭证。

AI Studio 的声音复刻功能不向伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度开放。

Google 报告称,Flash 在 Hume Voice Design Benchmark 的综合得分为 71.4,口音建模得分为 60.8。Google 称,Flash 和 Lite 在 Hume Overall Quality Index 中分别排名第一和第二。

Artificial Analysis在 9 月 23 日另行列出 Flash 的 Arena Elo 分数为 1260.15,在 95 个模型中排名第 27。这衡量的是群体偏好;本文查阅的排名没有证实它在不同语言或长时间录音方面的表现。本文未使用 Lite 的对应独立结果。

如果想与另一组托管语音模型比较,请参阅我们的Qwen Audio 3.1 API 与定价分析。