Googleの9月23日の発表では、Gemini APIとAI Studio向けに二つの安定版音声合成モデルを公開した。創作向けのFlashと、大量生成向けのFlash-Liteだ。Gemini EnterpriseでのAPI提供は後日となる。
どちらも生成音声1分当たりでは、3.1 Flash TTS Previewより安い。標準料金は2027年1月1日に倍増する。移行時には、アプリケーションが指示を送る方法や音声を保存する方法も変更が必要だ。
大きな変化
- 何が変わったか:新しい料金区分では、読み上げる文字と演技上の指示を分け、再利用できる音声にも対応する。
- なぜ重要か:音声生成システムの導入コストには、今必要となるエンジニアリング変更と、予定されている生成料金の値上げの両方を考慮する必要がある。
- 今後の注目点:吹き替え、オーディオブック、音声エージェントでは、実際の制作台本を使い、言語ごとに聞き取りやすさと話者の一貫性を比べることが重要だ。これらの結果で、安価な生成1分当たりの料金が、実際に使える音声のコストも下げるかが分かる。
生成音声1分当たりの出力費用
Googleの料金表によると、音声トークンは1秒当たり25個、1分当たり1,500個だ。計算は出力料金×1,500÷1,000,000で、テキスト入力料金は別途かかる。以下はすべて標準料金の米ドル換算。
モデル | 対応言語 | 2026年12月31日までの100万トークン当たり入力/出力料金 | 現在の1分当たり出力料金 | 2027年1月1日以降の1分当たり出力料金 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | 変更の発表なし |
3.8モデルではBatchとFlexの料金は標準の半額、Priorityは標準の1.8倍となる。Googleのモデル一覧では旧版3.1 Previewを新しいいずれかのモデルに置き換えるよう勧めている。
プロンプトと音声ファイルの変更点
GoogleのFlash移行ガイドによると、文字起こし用の文章はそのまま読み上げられる。継続的な演技指示や話者ラベルは指示用タグ内に記述する。speech_metadataそうしないと「明るく話して」のような旧形式の指示まで音声で読み上げられる場合がある。短いイベントタグなどは<laugh>文中に残る。
複数話者によるすべての発話には、設定と一致する話者名が必要だ。単一話者の応答は新たにWAVヘッダー付きとなり、従来の初期設定だった生のPCM形式に置き換わった。アプリケーションでWAVヘッダーを追加していたコードは削除するか、明示的に生形式を要求する必要がある。
Flash-Liteの文書によると、両モデルは共通のリクエスト形式を採用し、入力上限は8,192トークン、出力上限は16,384トークンだ。そのため、アプリケーションは同じ統合方法で両モデルを比較できる。
音声の複製と評価
Googleは、2,000種類を超える既成音声、音声デザイン、利用権を持つ声の30秒サンプルからの複製に対応すると説明する。音声を複製する際は、それに対応する口頭同意の録音が必要だ。Googleによると、生成音声にはSynthID、複製音声にはC2PA認証情報が付与される。
AI Studioでの音声複製は、イリノイ州、テキサス州、欧州経済領域、英国、スイス、インドでは利用できない。
Googleによると、FlashはHumeのVoice Design Benchmarkで総合71.4点、アクセント再現60.8点だった。またHumeのOverall Quality IndexではFlashとLiteを1位と2位に位置づけている。
Artificial Analysisは9月23日、FlashをArena Elo 1260.15、95モデル中27位と別途掲載した。これは利用者の選好を測るもので、確認した一覧から言語別性能や長時間録音での能力は分からない。同等の独立評価によるLiteの結果はここでは用いていない。
別のホスト型音声モデルとの比較は、当社のQwen Audio 3.1のAPIと料金分析を参照。



