AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS、値下げ後の料金は2027年1月1日に倍増

> Googleの安定版Gemini 3.8音声合成モデルは、生成音声の料金を引き下げる。ただし、料金は2027年1月1日に倍増する。移行時にはプロンプトと話者ラベル、WAVファイルの扱いも変わる。

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Googleの9月23日の発表](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)では、Gemini APIとAI Studio向けに二つの安定版音声合成モデルを公開した。創作向けのFlashと、大量生成向けのFlash-Liteだ。Gemini EnterpriseでのAPI提供は後日となる。

どちらも生成音声1分当たりでは、3.1 Flash TTS Previewより安い。標準料金は2027年1月1日に倍増する。移行時には、アプリケーションが指示を送る方法や音声を保存する方法も変更が必要だ。

## 大きな変化

- **何が変わったか：**新しい料金区分では、読み上げる文字と演技上の指示を分け、再利用できる音声にも対応する。
- **なぜ重要か：**音声生成システムの導入コストには、今必要となるエンジニアリング変更と、予定されている生成料金の値上げの両方を考慮する必要がある。
- **今後の注目点：**吹き替え、オーディオブック、音声エージェントでは、実際の制作台本を使い、言語ごとに聞き取りやすさと話者の一貫性を比べることが重要だ。これらの結果で、安価な生成1分当たりの料金が、実際に使える音声のコストも下げるかが分かる。

## 生成音声1分当たりの出力費用

[Googleの料金表](https://ai.google.dev/gemini-api/docs/pricing?hl=en)によると、音声トークンは1秒当たり25個、1分当たり1,500個だ。計算は出力料金×1,500÷1,000,000で、テキスト入力料金は別途かかる。以下はすべて標準料金の米ドル換算。

| モデル | 対応言語 | 2026年12月31日までの100万トークン当たり入力／出力料金 | 現在の1分当たり出力料金 | 2027年1月1日以降の1分当たり出力料金 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | 変更の発表なし |

3.8モデルではBatchとFlexの料金は標準の半額、Priorityは標準の1.8倍となる。Googleの[モデル一覧](https://ai.google.dev/gemini-api/docs/models)では旧版3.1 Previewを新しいいずれかのモデルに置き換えるよう勧めている。

## プロンプトと音声ファイルの変更点

Googleの[Flash移行ガイド](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)によると、文字起こし用の文章はそのまま読み上げられる。継続的な演技指示や話者ラベルは指示用タグ内に記述する。`speech_metadata`そうしないと「明るく話して」のような旧形式の指示まで音声で読み上げられる場合がある。短いイベントタグなどは`<laugh>`文中に残る。

複数話者によるすべての発話には、設定と一致する話者名が必要だ。単一話者の応答は新たにWAVヘッダー付きとなり、従来の初期設定だった生のPCM形式に置き換わった。アプリケーションでWAVヘッダーを追加していたコードは削除するか、明示的に生形式を要求する必要がある。

[Flash-Liteの文書](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)によると、両モデルは共通のリクエスト形式を採用し、入力上限は8,192トークン、出力上限は16,384トークンだ。そのため、アプリケーションは同じ統合方法で両モデルを比較できる。

## 音声の複製と評価

Googleは、2,000種類を超える既成音声、音声デザイン、利用権を持つ声の30秒サンプルからの複製に対応すると説明する。音声を複製する際は、それに対応する口頭同意の録音が必要だ。Googleによると、生成音声にはSynthID、複製音声にはC2PA認証情報が付与される。

AI Studioでの音声複製は、イリノイ州、テキサス州、欧州経済領域、英国、スイス、インドでは利用できない。

Googleによると、FlashはHumeのVoice Design Benchmarkで総合71.4点、アクセント再現60.8点だった。またHumeのOverall Quality IndexではFlashとLiteを1位と2位に位置づけている。

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)は9月23日、FlashをArena Elo 1260.15、95モデル中27位と別途掲載した。これは利用者の選好を測るもので、確認した一覧から言語別性能や長時間録音での能力は分からない。同等の独立評価によるLiteの結果はここでは用いていない。

別のホスト型音声モデルとの比較は、当社の[Qwen Audio 3.1のAPIと料金分析](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)を参照。

## Sources

- [Gemini 3.8テキスト読み上げが登場](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — 公式発表の対象範囲、各モデルの役割、言語数、音声機能、同意管理、地域別の利用条件、Googleが報告した評価結果を掲載。品質の主張はGoogleによる説明として扱う。
- [Gemini 3.8 Flash TTSモデルの説明](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 現行のリクエスト形式、入出力上限、テキストの扱い、文中イベントタグ、複数話者の検証、生PCMから初期設定WAV形式への変更を解説する。
- [Gemini 3.8 Flash-Lite TTSモデルの説明](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 大量生成向けモデルの現行説明、記載されている101言語、両3.8モデルに共通するインターフェースを掲載。
- [Gemini API料金](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — 標準、Batch、Flex、Priorityの公式単価、12月31日までの導入価格、1月1日以降の料金、1秒25音声トークンの換算方法を掲載。
- [音声合成](https://ai.google.dev/gemini-api/docs/speech-generation) — 現行の音声ガイドは3.8モデルの言語一覧、テキストの扱い、移行時の変更を解説する。現在の言語一覧だけでは、以前のPreview版の言語数は確認できない。
- [Geminiモデル一覧](https://ai.google.dev/gemini-api/docs/models) — 現行モデル一覧は3.1 Flash TTSを旧Previewとしており、Gemini 3.8 Flash TTSまたはFlash-Lite TTSへの更新を推奨している。
- [Gemini 3.8 Flash TTSの品質、速度、料金分析](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 発売日に掲載された独立一覧で、評価時点のFlashはArena Elo 1260.15、95モデル中27位。順位は変動し、複数言語や長時間音声で検証した結果ではない。
