AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS ist jetzt günstiger. Am 1. Januar verdoppelt sich der Preis

> Googles stabile Gemini-3.8-TTS-Modelle senken die Kosten für erzeugte Audiodaten. Am 1. Januar verdoppeln sich jedoch die Preise; auch die Migration verändert den Umgang mit Eingabeanweisungen und WAV-Dateien.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Googles Markteinführung am 23. September](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) bringt zwei stabile Sprachmodelle für die Gemini API und AI Studio: Flash für kreative Anwendungen und Flash-Lite für hohe Auslastung. Der Zugang über die Gemini Enterprise API folgt später.

Beide Modelle sind pro erzeugter Audiominute günstiger als Gemini 3.1 Flash TTS Preview. Ihre Standardtarife verdoppeln sich am 1. Januar 2027. Bei der Migration ändert sich außerdem, wie Anwendungen Anweisungen übermitteln und Audiodaten speichern.

## Die große Veränderung

- **Was sich geändert hat:** Die neuen Modellstufen trennen den gesprochenen Text von Regieanweisungen und unterstützen wiederverwendbare Stimmen.
- **Warum das wichtig ist:** Bei einer Sprachpipeline sind zwei Migrationskosten zu berücksichtigen: der technische Anpassungsaufwand jetzt und die planmäßige Erhöhung der Gebühren für die Audiogenerierung.
- **Worauf zu achten ist:** Für Synchronisationen, Hörbücher und Sprachagenten sollte man Verständlichkeit und Sprecherkonsistenz anhand echter Produktionsskripte in mehreren Sprachen vergleichen. Erst diese Ergebnisse zeigen, ob eine günstigere erzeugte Audiominute auch die Kosten für tatsächlich nutzbares Audio senkt.

## Kosten pro ausgegebener Audiominute

[Googles Preistabelle](https://ai.google.dev/gemini-api/docs/pricing?hl=en) gibt an, dass 25 Audiotoken pro Sekunde 1.500 Token pro Minute entsprechen. Die Berechnung lautet: Ausgabetarif × 1.500 / 1.000.000; Gebühren für Eingabetext kommen hinzu. Alle folgenden Beträge sind US-Dollar zu den Standardtarifen.

| Modell | Angegebene Sprachen | Ein- / Ausgabe je 1 Mio. Token bis 31. Dez. 2026 | Ausgabe pro Minute derzeit | Ausgabe pro Minute ab 1. Jan. 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | 0,50 $ / 9 $ | 0,0135 $ | 0,027 $ |
| Gemini 3.8 Flash-Lite TTS | 101 | 0,50 $ / 6 $ | 0,009 $ | 0,018 $ |
| Gemini 3.1 Flash TTS Preview | — | 1 $ / 20 $ | 0,03 $ | Keine Änderung angekündigt |

Bei den 3.8-Modellen kosten Batch und Flex die Hälfte des Standardtarifs; Priority kostet das 1,8-Fache. Googles [Modellübersicht](https://ai.google.dev/gemini-api/docs/models) empfiehlt, die ältere Preview-Version 3.1 durch eine der beiden neuen Modellstufen zu ersetzen.

## Prompts und Audiodateien erfordern Anpassungen

Der [Migrationsleitfaden für Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) besagt, dass der Transkripttext wortgetreu gesprochen wird. Länger geltende Regieanweisungen und Sprecherkennzeichnungen gehören in `speech_metadata`; eine ältere Anweisung wie „Say cheerfully:“ kann sonst laut vorgelesen werden. Kurze Ereignisse wie `<laugh>` bleiben dagegen inline.

Jeder Sprecherwechsel muss einen Sprecher nennen, der mit der Konfiguration übereinstimmt. Antworten mit nur einem Sprecher enthalten jetzt WAV-Header; zuvor war standardmäßig rohes PCM ausgegeben worden. Entfernen Sie Code, der einen WAV-Header hinzufügt, oder fordern Sie ausdrücklich ein Rohdatenformat an.

[Dokumentation zu Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) bestätigt ein gemeinsames Schema und für beide Modellstufen Limits von 8.192 Eingabe- und 16.384 Ausgabetoken. Anwendungen können sie daher über dieselbe Integration vergleichen.

## Stimmenklonen und Qualitätsbewertung

Google nennt mehr als 2.000 fertige Stimmen, Stimmdesign und das Klonen anhand einer 30-sekündigen Stimmprobe, sofern der Nutzer die nötigen Rechte daran hat. Zum Klonen ist eine passende gesprochene Einwilligung erforderlich. Laut Google tragen erzeugte Audioclips SynthID-Kennzeichnungen; geklonte Stimmen erhalten C2PA-Nachweise.

Das Klonen von Stimmen in AI Studio ist in Illinois, Texas, dem Europäischen Wirtschaftsraum, im Vereinigten Königreich, in der Schweiz und in Indien nicht verfügbar.

Google zufolge erreicht Flash im Hume Voice Design Benchmark 71,4 Punkte insgesamt und 60,8 bei der Modellierung von Akzenten. In Humes Overall Quality Index belegt das Unternehmen mit Flash und Lite den ersten und zweiten Platz.

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) führte Flash am 23. September separat mit 1.260,15 Arena-Elo-Punkten auf Platz 27 von 95 Modellen. Der Wert misst die Präferenz von Nutzern; der geprüfte Eintrag belegt weder die Leistung in einzelnen Sprachen noch bei langen Aufnahmen. Ein entsprechendes unabhängiges Ergebnis für Lite wurde hier nicht verwendet.

Einen Vergleich mit einer anderen gehosteten Sprachmodellfamilie bietet unsere [Analyse zu Qwen Audio 3.1 API und Preisen](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8 Text-to-Speech stellt sich vor](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Offizieller Umfang der Markteinführung, Rollen der Modelle, Sprachanzahl, Stimmfunktionen, Einwilligungskontrollen und von Google berichtete Benchmark-Ergebnisse. Qualitätsaussagen werden Google zugeschrieben.
- [Dokumentation zum Modell Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Aktuelles Anfrageformat, Ein- und Ausgabelimits, Behandlung des Transkripttexts, Inline-Ereignis-Tags, Validierung mehrerer Sprecher und Umstellung von rohem PCM auf standardmäßige WAV-Ausgabe.
- [Dokumentation zum Modell Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Aktuelle Beschreibung der auf hohen Durchsatz ausgelegten Modellstufe, der 101 aufgeführten Sprachen und der gemeinsamen 3.8-Schnittstelle.
- [Preise der Gemini API](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Offizielle Standard-, Batch-, Flex- und Priority-Tarife, Frist für die Einführungspreise am 31. Dezember, Preise ab dem 1. Januar und Umrechnung auf Grundlage von 25 Audiotoken pro Sekunde.
- [Sprachgenerierung per Text-to-Speech](https://ai.google.dev/gemini-api/docs/speech-generation) — Die aktuelle Sprachdokumentation beschreibt die Sprachtabelle von Version 3.8, die Behandlung des Transkripttexts und das Migrationsverhalten. Ihre aktuelle Sprachtabelle belegt nicht die Anzahl der Sprachen in der früheren Preview-Version.
- [Gemini-Modelle](https://ai.google.dev/gemini-api/docs/models) — Die aktuelle Modellübersicht bezeichnet Gemini 3.1 Flash TTS als ältere Preview-Version und empfiehlt ein Update auf Gemini 3.8 Flash TTS oder Flash-Lite TTS.
- [Gemini 3.8 Flash TTS: Analyse von Qualität, Geschwindigkeit und Preis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Unabhängiger Eintrag zum Starttag für das genaue Flash-Modell: 1.260,15 Arena-Elo-Punkte und Platz 27 von 95 zum Zeitpunkt der Prüfung. Die Rangfolge kann sich ändern und ist weder ein Test in mehreren Sprachen noch ein Langzeittest.
