Googles Markteinführung am 23. September bringt zwei stabile Sprachmodelle für die Gemini API und AI Studio: Flash für kreative Anwendungen und Flash-Lite für hohe Auslastung. Der Zugang über die Gemini Enterprise API folgt später.
Beide Modelle sind pro erzeugter Audiominute günstiger als Gemini 3.1 Flash TTS Preview. Ihre Standardtarife verdoppeln sich am 1. Januar 2027. Bei der Migration ändert sich außerdem, wie Anwendungen Anweisungen übermitteln und Audiodaten speichern.
Die große Veränderung
- Was sich geändert hat: Die neuen Modellstufen trennen den gesprochenen Text von Regieanweisungen und unterstützen wiederverwendbare Stimmen.
- Warum das wichtig ist: Bei einer Sprachpipeline sind zwei Migrationskosten zu berücksichtigen: der technische Anpassungsaufwand jetzt und die planmäßige Erhöhung der Gebühren für die Audiogenerierung.
- Worauf zu achten ist: Für Synchronisationen, Hörbücher und Sprachagenten sollte man Verständlichkeit und Sprecherkonsistenz anhand echter Produktionsskripte in mehreren Sprachen vergleichen. Erst diese Ergebnisse zeigen, ob eine günstigere erzeugte Audiominute auch die Kosten für tatsächlich nutzbares Audio senkt.
Kosten pro ausgegebener Audiominute
Googles Preistabelle gibt an, dass 25 Audiotoken pro Sekunde 1.500 Token pro Minute entsprechen. Die Berechnung lautet: Ausgabetarif × 1.500 / 1.000.000; Gebühren für Eingabetext kommen hinzu. Alle folgenden Beträge sind US-Dollar zu den Standardtarifen.
Modell | Angegebene Sprachen | Ein- / Ausgabe je 1 Mio. Token bis 31. Dez. 2026 | Ausgabe pro Minute derzeit | Ausgabe pro Minute ab 1. Jan. 2027 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | 0,50 $ / 9 $ | 0,0135 $ | 0,027 $ |
Gemini 3.8 Flash-Lite TTS | 101 | 0,50 $ / 6 $ | 0,009 $ | 0,018 $ |
Gemini 3.1 Flash TTS Preview | — | 1 $ / 20 $ | 0,03 $ | Keine Änderung angekündigt |
Bei den 3.8-Modellen kosten Batch und Flex die Hälfte des Standardtarifs; Priority kostet das 1,8-Fache. Googles Modellübersicht empfiehlt, die ältere Preview-Version 3.1 durch eine der beiden neuen Modellstufen zu ersetzen.
Prompts und Audiodateien erfordern Anpassungen
Der Migrationsleitfaden für Flash besagt, dass der Transkripttext wortgetreu gesprochen wird. Länger geltende Regieanweisungen und Sprecherkennzeichnungen gehören in speech_metadata; eine ältere Anweisung wie „Say cheerfully:“ kann sonst laut vorgelesen werden. Kurze Ereignisse wie <laugh> bleiben dagegen inline.
Jeder Sprecherwechsel muss einen Sprecher nennen, der mit der Konfiguration übereinstimmt. Antworten mit nur einem Sprecher enthalten jetzt WAV-Header; zuvor war standardmäßig rohes PCM ausgegeben worden. Entfernen Sie Code, der einen WAV-Header hinzufügt, oder fordern Sie ausdrücklich ein Rohdatenformat an.
Dokumentation zu Flash-Lite bestätigt ein gemeinsames Schema und für beide Modellstufen Limits von 8.192 Eingabe- und 16.384 Ausgabetoken. Anwendungen können sie daher über dieselbe Integration vergleichen.
Stimmenklonen und Qualitätsbewertung
Google nennt mehr als 2.000 fertige Stimmen, Stimmdesign und das Klonen anhand einer 30-sekündigen Stimmprobe, sofern der Nutzer die nötigen Rechte daran hat. Zum Klonen ist eine passende gesprochene Einwilligung erforderlich. Laut Google tragen erzeugte Audioclips SynthID-Kennzeichnungen; geklonte Stimmen erhalten C2PA-Nachweise.
Das Klonen von Stimmen in AI Studio ist in Illinois, Texas, dem Europäischen Wirtschaftsraum, im Vereinigten Königreich, in der Schweiz und in Indien nicht verfügbar.
Google zufolge erreicht Flash im Hume Voice Design Benchmark 71,4 Punkte insgesamt und 60,8 bei der Modellierung von Akzenten. In Humes Overall Quality Index belegt das Unternehmen mit Flash und Lite den ersten und zweiten Platz.
Artificial Analysis führte Flash am 23. September separat mit 1.260,15 Arena-Elo-Punkten auf Platz 27 von 95 Modellen. Der Wert misst die Präferenz von Nutzern; der geprüfte Eintrag belegt weder die Leistung in einzelnen Sprachen noch bei langen Aufnahmen. Ein entsprechendes unabhängiges Ergebnis für Lite wurde hier nicht verwendet.
Einen Vergleich mit einer anderen gehosteten Sprachmodellfamilie bietet unsere Analyse zu Qwen Audio 3.1 API und Preisen.



