LE MONDE NE S’ARRÊTE PAS.RSS
BIG CHANGE.

Édition Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS coûte moins cher aujourd’hui. Son prix doublera le 1er janvier

> Les modèles Gemini 3.8 TTS stables de Google réduisent le coût de l’audio généré, mais les tarifs doubleront le 1er janvier et la migration modifie les consignes et le traitement des fichiers WAV.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Le lancement annoncé par Google le 23 septembre](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) apporte deux modèles vocaux stables à l’API Gemini et à AI Studio : Flash pour les usages créatifs et Flash-Lite pour le traitement à grande échelle. L’accès via l’API Gemini Enterprise sera proposé plus tard.

Les deux modèles coûtent moins cher par minute générée que 3.1 Flash TTS Preview. Leurs tarifs Standard doubleront le 1er janvier 2027. La migration modifie également la façon dont les applications transmettent les consignes et enregistrent l’audio.

## Le grand changement

- **Ce qui a changé :** Les nouveaux paliers séparent le texte à prononcer des indications de jeu et prennent en charge des voix réutilisables.
- **Pourquoi c’est important :** Une chaîne de traitement vocal doit prendre en compte deux coûts de migration : les changements techniques à effectuer maintenant et la hausse programmée des frais de génération.
- **À suivre :** Pour le doublage, les livres audio et les agents vocaux, comparez l’intelligibilité et la cohérence des locuteurs sur de vrais scripts de production et dans différentes langues. Ces résultats détermineront si une minute d’audio générée moins chère réduit aussi le coût d’un audio réellement exploitable.

## Coût de génération par minute

[Le tableau tarifaire de Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) indique 25 jetons audio par seconde, soit 1 500 par minute. Le calcul est le suivant : tarif de sortie × 1 500 / 1 000 000 ; les frais d’entrée pour le texte s’ajoutent. Tous les montants ci-dessous sont en dollars américains, aux tarifs Standard.

| Modèle | Langues répertoriées | Entrée / sortie par million de jetons jusqu’au 31 décembre 2026 | Coût de sortie par minute aujourd’hui | Coût de sortie par minute à partir du 1er janvier 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Aucun changement annoncé |

Pour les modèles 3.8, les modes Batch et Flex coûtent la moitié du tarif Standard ; Priority coûte 1,8 fois le tarif Standard. L’[index des modèles de Google](https://ai.google.dev/gemini-api/docs/models) recommande de remplacer la version 3.1 Preview obsolète par l’un des deux nouveaux paliers.

## Les consignes et fichiers audio nécessitent des changements

Le [guide de migration de Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) précise que le texte de transcription est prononcé tel quel. Placez les indications de jeu prolongées et les étiquettes de locuteur dans `speech_metadata` ; sinon, une ancienne consigne comme « Dites-le avec entrain : » peut être lue à voix haute. Les événements brefs comme `<laugh>` restent intégrés au texte.

Chaque réplique à plusieurs locuteurs doit indiquer un locuteur correspondant à la configuration. Les réponses Unary contiennent désormais des en-têtes WAV, alors qu’elles étaient auparavant en PCM brut par défaut. Supprimez le code qui ajoute un en-tête WAV ou demandez explicitement un format brut.

[La documentation de Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) confirme que les deux paliers partagent le même schéma et les mêmes limites : 8 192 jetons en entrée et 16 384 en sortie. Les applications peuvent donc les comparer en utilisant la même intégration.

## Réplication vocale et évaluation

Google décrit plus de 2 000 voix prêtes à l’emploi, la conception de voix et leur réplication à partir d’un échantillon de 30 secondes que l’utilisateur a le droit d’utiliser. La réplication exige un enregistrement correspondant de consentement verbal. Google indique que les clips générés portent le filigrane SynthID et que les voix répliquées disposent d’identifiants C2PA.

La réplication vocale dans AI Studio n’est pas proposée dans l’Illinois, le Texas, l’Espace économique européen, le Royaume-Uni, la Suisse ni l’Inde.

Google indique que Flash obtient un score global de 71,4 et de 60,8 pour la modélisation des accents au Voice Design Benchmark de Hume. L’entreprise classe Flash et Lite aux première et deuxième places de l’Overall Quality Index de Hume.

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) a également classé Flash à 1 260,15 points Arena Elo, au 27e rang sur 95 modèles, le 23 septembre. Cette mesure reflète les préférences du public ; la fiche consultée n’établit pas les performances par langue ni sur de longs enregistrements. Aucun résultat indépendant équivalent pour Lite n’a été utilisé ici.

Pour comparer avec une autre gamme vocale hébergée, consultez notre [analyse de l’API et des tarifs de Qwen Audio 3.1](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [La synthèse vocale Gemini 3.8 donne de la voix](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Périmètre du lancement officiel, rôles des modèles, nombre de langues, fonctions vocales, contrôles du consentement, accès régional et résultats des benchmarks rapportés par Google. Les affirmations sur la qualité sont attribuées à Google.
- [Documentation du modèle Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Schéma actuel des requêtes, limites d’entrée et de sortie, traitement de la transcription, balises d’événement intégrées, validation des échanges à plusieurs locuteurs et passage du PCM brut à une sortie WAV par défaut.
- [Documentation du modèle Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Présentation actuelle du modèle à haut débit, de ses 101 langues répertoriées et de son interface commune avec la version 3.8 Flash.
- [Tarifs de l’API Gemini](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Tarifs officiels Standard, Batch, Flex et Priority, date limite du tarif de lancement au 31 décembre, tarifs au 1er janvier et conversion à 25 jetons audio par seconde.
- [Génération de parole](https://ai.google.dev/gemini-api/docs/speech-generation) — Le guide vocal actuel documente le tableau des langues de la version 3.8, le traitement de la transcription et le comportement requis pour la migration. Son tableau actuel des langues ne permet pas d’établir le nombre de langues de l’ancienne version Preview.
- [Modèles Gemini](https://ai.google.dev/gemini-api/docs/models) — L’index actuel des modèles qualifie Gemini 3.1 Flash TTS de version Preview historique et recommande de passer à Gemini 3.8 Flash TTS ou Flash-Lite TTS.
- [Analyse de la qualité, de la vitesse et du prix de Gemini 3.8 Flash TTS](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Fiche indépendante publiée le jour du lancement pour le modèle Flash concerné : 1 260,15 points Arena Elo et 27e place sur 95 au moment de l’examen. Le classement peut évoluer ; il ne valide ni les performances multilingues ni les enregistrements de longue durée.