Le lancement annoncé par Google le 23 septembre apporte deux modèles vocaux stables à l’API Gemini et à AI Studio : Flash pour les usages créatifs et Flash-Lite pour le traitement à grande échelle. L’accès via l’API Gemini Enterprise sera proposé plus tard.
Les deux modèles coûtent moins cher par minute générée que 3.1 Flash TTS Preview. Leurs tarifs Standard doubleront le 1er janvier 2027. La migration modifie également la façon dont les applications transmettent les consignes et enregistrent l’audio.
Le grand changement
- Ce qui a changé : Les nouveaux paliers séparent le texte à prononcer des indications de jeu et prennent en charge des voix réutilisables.
- Pourquoi c’est important : Une chaîne de traitement vocal doit prendre en compte deux coûts de migration : les changements techniques à effectuer maintenant et la hausse programmée des frais de génération.
- À suivre : Pour le doublage, les livres audio et les agents vocaux, comparez l’intelligibilité et la cohérence des locuteurs sur de vrais scripts de production et dans différentes langues. Ces résultats détermineront si une minute d’audio générée moins chère réduit aussi le coût d’un audio réellement exploitable.
Coût de génération par minute
Le tableau tarifaire de Google indique 25 jetons audio par seconde, soit 1 500 par minute. Le calcul est le suivant : tarif de sortie × 1 500 / 1 000 000 ; les frais d’entrée pour le texte s’ajoutent. Tous les montants ci-dessous sont en dollars américains, aux tarifs Standard.
Modèle | Langues répertoriées | Entrée / sortie par million de jetons jusqu’au 31 décembre 2026 | Coût de sortie par minute aujourd’hui | Coût de sortie par minute à partir du 1er janvier 2027 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Aucun changement annoncé |
Pour les modèles 3.8, les modes Batch et Flex coûtent la moitié du tarif Standard ; Priority coûte 1,8 fois le tarif Standard. L’index des modèles de Google recommande de remplacer la version 3.1 Preview obsolète par l’un des deux nouveaux paliers.
Les consignes et fichiers audio nécessitent des changements
Le guide de migration de Flash précise que le texte de transcription est prononcé tel quel. Placez les indications de jeu prolongées et les étiquettes de locuteur dans speech_metadata ; sinon, une ancienne consigne comme « Dites-le avec entrain : » peut être lue à voix haute. Les événements brefs comme <laugh> restent intégrés au texte.
Chaque réplique à plusieurs locuteurs doit indiquer un locuteur correspondant à la configuration. Les réponses Unary contiennent désormais des en-têtes WAV, alors qu’elles étaient auparavant en PCM brut par défaut. Supprimez le code qui ajoute un en-tête WAV ou demandez explicitement un format brut.
La documentation de Flash-Lite confirme que les deux paliers partagent le même schéma et les mêmes limites : 8 192 jetons en entrée et 16 384 en sortie. Les applications peuvent donc les comparer en utilisant la même intégration.
Réplication vocale et évaluation
Google décrit plus de 2 000 voix prêtes à l’emploi, la conception de voix et leur réplication à partir d’un échantillon de 30 secondes que l’utilisateur a le droit d’utiliser. La réplication exige un enregistrement correspondant de consentement verbal. Google indique que les clips générés portent le filigrane SynthID et que les voix répliquées disposent d’identifiants C2PA.
La réplication vocale dans AI Studio n’est pas proposée dans l’Illinois, le Texas, l’Espace économique européen, le Royaume-Uni, la Suisse ni l’Inde.
Google indique que Flash obtient un score global de 71,4 et de 60,8 pour la modélisation des accents au Voice Design Benchmark de Hume. L’entreprise classe Flash et Lite aux première et deuxième places de l’Overall Quality Index de Hume.
Artificial Analysis a également classé Flash à 1 260,15 points Arena Elo, au 27e rang sur 95 modèles, le 23 septembre. Cette mesure reflète les préférences du public ; la fiche consultée n’établit pas les performances par langue ni sur de longs enregistrements. Aucun résultat indépendant équivalent pour Lite n’a été utilisé ici.
Pour comparer avec une autre gamme vocale hébergée, consultez notre analyse de l’API et des tarifs de Qwen Audio 3.1.



