AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS ahora cuesta menos. El precio se duplicará el 1 de enero

> Los modelos estables Gemini 3.8 TTS de Google reducen el coste del audio generado, pero los precios se duplicarán el 1 de enero y la migración implica cambios en las indicaciones y el manejo de archivos WAV.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[El lanzamiento de Google del 23 de septiembre](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) presenta dos modelos estables de voz en Gemini API y AI Studio: Flash para trabajos creativos y Flash-Lite para un uso de mayor volumen. El acceso mediante Gemini Enterprise API llegará más adelante.

Ambos cuestan menos por minuto de audio generado que 3.1 Flash TTS Preview. Sus tarifas Standard se duplicarán el 1 de enero de 2027. La migración también cambia la forma en que las aplicaciones envían instrucciones y guardan el audio.

## El gran cambio

- **Qué cambió:** Los nuevos niveles separan el texto de la transcripción de las indicaciones de interpretación y admiten voces reutilizables.
- **Por qué importa:** Al migrar una cadena de procesamiento de voz hay que tener en cuenta dos costes: los cambios de ingeniería necesarios ahora y el aumento programado de las tarifas de generación.
- **Qué observar:** Para doblaje, audiolibros y agentes de voz, compara la inteligibilidad y la consistencia entre hablantes con guiones reales de producción en distintos idiomas. Esos resultados determinarán si un minuto de generación más barato también reduce el coste del audio utilizable.

## Coste de generación por minuto

[La tabla de precios de Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) especifica 25 tokens de audio por segundo: 1.500 por minuto. El cálculo es tarifa de salida × 1.500 / 1.000.000; los cargos por texto de entrada se suman aparte. Todas las cifras siguientes son tarifas Standard en dólares estadounidenses.

| Modelo | Idiomas disponibles | Precio de entrada / salida por 1 millón de tokens hasta el 31 de diciembre de 2026 | Coste de salida por minuto ahora | Coste de salida por minuto desde el 1 de enero de 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Sin cambio anunciado |

En los modelos 3.8, Batch y Flex cuestan la mitad de Standard; Priority cuesta 1,8 veces la tarifa Standard. El [índice de modelos](https://ai.google.dev/gemini-api/docs/models) de Google recomienda sustituir la versión preliminar antigua 3.1 por cualquiera de los dos nuevos niveles.

## Las indicaciones y los archivos de audio requieren cambios

La [guía de migración de Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) indica que el texto de la transcripción se pronuncia literalmente. Las indicaciones sostenidas y las etiquetas de hablante deben ir en `speech_metadata`; una instrucción antigua como «Di alegremente:» puede pronunciarse en voz alta. Los eventos breves, como `<laugh>`, permanecen insertados en línea.

Cada turno con varios hablantes debe especificar un hablante que coincida con la configuración. Las respuestas de un solo hablante ahora incluyen encabezados WAV, en lugar de usar por defecto PCM sin procesar. Elimina el código que añade un encabezado WAV o solicita explícitamente un formato sin procesar.

[La documentación de Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) confirma que ambos niveles comparten el mismo esquema y los límites de 8.192 tokens de entrada y 16.384 de salida. Por tanto, las aplicaciones pueden compararlos con la misma integración.

## Clonación de voz y evaluación

Google describe más de 2.000 voces listas para usar, diseño de voz y clonación a partir de una muestra de voz de 30 segundos cuyo uso esté autorizado. Para clonar una voz se requiere una grabación de consentimiento verbal coincidente. Google afirma que los clips generados incluyen SynthID y que las voces clonadas tienen credenciales C2PA.

La clonación de voz en AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, el Reino Unido, Suiza ni India.

Google informa de puntuaciones de 71,4 en total y 60,8 en modelado de acentos para Flash en Voice Design Benchmark de Hume. Sitúa a Flash y Lite en primer y segundo lugar, respectivamente, en Overall Quality Index de Hume.

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) clasificó por separado a Flash con 1260,15 puntos Arena Elo, en el puesto 27 de 95 modelos, el 23 de septiembre. Esta medición refleja las preferencias del público; la clasificación consultada no demuestra el rendimiento por idioma ni en grabaciones largas. Aquí no se usaron resultados independientes equivalentes para Lite.

Para comparar con otra línea de voz alojada, consulta nuestro análisis de [Qwen Audio 3.1 API y precios](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8 TTS da la bienvenida](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Alcance oficial del lanzamiento, funciones de cada modelo, cantidad de idiomas, funciones de voz, controles de consentimiento y resultados de pruebas comparativas comunicados por Google. Las afirmaciones sobre calidad se atribuyen a Google.
- [Documentación del modelo Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Esquema actual de solicitudes, límites de entrada y salida, tratamiento de la transcripción, etiquetas de eventos en línea, validación de varios hablantes y cambio del formato PCM sin procesar al formato WAV predeterminado.
- [Documentación del modelo Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Descripción actual del nivel de alto volumen, sus 101 idiomas disponibles y su interfaz compartida con Gemini 3.8 Flash TTS.
- [Precios de Gemini API](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Tarifas oficiales Standard, Batch, Flex y Priority; fin del precio promocional el 31 de diciembre, tarifas desde el 1 de enero y conversión basada en 25 tokens de audio por segundo.
- [Generación de voz a partir de texto](https://ai.google.dev/gemini-api/docs/speech-generation) — La guía actual de voz documenta la tabla de idiomas de 3.8, el tratamiento de las transcripciones y el comportamiento de la migración. Su tabla actual de idiomas no establece cuántos idiomas admitía la versión preliminar anterior.
- [Modelos Gemini](https://ai.google.dev/gemini-api/docs/models) — El índice actual de modelos identifica 3.1 Flash TTS como una versión preliminar heredada y recomienda actualizar a Gemini 3.8 Flash TTS o Flash-Lite TTS.
- [Análisis de calidad, velocidad y precio de Gemini 3.8 Flash TTS](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Clasificación independiente publicada el día del lanzamiento para el modelo Flash específico: 1260,15 puntos Arena Elo y puesto 27 de 95 al momento de la consulta. La clasificación puede cambiar y no valida el rendimiento multilingüe ni en grabaciones largas.
