AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS está mais barato agora. O preço dobra em 1º de janeiro de 2027

> Os modelos estáveis Gemini 3.8 TTS do Google reduzem o custo de geração de áudio, mas os preços dobram em 1º de janeiro. A migração também muda os comandos e o tratamento de arquivos WAV.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[O lançamento do Google em 23 de setembro](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) trouxe dois modelos estáveis de voz para a API Gemini e o AI Studio: o Flash para trabalhos criativos e o Flash-Lite para alto volume. O acesso pela Gemini Enterprise API chegará mais tarde.

O custo de saída dos dois modelos por minuto gerado é menor que o do 3.1 Flash TTS Preview. As tarifas Standard dobram em 1º de janeiro de 2027. A migração também muda a forma como os aplicativos enviam instruções e salvam o áudio.

## A grande mudança

- **O que mudou:** As novas versões separam o texto da transcrição das instruções de desempenho e permitem reutilizar vozes.
- **Por que isso importa:** Um sistema de voz precisa levar em conta dois custos de migração: as mudanças de engenharia necessárias agora e o aumento programado das cobranças de geração.
- **O que observar:** Para dublagem, audiolivros e agentes de voz, compare a inteligibilidade e a consistência das vozes usando roteiros reais de produção em diferentes idiomas. Esses resultados determinarão se o menor preço por minuto gerado também reduz o custo do áudio que pode ser usado.

## Custo de saída por minuto

[A tabela de preços do Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) especifica 25 tokens de áudio por segundo, ou 1.500 por minuto. O cálculo é tarifa de saída × 1.500 ÷ 1.000.000; os custos de entrada de texto são cobrados à parte. Todos os valores abaixo estão em dólares americanos, nas tarifas Standard.

| Modelo | Idiomas listados | Entrada/saída por milhão de tokens até 31 de dezembro de 2026 | Custo de saída por minuto agora | Custo de saída por minuto a partir de 1º de janeiro de 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | US$ 0,50/US$ 9 | US$ 0,0135 | US$ 0,027 |
| Gemini 3.8 Flash-Lite TTS | 101 | US$ 0,50/US$ 6 | US$ 0,009 | US$ 0,018 |
| Gemini 3.1 Flash TTS Preview | — | US$ 1/US$ 20 | US$ 0,03 | Nenhuma mudança anunciada |

Para os modelos 3.8, as tarifas Batch e Flex custam metade da Standard; a Priority custa 1,8 vez a tarifa Standard. O [índice de modelos](https://ai.google.dev/gemini-api/docs/models) do Google recomenda substituir a versão legada 3.1 Preview por uma das novas versões.

## Os comandos e arquivos de áudio exigem mudanças

O [guia de migração do Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) diz que o texto da transcrição é pronunciado literalmente. Coloque instruções contínuas e rótulos de voz em `speech_metadata`; uma instrução antiga como “Diga com alegria:” pode acabar sendo lida em voz alta. Eventos breves como `<laugh>` permanecem em linha.

Cada fala em uma resposta com vários interlocutores precisa indicar um locutor correspondente à configuração. Agora, as respostas unárias incluem cabeçalhos WAV, que substituem a saída PCM bruta usada como padrão anteriormente. Remova o código que acrescenta um cabeçalho WAV ou solicite explicitamente um formato bruto.

[A documentação do Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) confirma que os dois níveis usam o mesmo esquema e têm limites de 8.192 tokens de entrada e 16.384 de saída. Assim, os aplicativos podem compará-los usando a mesma integração.

## Replicação e avaliação de vozes

O Google descreve mais de 2.000 vozes prontas, criação de vozes e replicação a partir de uma amostra de 30 segundos de uma voz que o usuário tem direito de usar. A replicação exige uma gravação correspondente de consentimento verbal. O Google diz que os clipes gerados incluem SynthID e as vozes replicadas têm credenciais C2PA.

A replicação de vozes pelo AI Studio não está disponível em Illinois, Texas, Espaço Econômico Europeu, Reino Unido, Suíça e Índia.

O Google informa pontuações de 71,4 no geral e 60,8 em modelagem de sotaques para o Flash no Voice Design Benchmark da Hume. A empresa o coloca em primeiro lugar e o Lite em segundo no Overall Quality Index da Hume.

[A Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) listou separadamente o Flash com 1.260,15 pontos Arena Elo, na 27ª posição entre 95 modelos, em 23 de setembro. Essa métrica representa preferências do público; a listagem consultada não estabelece o desempenho por idioma nem em gravações longas. Nenhum resultado independente equivalente para o Lite foi usado aqui.

Para comparar com outra linha de modelos de voz hospedados, consulte nossa análise da API e dos preços do [Qwen Audio 3.1](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8 de texto para fala: uma apresentação](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Escopo oficial do lançamento, funções dos modelos, quantidade de idiomas, recursos de voz, controles de consentimento, disponibilidade regional e resultados de benchmark divulgados pelo Google. As alegações sobre qualidade continuam atribuídas ao Google.
- [Documentação do modelo Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Esquema atual de solicitações, limites de entrada e saída, tratamento de transcrições, tags de eventos em linha, validação de vários interlocutores e mudança do PCM bruto para saída WAV como padrão.
- [Documentação do modelo Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Descrição atual do nível de alto volume, dos 101 idiomas listados e da interface 3.8 compartilhada.
- [Preços da API Gemini](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Tarifas oficiais Standard, Batch, Flex e Priority, prazo promocional de 31 de dezembro, preços a partir de 1º de janeiro e conversão de 25 tokens de áudio por segundo.
- [Geração de fala com texto](https://ai.google.dev/gemini-api/docs/speech-generation) — O guia atual de fala documenta a tabela de idiomas 3.8, o tratamento de transcrições e o comportamento da migração. A tabela atual não estabelece o total de idiomas da versão de prévia anterior.
- [Modelos Gemini](https://ai.google.dev/gemini-api/docs/models) — O índice atual de modelos identifica o 3.1 Flash TTS como uma versão de prévia legada e recomenda a migração para o Gemini 3.8 Flash TTS ou Flash-Lite TTS.
- [Artificial Analysis: análise de qualidade, velocidade e preço do Gemini 3.8 Flash TTS](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Listagem independente publicada no dia do lançamento para o modelo Flash específico: 1.260,15 pontos Arena Elo e 27ª posição entre 95 modelos na data da consulta. A classificação pode mudar e não valida o desempenho multilíngue nem em conteúdo longo.
