AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS está mais barato. O preço duplica a 1 de janeiro

> Os modelos estáveis Gemini 3.8 TTS da Google baixam o custo de geração de áudio, mas os preços duplicam a 1 de janeiro e a migração implica alterações a comandos e ficheiros WAV.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[O ](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)lançamento da Google, a 23 de setembro, apresentou dois modelos estáveis de voz na Gemini API e no AI Studio: Flash para utilização criativa e Flash-Lite para grandes volumes. O acesso através da Gemini Enterprise API chegará mais tarde.

Ambos custam menos por minuto de áudio gerado do que a versão preliminar 3.1 Flash TTS. As tarifas Standard duplicam a 1 de janeiro de 2027. A migração também altera a forma como as aplicações enviam instruções e guardam o áudio.

## A grande mudança

- **O que mudou:** Os novos níveis separam o texto a pronunciar das indicações de interpretação e permitem reutilizar vozes.
- **Porque é importante:** Uma cadeia de processamento de voz tem dois custos de migração a considerar: alterações de engenharia necessárias agora e o aumento programado dos encargos de geração.
- **O que importa acompanhar:** Para dobragem, audiolivros e agentes de voz, compare a inteligibilidade e a consistência das vozes com guiões de produção reais em vários idiomas. Esses resultados mostrarão se um minuto de geração mais barato também reduz o custo do áudio utilizável.

## Custo de geração por minuto

[A tabela de preços da Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) especifica 25 tokens de áudio por segundo: 1 500 por minuto. O cálculo é a tarifa de saída × 1 500 / 1 000 000; os custos dos tokens de texto de entrada são adicionais. Todos os valores abaixo são preços Standard em dólares norte-americanos.

| Modelo | Idiomas indicados | Preço de entrada/saída por milhão de tokens até 31 de dezembro de 2026 | Custo de saída por minuto agora | Custo de saída por minuto a partir de 1 de janeiro de 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | 0,50 USD / 9 USD | 0,0135 USD | 0,027 USD |
| Gemini 3.8 Flash-Lite TTS | 101 | 0,50 USD / 6 USD | 0,009 USD | 0,018 USD |
| Gemini 3.1 Flash TTS Preview | — | 1 USD / 20 USD | 0,03 USD | Sem alteração anunciada |

Para os modelos 3.8, Batch e Flex custam metade da tarifa Standard; Priority custa 1,8 vezes a tarifa Standard. O [índice de modelos](https://ai.google.dev/gemini-api/docs/models) da Google recomenda substituir a versão preliminar antiga 3.1 por qualquer um dos novos níveis.

## Os comandos e ficheiros de áudio precisam de alterações

O [guia de migração do Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) indica que o texto da transcrição é pronunciado literalmente. As instruções prolongadas e as etiquetas de orador devem ser colocadas em `speech_metadata`; caso contrário, uma instrução antiga, como «Diz com alegria:», poderá ser lida em voz alta. Eventos curtos, como `<laugh>`, mantêm-se em linha.

Cada turno com vários oradores tem de indicar um orador que corresponda à configuração. As respostas de um só orador incluem agora cabeçalhos WAV, em vez de usarem por predefinição o formato PCM bruto. Remova o código que acrescenta um cabeçalho WAV ou peça explicitamente um formato bruto.

[A documentação do Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) confirma que os dois níveis partilham o mesmo esquema e têm limites de 8 192 tokens de entrada e 16 384 tokens de saída. As aplicações podem, assim, compará-los através da mesma integração.

## Clonagem de voz e avaliação

A Google descreve mais de 2 000 vozes prontas a utilizar, criação de vozes e clonagem a partir de uma amostra de 30 segundos de uma voz que o utilizador tenha direito a usar. A clonagem exige uma gravação correspondente de consentimento verbal. A Google afirma que os clips gerados incluem SynthID e que as vozes clonadas têm credenciais C2PA.

A clonagem de voz no AI Studio não está disponível no Illinois, Texas, Espaço Económico Europeu, Reino Unido, Suíça nem Índia.

A Google reporta para o Flash uma pontuação geral de 71,4 e de 60,8 em modelação de sotaques no Voice Design Benchmark da Hume. Coloca o Flash e o Lite, respetivamente, no primeiro e segundo lugares do Overall Quality Index da Hume.

[A Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) apresentou separadamente o Flash com 1 260,15 pontos Arena Elo, na 27.ª posição entre 95 modelos, a 23 de setembro. Esta medição reflete as preferências do público; a classificação consultada não demonstra o desempenho por idioma ou em gravações longas. Não foram utilizados resultados independentes equivalentes para o Lite.

Para comparar com outra gama de voz alojada, consulte a nossa análise da [API e dos preços do Qwen Audio 3.1](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8 text-to-speech dá as boas-vindas](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Âmbito oficial do lançamento, funções dos modelos, número de idiomas, funcionalidades de voz, controlos de consentimento e disponibilidade regional, além dos resultados de avaliação reportados pela Google. As alegações de qualidade são atribuídas à Google.
- [Documentação do modelo Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Esquema atual dos pedidos, limites de entrada e saída, tratamento do texto de transcrição, etiquetas de eventos em linha, validação de vários oradores e transição do formato PCM bruto para WAV por predefinição.
- [Documentação do modelo Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Descrição atual do nível destinado a grandes volumes, dos 101 idiomas indicados e da interface comum aos modelos 3.8.
- [Preços da Gemini API](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Tarifas oficiais Standard, Batch, Flex e Priority; fim dos preços promocionais a 31 de dezembro, tarifas a partir de 1 de janeiro e conversão baseada em 25 tokens de áudio por segundo.
- [Geração de voz a partir de texto](https://ai.google.dev/gemini-api/docs/speech-generation) — O guia atual de voz documenta a tabela de idiomas 3.8, o tratamento de texto de transcrição e o comportamento da migração. A tabela atual não estabelece o número de idiomas da versão preliminar anterior.
- [Modelos Gemini](https://ai.google.dev/gemini-api/docs/models) — O índice atual de modelos identifica o 3.1 Flash TTS como uma versão preliminar antiga e recomenda a atualização para Gemini 3.8 Flash TTS ou Flash-Lite TTS.
- [Gemini 3.8 Flash TTS: análise de qualidade, velocidade e preço](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Classificação independente publicada no dia do lançamento para o modelo Flash específico: 1 260,15 pontos Arena Elo e 27.º lugar entre 95 modelos à data da consulta. A classificação pode mudar e não constitui uma avaliação multilingue ou de gravações longas.
