O lançamento do Google em 23 de setembro trouxe dois modelos estáveis de voz para a API Gemini e o AI Studio: o Flash para trabalhos criativos e o Flash-Lite para alto volume. O acesso pela Gemini Enterprise API chegará mais tarde.
O custo de saída dos dois modelos por minuto gerado é menor que o do 3.1 Flash TTS Preview. As tarifas Standard dobram em 1º de janeiro de 2027. A migração também muda a forma como os aplicativos enviam instruções e salvam o áudio.
A grande mudança
- O que mudou: As novas versões separam o texto da transcrição das instruções de desempenho e permitem reutilizar vozes.
- Por que isso importa: Um sistema de voz precisa levar em conta dois custos de migração: as mudanças de engenharia necessárias agora e o aumento programado das cobranças de geração.
- O que observar: Para dublagem, audiolivros e agentes de voz, compare a inteligibilidade e a consistência das vozes usando roteiros reais de produção em diferentes idiomas. Esses resultados determinarão se o menor preço por minuto gerado também reduz o custo do áudio que pode ser usado.
Custo de saída por minuto
A tabela de preços do Google especifica 25 tokens de áudio por segundo, ou 1.500 por minuto. O cálculo é tarifa de saída × 1.500 ÷ 1.000.000; os custos de entrada de texto são cobrados à parte. Todos os valores abaixo estão em dólares americanos, nas tarifas Standard.
Modelo | Idiomas listados | Entrada/saída por milhão de tokens até 31 de dezembro de 2026 | Custo de saída por minuto agora | Custo de saída por minuto a partir de 1º de janeiro de 2027 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | US$ 0,50/US$ 9 | US$ 0,0135 | US$ 0,027 |
Gemini 3.8 Flash-Lite TTS | 101 | US$ 0,50/US$ 6 | US$ 0,009 | US$ 0,018 |
Gemini 3.1 Flash TTS Preview | — | US$ 1/US$ 20 | US$ 0,03 | Nenhuma mudança anunciada |
Para os modelos 3.8, as tarifas Batch e Flex custam metade da Standard; a Priority custa 1,8 vez a tarifa Standard. O índice de modelos do Google recomenda substituir a versão legada 3.1 Preview por uma das novas versões.
Os comandos e arquivos de áudio exigem mudanças
O guia de migração do Flash diz que o texto da transcrição é pronunciado literalmente. Coloque instruções contínuas e rótulos de voz em speech_metadata; uma instrução antiga como “Diga com alegria:” pode acabar sendo lida em voz alta. Eventos breves como <laugh> permanecem em linha.
Cada fala em uma resposta com vários interlocutores precisa indicar um locutor correspondente à configuração. Agora, as respostas unárias incluem cabeçalhos WAV, que substituem a saída PCM bruta usada como padrão anteriormente. Remova o código que acrescenta um cabeçalho WAV ou solicite explicitamente um formato bruto.
A documentação do Flash-Lite confirma que os dois níveis usam o mesmo esquema e têm limites de 8.192 tokens de entrada e 16.384 de saída. Assim, os aplicativos podem compará-los usando a mesma integração.
Replicação e avaliação de vozes
O Google descreve mais de 2.000 vozes prontas, criação de vozes e replicação a partir de uma amostra de 30 segundos de uma voz que o usuário tem direito de usar. A replicação exige uma gravação correspondente de consentimento verbal. O Google diz que os clipes gerados incluem SynthID e as vozes replicadas têm credenciais C2PA.
A replicação de vozes pelo AI Studio não está disponível em Illinois, Texas, Espaço Econômico Europeu, Reino Unido, Suíça e Índia.
O Google informa pontuações de 71,4 no geral e 60,8 em modelagem de sotaques para o Flash no Voice Design Benchmark da Hume. A empresa o coloca em primeiro lugar e o Lite em segundo no Overall Quality Index da Hume.
A Artificial Analysis listou separadamente o Flash com 1.260,15 pontos Arena Elo, na 27ª posição entre 95 modelos, em 23 de setembro. Essa métrica representa preferências do público; a listagem consultada não estabelece o desempenho por idioma nem em gravações longas. Nenhum resultado independente equivalente para o Lite foi usado aqui.
Para comparar com outra linha de modelos de voz hospedados, consulte nossa análise da API e dos preços do Qwen Audio 3.1.



