O lançamento do Google em 23 de setembro trouxe dois modelos estáveis de voz para a API Gemini e o AI Studio: o Flash para trabalhos criativos e o Flash-Lite para alto volume. O acesso pela Gemini Enterprise API chegará mais tarde.

O custo de saída dos dois modelos por minuto gerado é menor que o do 3.1 Flash TTS Preview. As tarifas Standard dobram em 1º de janeiro de 2027. A migração também muda a forma como os aplicativos enviam instruções e salvam o áudio.

A grande mudança

  • O que mudou: As novas versões separam o texto da transcrição das instruções de desempenho e permitem reutilizar vozes.
  • Por que isso importa: Um sistema de voz precisa levar em conta dois custos de migração: as mudanças de engenharia necessárias agora e o aumento programado das cobranças de geração.
  • O que observar: Para dublagem, audiolivros e agentes de voz, compare a inteligibilidade e a consistência das vozes usando roteiros reais de produção em diferentes idiomas. Esses resultados determinarão se o menor preço por minuto gerado também reduz o custo do áudio que pode ser usado.

Custo de saída por minuto

A tabela de preços do Google especifica 25 tokens de áudio por segundo, ou 1.500 por minuto. O cálculo é tarifa de saída × 1.500 ÷ 1.000.000; os custos de entrada de texto são cobrados à parte. Todos os valores abaixo estão em dólares americanos, nas tarifas Standard.

Modelo

Idiomas listados

Entrada/saída por milhão de tokens até 31 de dezembro de 2026

Custo de saída por minuto agora

Custo de saída por minuto a partir de 1º de janeiro de 2027

Gemini 3.8 Flash TTS

130

US$ 0,50/US$ 9

US$ 0,0135

US$ 0,027

Gemini 3.8 Flash-Lite TTS

101

US$ 0,50/US$ 6

US$ 0,009

US$ 0,018

Gemini 3.1 Flash TTS Preview

—

US$ 1/US$ 20

US$ 0,03

Nenhuma mudança anunciada

Para os modelos 3.8, as tarifas Batch e Flex custam metade da Standard; a Priority custa 1,8 vez a tarifa Standard. O índice de modelos do Google recomenda substituir a versão legada 3.1 Preview por uma das novas versões.

Os comandos e arquivos de áudio exigem mudanças

O guia de migração do Flash diz que o texto da transcrição é pronunciado literalmente. Coloque instruções contínuas e rótulos de voz em speech_metadata; uma instrução antiga como “Diga com alegria:” pode acabar sendo lida em voz alta. Eventos breves como <laugh> permanecem em linha.

Cada fala em uma resposta com vários interlocutores precisa indicar um locutor correspondente à configuração. Agora, as respostas unárias incluem cabeçalhos WAV, que substituem a saída PCM bruta usada como padrão anteriormente. Remova o código que acrescenta um cabeçalho WAV ou solicite explicitamente um formato bruto.

A documentação do Flash-Lite confirma que os dois níveis usam o mesmo esquema e têm limites de 8.192 tokens de entrada e 16.384 de saída. Assim, os aplicativos podem compará-los usando a mesma integração.

Replicação e avaliação de vozes

O Google descreve mais de 2.000 vozes prontas, criação de vozes e replicação a partir de uma amostra de 30 segundos de uma voz que o usuário tem direito de usar. A replicação exige uma gravação correspondente de consentimento verbal. O Google diz que os clipes gerados incluem SynthID e as vozes replicadas têm credenciais C2PA.

A replicação de vozes pelo AI Studio não está disponível em Illinois, Texas, Espaço Econômico Europeu, Reino Unido, Suíça e Índia.

O Google informa pontuações de 71,4 no geral e 60,8 em modelagem de sotaques para o Flash no Voice Design Benchmark da Hume. A empresa o coloca em primeiro lugar e o Lite em segundo no Overall Quality Index da Hume.

A Artificial Analysis listou separadamente o Flash com 1.260,15 pontos Arena Elo, na 27ª posição entre 95 modelos, em 23 de setembro. Essa métrica representa preferências do público; a listagem consultada não estabelece o desempenho por idioma nem em gravações longas. Nenhum resultado independente equivalente para o Lite foi usado aqui.

Para comparar com outra linha de modelos de voz hospedados, consulte nossa análise da API e dos preços do Qwen Audio 3.1.