O lançamento da Google, a 23 de setembro, apresentou dois modelos estáveis de voz na Gemini API e no AI Studio: Flash para utilização criativa e Flash-Lite para grandes volumes. O acesso através da Gemini Enterprise API chegará mais tarde.
Ambos custam menos por minuto de áudio gerado do que a versão preliminar 3.1 Flash TTS. As tarifas Standard duplicam a 1 de janeiro de 2027. A migração também altera a forma como as aplicações enviam instruções e guardam o áudio.
A grande mudança
- O que mudou: Os novos níveis separam o texto a pronunciar das indicações de interpretação e permitem reutilizar vozes.
- Porque é importante: Uma cadeia de processamento de voz tem dois custos de migração a considerar: alterações de engenharia necessárias agora e o aumento programado dos encargos de geração.
- O que importa acompanhar: Para dobragem, audiolivros e agentes de voz, compare a inteligibilidade e a consistência das vozes com guiões de produção reais em vários idiomas. Esses resultados mostrarão se um minuto de geração mais barato também reduz o custo do áudio utilizável.
Custo de geração por minuto
A tabela de preços da Google especifica 25 tokens de áudio por segundo: 1 500 por minuto. O cálculo é a tarifa de saída × 1 500 / 1 000 000; os custos dos tokens de texto de entrada são adicionais. Todos os valores abaixo são preços Standard em dólares norte-americanos.
Modelo | Idiomas indicados | Preço de entrada/saída por milhão de tokens até 31 de dezembro de 2026 | Custo de saída por minuto agora | Custo de saída por minuto a partir de 1 de janeiro de 2027 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | 0,50 USD / 9 USD | 0,0135 USD | 0,027 USD |
Gemini 3.8 Flash-Lite TTS | 101 | 0,50 USD / 6 USD | 0,009 USD | 0,018 USD |
Gemini 3.1 Flash TTS Preview | — | 1 USD / 20 USD | 0,03 USD | Sem alteração anunciada |
Para os modelos 3.8, Batch e Flex custam metade da tarifa Standard; Priority custa 1,8 vezes a tarifa Standard. O índice de modelos da Google recomenda substituir a versão preliminar antiga 3.1 por qualquer um dos novos níveis.
Os comandos e ficheiros de áudio precisam de alterações
O guia de migração do Flash indica que o texto da transcrição é pronunciado literalmente. As instruções prolongadas e as etiquetas de orador devem ser colocadas em speech_metadata; caso contrário, uma instrução antiga, como «Diz com alegria:», poderá ser lida em voz alta. Eventos curtos, como <laugh>, mantêm-se em linha.
Cada turno com vários oradores tem de indicar um orador que corresponda à configuração. As respostas de um só orador incluem agora cabeçalhos WAV, em vez de usarem por predefinição o formato PCM bruto. Remova o código que acrescenta um cabeçalho WAV ou peça explicitamente um formato bruto.
A documentação do Flash-Lite confirma que os dois níveis partilham o mesmo esquema e têm limites de 8 192 tokens de entrada e 16 384 tokens de saída. As aplicações podem, assim, compará-los através da mesma integração.
Clonagem de voz e avaliação
A Google descreve mais de 2 000 vozes prontas a utilizar, criação de vozes e clonagem a partir de uma amostra de 30 segundos de uma voz que o utilizador tenha direito a usar. A clonagem exige uma gravação correspondente de consentimento verbal. A Google afirma que os clips gerados incluem SynthID e que as vozes clonadas têm credenciais C2PA.
A clonagem de voz no AI Studio não está disponível no Illinois, Texas, Espaço Económico Europeu, Reino Unido, Suíça nem Índia.
A Google reporta para o Flash uma pontuação geral de 71,4 e de 60,8 em modelação de sotaques no Voice Design Benchmark da Hume. Coloca o Flash e o Lite, respetivamente, no primeiro e segundo lugares do Overall Quality Index da Hume.
A Artificial Analysis apresentou separadamente o Flash com 1 260,15 pontos Arena Elo, na 27.ª posição entre 95 modelos, a 23 de setembro. Esta medição reflete as preferências do público; a classificação consultada não demonstra o desempenho por idioma ou em gravações longas. Não foram utilizados resultados independentes equivalentes para o Lite.
Para comparar com outra gama de voz alojada, consulte a nossa análise da API e dos preços do Qwen Audio 3.1.



