Peluncuran Google pada 23 September menghadirkan dua model suara stabil ke Gemini API dan AI Studio: Flash untuk pekerjaan kreatif dan Flash-Lite untuk penggunaan skala besar. Akses melalui Gemini Enterprise API akan menyusul.

Biaya keduanya per menit audio yang dihasilkan lebih rendah daripada 3.1 Flash TTS Preview. Tarif Standard akan berlipat ganda pada 1 Januari 2027. Migrasi juga mengubah cara aplikasi mengirim instruksi dan menyimpan audio.

Perubahan besar

  • Yang berubah: Tingkat baru memisahkan teks transkrip dari arahan performa dan mendukung suara yang dapat digunakan kembali.
  • Mengapa ini penting: Ada dua biaya migrasi yang perlu diperhitungkan dalam alur kerja suara: perubahan teknis sekarang dan kenaikan biaya pembuatan audio yang telah dijadwalkan.
  • Yang perlu dipantau: Untuk sulih suara, buku audio, dan agen suara, bandingkan kejelasan ucapan serta konsistensi pembicara dengan naskah produksi sungguhan dalam berbagai bahasa. Hasil itulah yang menentukan apakah biaya per menit audio yang lebih murah juga menurunkan biaya audio yang benar-benar dapat digunakan.

Biaya keluaran per menit

Tabel harga Google menetapkan 25 token audio per detik atau 1.500 token per menit. Perhitungannya adalah tarif keluaran × 1.500 / 1.000.000; biaya masukan teks dikenakan terpisah. Semua angka berikut adalah dolar AS dengan tarif Standard.

Model

Bahasa yang tercantum

Masukan / keluaran per 1 juta token hingga 31 Desember 2026

Keluaran/menit saat ini

Keluaran/menit mulai 1 Januari 2027

Gemini 3.8 Flash TTS

130

US$0,50 / US$9

US$0,0135

US$0,027

Gemini 3.8 Flash-Lite TTS

101

US$0,50 / US$6

US$0,009

US$0,018

Gemini 3.1 Flash TTS Preview

—

US$1 / US$20

US$0,03

Belum ada perubahan yang diumumkan

Untuk model 3.8, Batch dan Flex berbiaya setengah tarif Standard; Priority berbiaya 1,8 kali tarif Standard. Indeks model Google menyarankan untuk mengganti pratinjau 3.1 yang lama dengan salah satu tingkat baru.

Prompt dan berkas audio perlu diubah

Panduan migrasi Flash menyebut teks transkrip akan diucapkan persis seperti tertulis. Cantumkan arahan berkelanjutan dan label pembicara di speech_metadata; jika tidak, instruksi lama seperti “Ucapkan dengan ceria:” bisa ikut dibacakan. Efek singkat seperti <laugh>.

Setiap giliran bicara dengan banyak pembicara harus mencantumkan nama pembicara yang cocok dengan konfigurasi. Respons unary kini menyertakan header WAV, menggantikan keluaran default lama berupa PCM mentah. Hapus kode yang menambahkan header WAV atau minta format mentah secara eksplisit.

Dokumentasi Flash-Lite mengonfirmasi skema yang sama serta batas masukan 8.192 token dan keluaran 16.384 token untuk kedua tingkat. Karena itu, aplikasi dapat membandingkan keduanya melalui integrasi yang sama.

Replikasi suara dan evaluasi

Google menjelaskan bahwa tersedia lebih dari 2.000 suara siap pakai, desain suara, dan replikasi dari sampel suara berdurasi 30 detik yang hak penggunaannya dimiliki pemakai. Replikasi memerlukan rekaman persetujuan lisan yang sesuai. Google mengatakan klip yang dihasilkan memuat SynthID, sedangkan suara hasil replikasi memiliki kredensial C2PA.

Replikasi suara di AI Studio tidak tersedia di Illinois, Texas, Kawasan Ekonomi Eropa, Inggris Raya, Swiss, dan India.

Google melaporkan skor Flash 71,4 secara keseluruhan dan 60,8 untuk pemodelan aksen pada Voice Design Benchmark milik Hume. Menurut Google, Flash dan Lite menempati urutan pertama dan kedua pada Overall Quality Index dari Hume.

Artificial Analysis secara terpisah mencatat Flash dengan skor 1260,15 Arena Elo pada 23 September, menempatkannya di urutan ke-27 dari 95 model. Ini mengukur preferensi pengguna; daftar yang ditinjau tidak membuktikan kinerja per bahasa atau dalam rekaman panjang. Kami tidak menggunakan hasil independen setara untuk Lite.

Untuk perbandingan dengan jajaran suara lain yang dihosting, baca analisis kami tentang API dan harga Qwen Audio 3.1.