Googleovo predstavljanje 23. septembra donelo je dva stabilna govorna modela u Gemini API i AI Studio: Flash za kreativni rad i Flash-Lite za veliki obim upotrebe. Pristup kroz Gemini Enterprise API stiže kasnije.

Oba modela koštaju manje po minutu generisanog zvuka od modela 3.1 Flash TTS Preview. Njihove standardne cene udvostručiće se 1. januara 2027. Migracija menja i način na koji aplikacije šalju uputstva i čuvaju zvuk.

Najvažnija promena

  • Šta se menja: Novi nivoi razdvajaju tekst transkripta od uputstava za izvođenje i podržavaju glasove koji mogu ponovo da se koriste.
  • Zašto je važno: Pri migraciji govornog sistema treba uzeti u obzir dva troška: sadašnje izmene u inženjerskom radu i najavljeno povećanje naknada za generisanje.
  • Na šta obratiti pažnju: Za sinhronizaciju, audio-knjige i glasovne agente uporedite razumljivost i doslednost govornika na stvarnim produkcionim tekstovima na više jezika. Ti rezultati pokazuju da li jeftiniji minut generisanog zvuka zaista smanjuje cenu upotrebljivog zvuka.

Cena izlaznog zvuka po minutu

Googleova tabela cena navodi 25 audio-tokena u sekundi, odnosno 1.500 u minutu. Obračun je izlazna cena × 1.500 / 1.000.000; ulazni tekst se dodatno naplaćuje. Svi iznosi u nastavku su u američkim dolarima po standardnim cenama.

Model

Navedeni jezici

Ulaz / izlaz na milion tokena do 31. decembra 2026.

Izlaz po minutu sada

Izlaz po minutu od 1. januara 2027.

Gemini 3.8 Flash TTS

130

0,50 USD / 9 USD

0,0135 USD

0,027 USD

Gemini 3.8 Flash-Lite TTS

101

0,50 USD / 6 USD

0,009 USD

0,018 USD

Gemini 3.1 Flash TTS Preview

—

1 USD / 20 USD

0,03 USD

Nije najavljena promena

Za modele 3.8, Batch i Flex koštaju upola manje od standardne cene, dok Priority košta 1,8 puta više. Googleov indeks modela preporučuje zamenu zastarelog modela 3.1 Preview jednim od novih nivoa.

Potrebne su izmene promptova i audio-datoteka

U vodiču za migraciju modela Flash navodi se da se tekst transkripta izgovara doslovno. Trajna uputstva i oznake govornika unesite u speech_metadata; u suprotnom, staro uputstvo poput „Reci veselo:“ može da bude pročitano naglas. Kratki zvučni efekti, kao što je <laugh>, ostaju u tekstu.

Svaki red u dijalogu sa više govornika mora da navede govornika čije ime odgovara podešavanjima. Odgovori na pojedinačne zahteve sada sadrže WAV zaglavlja, za razliku od ranijeg podrazumevanog sirovog PCM formata. Uklonite kod koji dodaje WAV zaglavlje ili izričito zatražite sirovi format.

Dokumentacija za Flash-Lite potvrđuje zajedničku šemu i ograničenja od 8.192 ulazna i 16.384 izlazna tokena za oba nivoa. Aplikacije zato mogu da ih upoređuju kroz istu integraciju.

Replikacija glasa i evaluacija

Google navodi da je dostupno više od 2.000 gotovih glasova, kao i dizajn glasa i replikacija na osnovu uzorka od 30 sekundi za čiji korisnik ima pravo upotrebe. Za replikaciju je potreban odgovarajući snimak usmene saglasnosti. Google navodi da generisani klipovi nose SynthID, a replike glasova C2PA podatke o poreklu.

Replikacija glasa u AI Studio nije dostupna u Ilinoisu, Teksasu, Evropskom ekonomskom prostoru, Ujedinjenom Kraljevstvu, Švajcarskoj i Indiji.

Google navodi da je Flash ostvario rezultate 71,4 ukupno i 60,8 u modelovanju akcenata na Humeovom merilu Voice Design Benchmark. Prema Googleu, Flash i Lite zauzimaju prvo i drugo mesto na Humeovom indeksu Overall Quality Index.

Artificial Analysis je zasebno uvrstio Flash sa Arena Elo ocenom 1260,15, na 27. mestu među 95 modela, 23. septembra. To meri sklonost publike; pregledana rang-lista ne utvrđuje performanse po jezicima niti pri dugim snimanjima. Ovde nije korišćen uporediv nezavisni rezultat za Lite.

Za poređenje sa još jednim skupom hostovanih govornih usluga pogledajte našu analizu API-ja i cena Qwen Audio 3.1.