Google-ово представљање 23. септембра доноси два стабилна говорна модела у Gemini API и AI Studio: Flash за креативне задатке и Flash-Lite за велики обим. Приступ преко Gemini Enterprise API-ја стиже касније.

Оба коштају мање по генерисаном минуту од модела 3.1 Flash TTS Preview. Њихове стандардне цене удвостручују се 1. јануара 2027. Миграција мења и начин на који апликације шаљу упутства и чувају звук.

Велика промена

  • Шта се променило: Нови ценовни нивои раздвајају текст транскрипта од упутстава за извођење и подржавају поновно коришћење гласова.
  • Зашто је важно: При миграцији говорног система треба узети у обзир два трошка: инжењерске измене које треба спровести сада и најављено повећање накнаде за генерисање.
  • Шта треба пратити: За синхронизацију, аудио-књиге и гласовне агенте упоредите разумљивост и доследност говорника на стварним продукционим сценаријима на више језика. Ти резултати ће показати да ли јефтинији генерисани минут снижава и трошак добијања употребљивог звука.

Цена генерисања по минуту

У Google-овој табели цена наведено је 25 аудио-токена у секунди, односно 1.500 у минути. Обрачун је стопа излаза × 1.500 / 1.000.000; улазни текст се наплаћује додатно. Сви износи у наставку су у америчким доларима по стандардним ценама.

Модел

Број наведених језика

Улаз / излаз на милион токена до 31. децембра 2026.

Цена излаза по минуту сада

Цена излаза по минуту од 1. јануара 2027.

Gemini 3.8 Flash TTS

130

$0,50 / $9

$0,0135

$0,027

Gemini 3.8 Flash-Lite TTS

101

$0,50 / $6

$0,009

$0,018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0,03

Промена није најављена

За моделе 3.8, Batch и Flex коштају упола мање од Standard-а; Priority кошта 1,8 пута више од Standard-а. Google-ов индекс модела препоручује замену застарелог модела 3.1 Preview једним од два нова ценовна нивоа.

Упутства и аудио-датотеке захтевају измене

У водичу за миграцију модела Flash пише да се текст транскрипта изговара дословно. Дуготрајна упутства и ознаке говорника уносите у тело упита speech_metadata; старо упутство као што је „Реци весело:“ иначе може бити изговорено наглас. Кратке звучне радње као што су <laugh> остају унутар текста.

У свакој размени са више говорника мора се навести говорник који одговара конфигурацији. Једнократни одговори сада садрже WAV заглавља, уместо старог подразумеваног сировог PCM формата. Уклоните код који додаје WAV заглавље или изричито затражите сирови формат.

У документацији за Flash-Lite потврђује се заједничка шема и ограничења од 8.192 улазна и 16.384 излазна токена за оба нивоа. Апликације стога могу да их упоређују преко исте интеграције.

Репликација гласа и оцена

Google описује више од 2.000 готових гласова, осмишљавање гласа и репликацију на основу тридесетосекундног узорка гласа за који корисник има права. За репликацију је потребан снимак усмене сагласности који одговара узорку. Google наводи да генерисани аудио-снимци садрже SynthID, а да реплицирани гласови имају C2PA акредитиве.

Репликација гласа у AI Studio-у није доступна у Илиноису, Тексасу, Европском економском простору, Уједињеном Краљевству, Швајцарској и Индији.

Google пријављује резултате модела Flash од 71,4 укупно и 60,8 за моделирање акцента на тесту Hume Voice Design Benchmark. Компанија наводи да Flash и Lite заузимају прво и друго место на Hume индексу укупног квалитета.

Artificial Analysis је засебно навео резултат Arena Elo од 1260,15 за Flash, што је 27. место од 95 модела, на дан 23. септембра. Ово мерење бележи склоности корисника; прегледани запис не утврђује перформансе по језику ни при дугим снимцима. Овде није коришћен упоредив независан резултат за Lite.

За поређење са другом линијом говорних модела доступних преко хостованог API-ја погледајте нашу анализу API-ја и цена Qwen Audio 3.1.