Google సెప్టెంబర్ 23 విడుదల Gemini API, AI Studioకి రెండు స్థిర వాయిస్ మోడళ్లను తీసుకువస్తుంది: సృజనాత్మక పనులకు Flash, అధిక పరిమాణానికి Flash-Lite. Gemini Enterprise API ప్రాప్యత తర్వాత వస్తుంది.

రూపొందించిన ప్రతి నిమిషం ఖర్చు 3.1 Flash TTS Preview కంటే రెండింటిలోనూ తక్కువ. వాటి Standard ధరలు 2027 జనవరి 1న రెట్టింపవుతాయి. వలసలో అప్లికేషన్‌లు సూచనలు పంపే, ఆడియోను సేవ్ చేసే విధానమూ మారుతుంది.

పెద్ద మార్పు

  • ఏం మారింది:కొత్త శ్రేణుల్లో చదివే లిప్యంతరీకరణ పాఠ్యాన్ని ప్రదర్శన సూచనల నుంచి వేరు చేసి, మళ్లీ ఉపయోగించగల వాయిస్‌లకు మద్దతు ఇస్తారు.
  • ఇది ఎందుకు ముఖ్యం:వాయిస్ పైప్‌లైన్‌కు వలసలో రెండు ఖర్చులున్నాయి: ఇప్పుడు చేయాల్సిన ఇంజినీరింగ్ మార్పులు, ఉత్పత్తి ఛార్జీల్లో షెడ్యూల్ చేసిన పెంపు.
  • ఏం గమనించాలి:డబ్బింగ్, ఆడియో పుస్తకాలు, వాయిస్ ఏజెంట్‌ల కోసం వివిధ భాషల్లో నిజమైన ఉత్పత్తి స్క్రిప్ట్‌లతో ఉచ్చారణ స్పష్టత, వక్త స్థిరత్వాన్ని పోల్చండి. ప్రతి నిమిషం రూపొందించడానికి తక్కువ ఖర్చు, ఉపయోగించగల ఆడియో ఖర్చునూ తగ్గిస్తుందా అనేది ఆ ఫలితాలు తేలుస్తాయి.

ఒక్కో నిమిషం అవుట్‌పుట్ ఖర్చు

Google ధరల పట్టిక సెకనుకు 25 ఆడియో టోకెన్‌లు, అంటే నిమిషానికి 1,500 అని నిర్దేశిస్తుంది. లెక్క: అవుట్‌పుట్ రేటు × 1,500 / 1,000,000; టెక్స్ట్-ఇన్‌పుట్ ఛార్జీలు అదనం. దిగువ మొత్తాలన్నీ Standard ధరలలోని US డాలర్లు.

మోడల్

జాబితాలోని భాషలు

2026 డిసెంబర్ 31 వరకు ప్రతి 1M టోకెన్‌లకు ఇన్‌పుట్ / అవుట్‌పుట్

ఇప్పుడు ఒక్కో నిమిషం అవుట్‌పుట్

2027 జనవరి 1 నుంచి ఒక్కో నిమిషం అవుట్‌పుట్

Gemini 3.8 Flash TTS

130

$0.50 / $9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

101

$0.50 / $6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0.03

మార్పు ప్రకటించలేదు

3.8 మోడళ్లకు Batch, Flex ధరలు Standardలో సగం; Priority ధర 1.8 రెట్లు. Google మోడల్ సూచిక పాత 3.1 ప్రివ్యూకు బదులుగా కొత్త రెండు శ్రేణుల్లో ఏదో ఒకటి ఎంచుకోవాలని Google సూచిస్తుంది.

సూచనలు, ఆడియో ఫైళ్లకు మార్పులు అవసరం

ఈ Flash వలస మార్గదర్శకం ప్రకారం, లిప్యంతరీకరణ పాఠ్యాన్ని యథాతథంగా పలుకుతారు. నిరంతర సూచనలు, వక్త లేబుల్‌లను speech_metadata వేరుగా ఉంచాలి; లేకపోతే “సంతోషంగా చెప్పండి:” వంటి పాత సూచనను గట్టిగా చదవవచ్చు. సంక్షిప్త ధ్వని సంఘటనలు <laugh> మాత్రం పాఠ్యంలోనే ఉంటాయి.

బహుళ వక్తల ప్రతి మాట మార్పులో, అమరికలోని పేరుకు సరిపడే వక్తను తప్పనిసరిగా పేర్కొనాలి. Unary ప్రతిస్పందనల్లో ఇప్పుడు WAV header ఉంటుంది; మునుపటి డిఫాల్ట్ ముడి PCM. WAV header జోడించే కోడ్‌ను తొలగించండి లేదా ముడి ఫార్మాట్‌ను స్పష్టంగా అడగండి.

Flash-Lite డాక్యుమెంటేషన్ రెండు శ్రేణులకూ ఒకే schema, 8,192 ఇన్‌పుట్ టోకెన్‌లు, 16,384 అవుట్‌పుట్ టోకెన్‌ల పరిమితులున్నాయని నిర్ధారిస్తుంది. అందువల్ల అప్లికేషన్‌లు ఒకే అనుసంధానంతో రెండింటినీ పోల్చవచ్చు.

2,000కుపైగా సిద్ధంగా ఉన్న వాయిస్‌లు, వాయిస్ రూపకల్పన, వినియోగ హక్కులు ఉన్న 30 సెకన్ల నమూనాతో ప్రతిరూపణను Google వివరిస్తుంది. ప్రతిరూపణకు సరిపోయే మౌఖిక సమ్మతి రికార్డింగ్ అవసరం. రూపొందించిన క్లిప్‌లలో SynthID, ప్రతిరూప వాయిస్‌లలో C2PA ఆధారాలు ఉంటాయని Google చెబుతుంది.

AI Studioలో వాయిస్ ప్రతిరూపణకు Illinois, Texas, European Economic Area, UK, Switzerland, India మినహాయింపు.

Hume Voice Design Benchmarkలో Flash మొత్తం 71.4, accent modelingలో 60.8 స్కోరు సాధించిందని Google నివేదిస్తుంది. Hume Overall Quality Indexలో Flash, Lite వరుసగా మొదటి, రెండో స్థానాల్లో ఉన్నాయని చెబుతుంది.

Flashకు Hume Voice Design Benchmarkలో మొత్తం 71.4, accent modelingలో 60.8 స్కోరు వచ్చిందని Google నివేదిస్తుంది. Hume Overall Quality Indexలో Flash, Lite వరుసగా మొదటి, రెండో స్థానాల్లో ఉన్నాయని కూడా చెబుతుంది.

Artificial Analysis సెప్టెంబర్ 23న Flashకు Arena Elo 1260.15, 95 మోడళ్లలో 27వ స్థానం ఇచ్చింది. ఇది సమూహ అభిరుచిని కొలుస్తుంది; సమీక్షించిన జాబితా భాషలవారీ పనితీరును లేదా దీర్ఘ రికార్డింగ్‌లను నిర్ధారించదు. పోలికలో సమాన స్వతంత్ర Lite ఫలితాన్ని ఉపయోగించలేదు.

మరో హోస్ట్ చేసిన వాయిస్ శ్రేణితో పోలిక కోసం మా Qwen Audio 3.1 API, ధరల విశ్లేషణచూడండి.