जग स्थिर नाही.RSS
BIG CHANGE.

Markdown आवृत्ती

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS आता स्वस्त; १ जानेवारीला किंमत दुप्पट

> Google च्या स्थिर Gemini 3.8 TTS मॉडेल्समुळे तयार ऑडिओचा खर्च कमी होतो; पण १ जानेवारीला किंमती दुप्पट होतील आणि स्थलांतरात prompt तसेच WAV हाताळणी बदलेल.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google च्या २३ सप्टेंबरच्या लाँचमध्ये](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) Gemini API आणि AI Studio साठी दोन स्थिर स्पीच मॉडेल्स आहेत: सर्जनशील कामांसाठी Flash आणि मोठ्या प्रमाणासाठी Flash-Lite. Gemini Enterprise API चा प्रवेश नंतर येईल.

दोन्हींचा प्रति मिनिट तयार ऑडिओचा खर्च 3.1 Flash TTS Preview पेक्षा कमी आहे. Standard दर १ जानेवारी २०२७ रोजी दुप्पट होतील. स्थलांतरामुळे अॅप्लिकेशन सूचना कशा पाठवतात आणि ऑडिओ कसा साठवतात हेही बदलेल.

## मोठा बदल

- **काय बदलले:** नव्या स्तरांत प्रतिलेखातील मजकूर आणि सादरीकरणाच्या सूचना वेगळ्या ठेवता येतात; पुन्हा वापरता येणारे आवाजही समर्थित आहेत.
- **हे का महत्त्वाचे:** व्हॉइस पाइपलाइन स्थलांतरित करताना दोन खर्च लक्षात घ्यावेत: आत्ताचे अभियांत्रिकी बदल आणि नियोजित दरवाढीनंतरचे निर्मिती-शुल्क.
- **कशाकडे लक्ष द्यावे:** डबिंग, ऑडिओबुक आणि व्हॉइस एजंटसाठी विविध भाषांतील प्रत्यक्ष स्क्रिप्टवर स्पष्टता आणि वक्त्याच्या आवाजातील सातत्य तपासा. स्वस्त तयार-मिनिटामुळे वापरण्यायोग्य ऑडिओचा खर्च कमी होतो का हे निकाल ठरवतील.

## प्रति मिनिट आउटपुटचा खर्च

[Google च्या किंमत-तक्त्यात](https://ai.google.dev/gemini-api/docs/pricing?hl=en) दर सेकंदाला २५ ऑडिओ टोकन, म्हणजे मिनिटाला १,५००, दिले आहेत. गणना: आउटपुट दर × १,५०० ÷ १,०००,०००; मजकूर-इनपुट शुल्क वेगळे. खालील आकडे Standard दराने अमेरिकी डॉलरमध्ये आहेत.

| मॉडेल | सूचीत नमूद भाषा | ३१ डिसेंबर २०२६ पर्यंत प्रति दशलक्ष टोकन इनपुट / आउटपुट | सध्याचा प्रति-मिनिट आउटपुट खर्च | १ जानेवारी २०२७ पासूनचा प्रति-मिनिट आउटपुट खर्च |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | बदल जाहीर नाही |

3.8 मॉडेल्ससाठी Batch आणि Flex दर Standard च्या निम्मे; Priority दर १.८ पट आहेत. Google चा [मॉडेल निर्देशांक](https://ai.google.dev/gemini-api/docs/models) जुन्या 3.1 Preview ऐवजी नव्या स्तरांपैकी एक वापरण्याची शिफारस करतो.

## Prompt आणि ऑडिओ फाइल्समध्ये बदल आवश्यक

Flash साठीचा [स्थलांतर मार्गदर्शकानुसार](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) प्रतिलेखातील मजकूर जसाच्या तसा बोलला जातो. टिकणाऱ्या सूचना आणि वक्त्याची लेबले `speech_metadata` मध्ये द्या; “आनंदाने म्हणा:” अशी जुनी सूचना अन्यथा मोठ्याने वाचली जाऊ शकते. लहान ध्वनी-घटना जसे `<laugh>` मजकूराच्या ओघात ठेवा.

अनेक वक्त्यांच्या प्रत्येक संवादात सेटिंगमधील नावाशी जुळणारा वक्ता नमूद करावा. एकाच वक्त्याच्या प्रतिसादांत आता WAV हेडर असतात; जुन्या डीफॉल्ट raw PCM ऐवजी. कोड WAV हेडर जोडत असल्यास तो भाग काढा किंवा raw format स्पष्टपणे मागवा.

[Flash-Lite च्या कागदपत्रांत](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) दोन्ही स्तरांसाठी समान schema आणि ८,१९२ इनपुट व १६,३८४ आउटपुट टोकन मर्यादा आहेत. अॅप्लिकेशन्स एकाच एकत्रीकरणातून त्यांची तुलना करू शकतात.

## आवाजाची प्रतिकृती आणि मूल्यमापन

२,०००हून अधिक तयार आवाज, आवाजाची रचना आणि वापराचा अधिकार असलेल्या आवाजाच्या ३० सेकंदांच्या नमुन्यावरून प्रतिकृती तयार करता येते, असे Google सांगते. प्रतिकृतीसाठी जुळणारे मौखिक-संमतीचे ध्वनिमुद्रण आवश्यक आहे. तयार क्लिपमध्ये SynthID आणि प्रतिकृती केलेल्या आवाजांत C2PA ओळखपत्रे असतात, असे कंपनी म्हणते.

AI Studio मधील आवाज-प्रतिकृती सेवा इलिनॉय, टेक्सास, युरोपियन आर्थिक क्षेत्र, यूके, स्वित्झर्लंड आणि भारतात उपलब्ध नाही.

Hume Voice Design Benchmark वर Flash ला एकूण ७१.४ आणि उच्चार-मॉडेलिंगसाठी ६०.८ गुण मिळाल्याचे Google सांगते. Hume च्या Overall Quality Index मध्ये Flash आणि Lite पहिल्या व दुसऱ्या क्रमांकावर असल्याचेही ते म्हणते.

[Artificial Analysis ने](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) २३ सप्टेंबरला Flash साठी १२६०.१५ Arena Elo नोंदवले; ९५ मॉडेल्सपैकी तो २७वा होता. हे गर्दीच्या पसंतीचे मोजमाप आहे; या नोंदीतून भाषा-निहाय किंवा दीर्घ रेकॉर्डिंगची कामगिरी सिद्ध होत नाही. Lite साठीचा समतुल्य स्वतंत्र निकाल येथे वापरलेला नाही.

दुसऱ्या होस्टेड स्पीच संचाशी तुलना करण्यासाठी आमचे [Qwen Audio 3.1 API आणि किंमत विश्लेषण](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8 text-to-speech कडून नमस्कार](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — अधिकृत लाँचची व्याप्ती, मॉडेलची भूमिका, भाषा-संख्या, आवाज वैशिष्ट्ये, संमती-नियंत्रणे, प्रादेशिक उपलब्धता आणि Google ने दिलेले बेंचमार्क निकाल. गुणवत्तेचे दावे Google ला श्रेय देऊन मांडले आहेत.
- [Gemini 3.8 Flash TTS मॉडेलचे दस्तऐवजीकरण](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — सध्याची विनंती-रचना, इनपुट-आउटपुट मर्यादा, प्रतिलेखाची हाताळणी, मजकुरातील ध्वनी-घटना टॅग, अनेक वक्त्यांची पडताळणी आणि raw PCM वरून डीफॉल्ट WAV आउटपुटकडे झालेला बदल.
- [Gemini 3.8 Flash-Lite TTS मॉडेलचे दस्तऐवजीकरण](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — मोठ्या प्रमाणावरील वापराच्या स्तराचे सध्याचे वर्णन, त्यातील १०१ सूचीतल्या भाषा आणि 3.8 ची समान रचना.
- [Gemini API ची किंमत](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — अधिकृत Standard, Batch, Flex आणि Priority दर; ३१ डिसेंबरपर्यंतची प्रारंभिक किंमत-मुदत, १ जानेवारीचे दर आणि दर सेकंदाला २५ ऑडिओ टोकन या रूपांतरणाचा आधार.
- [Text-to-speech निर्मिती](https://ai.google.dev/gemini-api/docs/speech-generation) — सध्याच्या स्पीच मार्गदर्शिकेत 3.8 ची भाषा-यादी, प्रतिलेखाची हाताळणी आणि स्थलांतराचे वर्तन दिले आहे. जुन्या Preview मधील भाषा-संख्या सध्याची यादी सिद्ध करत नाही.
- [Gemini मॉडेल्स](https://ai.google.dev/gemini-api/docs/models) — सध्याचा मॉडेल निर्देशांक 3.1 Flash TTS ला जुना Preview म्हणतो आणि Gemini 3.8 Flash TTS किंवा Flash-Lite TTS कडे अद्ययावत करण्याची शिफारस करतो.
- [Gemini 3.8 Flash TTS: गुणवत्ता, वेग आणि किंमत विश्लेषण](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — लाँच-दिवशीची स्वतंत्र नोंद, नेमक्या Flash मॉडेलसाठी: पुनरावलोकनावेळी १२६०.१५ Arena Elo आणि ९५ पैकी २७वा क्रमांक. क्रमवारी बदलू शकते; बहुभाषिक किंवा दीर्घ मजकुराच्या पडताळणीसाठी ती पुरेशी नाही.