AI-translated from English; not yet reviewed by a fluent editor.
# Gemini 3.8 TTS आता स्वस्त; १ जानेवारीला किंमत दुप्पट
> Google च्या स्थिर Gemini 3.8 TTS मॉडेल्समुळे तयार ऑडिओचा खर्च कमी होतो; पण १ जानेवारीला किंमती दुप्पट होतील आणि स्थलांतरात prompt तसेच WAV हाताळणी बदलेल.
By BIG CHANGE Editorial
Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

AI-generated conceptual illustration by BIG CHANGE.
[Google च्या २३ सप्टेंबरच्या लाँचमध्ये](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) Gemini API आणि AI Studio साठी दोन स्थिर स्पीच मॉडेल्स आहेत: सर्जनशील कामांसाठी Flash आणि मोठ्या प्रमाणासाठी Flash-Lite. Gemini Enterprise API चा प्रवेश नंतर येईल.
दोन्हींचा प्रति मिनिट तयार ऑडिओचा खर्च 3.1 Flash TTS Preview पेक्षा कमी आहे. Standard दर १ जानेवारी २०२७ रोजी दुप्पट होतील. स्थलांतरामुळे अॅप्लिकेशन सूचना कशा पाठवतात आणि ऑडिओ कसा साठवतात हेही बदलेल.
## मोठा बदल
- **काय बदलले:** नव्या स्तरांत प्रतिलेखातील मजकूर आणि सादरीकरणाच्या सूचना वेगळ्या ठेवता येतात; पुन्हा वापरता येणारे आवाजही समर्थित आहेत.
- **हे का महत्त्वाचे:** व्हॉइस पाइपलाइन स्थलांतरित करताना दोन खर्च लक्षात घ्यावेत: आत्ताचे अभियांत्रिकी बदल आणि नियोजित दरवाढीनंतरचे निर्मिती-शुल्क.
- **कशाकडे लक्ष द्यावे:** डबिंग, ऑडिओबुक आणि व्हॉइस एजंटसाठी विविध भाषांतील प्रत्यक्ष स्क्रिप्टवर स्पष्टता आणि वक्त्याच्या आवाजातील सातत्य तपासा. स्वस्त तयार-मिनिटामुळे वापरण्यायोग्य ऑडिओचा खर्च कमी होतो का हे निकाल ठरवतील.
## प्रति मिनिट आउटपुटचा खर्च
[Google च्या किंमत-तक्त्यात](https://ai.google.dev/gemini-api/docs/pricing?hl=en) दर सेकंदाला २५ ऑडिओ टोकन, म्हणजे मिनिटाला १,५००, दिले आहेत. गणना: आउटपुट दर × १,५०० ÷ १,०००,०००; मजकूर-इनपुट शुल्क वेगळे. खालील आकडे Standard दराने अमेरिकी डॉलरमध्ये आहेत.
| मॉडेल | सूचीत नमूद भाषा | ३१ डिसेंबर २०२६ पर्यंत प्रति दशलक्ष टोकन इनपुट / आउटपुट | सध्याचा प्रति-मिनिट आउटपुट खर्च | १ जानेवारी २०२७ पासूनचा प्रति-मिनिट आउटपुट खर्च |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | बदल जाहीर नाही |
3.8 मॉडेल्ससाठी Batch आणि Flex दर Standard च्या निम्मे; Priority दर १.८ पट आहेत. Google चा [मॉडेल निर्देशांक](https://ai.google.dev/gemini-api/docs/models) जुन्या 3.1 Preview ऐवजी नव्या स्तरांपैकी एक वापरण्याची शिफारस करतो.
## Prompt आणि ऑडिओ फाइल्समध्ये बदल आवश्यक
Flash साठीचा [स्थलांतर मार्गदर्शकानुसार](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) प्रतिलेखातील मजकूर जसाच्या तसा बोलला जातो. टिकणाऱ्या सूचना आणि वक्त्याची लेबले `speech_metadata` मध्ये द्या; “आनंदाने म्हणा:” अशी जुनी सूचना अन्यथा मोठ्याने वाचली जाऊ शकते. लहान ध्वनी-घटना जसे `<laugh>` मजकूराच्या ओघात ठेवा.
अनेक वक्त्यांच्या प्रत्येक संवादात सेटिंगमधील नावाशी जुळणारा वक्ता नमूद करावा. एकाच वक्त्याच्या प्रतिसादांत आता WAV हेडर असतात; जुन्या डीफॉल्ट raw PCM ऐवजी. कोड WAV हेडर जोडत असल्यास तो भाग काढा किंवा raw format स्पष्टपणे मागवा.
[Flash-Lite च्या कागदपत्रांत](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) दोन्ही स्तरांसाठी समान schema आणि ८,१९२ इनपुट व १६,३८४ आउटपुट टोकन मर्यादा आहेत. अॅप्लिकेशन्स एकाच एकत्रीकरणातून त्यांची तुलना करू शकतात.
## आवाजाची प्रतिकृती आणि मूल्यमापन
२,०००हून अधिक तयार आवाज, आवाजाची रचना आणि वापराचा अधिकार असलेल्या आवाजाच्या ३० सेकंदांच्या नमुन्यावरून प्रतिकृती तयार करता येते, असे Google सांगते. प्रतिकृतीसाठी जुळणारे मौखिक-संमतीचे ध्वनिमुद्रण आवश्यक आहे. तयार क्लिपमध्ये SynthID आणि प्रतिकृती केलेल्या आवाजांत C2PA ओळखपत्रे असतात, असे कंपनी म्हणते.
AI Studio मधील आवाज-प्रतिकृती सेवा इलिनॉय, टेक्सास, युरोपियन आर्थिक क्षेत्र, यूके, स्वित्झर्लंड आणि भारतात उपलब्ध नाही.
Hume Voice Design Benchmark वर Flash ला एकूण ७१.४ आणि उच्चार-मॉडेलिंगसाठी ६०.८ गुण मिळाल्याचे Google सांगते. Hume च्या Overall Quality Index मध्ये Flash आणि Lite पहिल्या व दुसऱ्या क्रमांकावर असल्याचेही ते म्हणते.
[Artificial Analysis ने](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) २३ सप्टेंबरला Flash साठी १२६०.१५ Arena Elo नोंदवले; ९५ मॉडेल्सपैकी तो २७वा होता. हे गर्दीच्या पसंतीचे मोजमाप आहे; या नोंदीतून भाषा-निहाय किंवा दीर्घ रेकॉर्डिंगची कामगिरी सिद्ध होत नाही. Lite साठीचा समतुल्य स्वतंत्र निकाल येथे वापरलेला नाही.
दुसऱ्या होस्टेड स्पीच संचाशी तुलना करण्यासाठी आमचे [Qwen Audio 3.1 API आणि किंमत विश्लेषण](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).
## Sources
- [Gemini 3.8 text-to-speech कडून नमस्कार](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — अधिकृत लाँचची व्याप्ती, मॉडेलची भूमिका, भाषा-संख्या, आवाज वैशिष्ट्ये, संमती-नियंत्रणे, प्रादेशिक उपलब्धता आणि Google ने दिलेले बेंचमार्क निकाल. गुणवत्तेचे दावे Google ला श्रेय देऊन मांडले आहेत.
- [Gemini 3.8 Flash TTS मॉडेलचे दस्तऐवजीकरण](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — सध्याची विनंती-रचना, इनपुट-आउटपुट मर्यादा, प्रतिलेखाची हाताळणी, मजकुरातील ध्वनी-घटना टॅग, अनेक वक्त्यांची पडताळणी आणि raw PCM वरून डीफॉल्ट WAV आउटपुटकडे झालेला बदल.
- [Gemini 3.8 Flash-Lite TTS मॉडेलचे दस्तऐवजीकरण](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — मोठ्या प्रमाणावरील वापराच्या स्तराचे सध्याचे वर्णन, त्यातील १०१ सूचीतल्या भाषा आणि 3.8 ची समान रचना.
- [Gemini API ची किंमत](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — अधिकृत Standard, Batch, Flex आणि Priority दर; ३१ डिसेंबरपर्यंतची प्रारंभिक किंमत-मुदत, १ जानेवारीचे दर आणि दर सेकंदाला २५ ऑडिओ टोकन या रूपांतरणाचा आधार.
- [Text-to-speech निर्मिती](https://ai.google.dev/gemini-api/docs/speech-generation) — सध्याच्या स्पीच मार्गदर्शिकेत 3.8 ची भाषा-यादी, प्रतिलेखाची हाताळणी आणि स्थलांतराचे वर्तन दिले आहे. जुन्या Preview मधील भाषा-संख्या सध्याची यादी सिद्ध करत नाही.
- [Gemini मॉडेल्स](https://ai.google.dev/gemini-api/docs/models) — सध्याचा मॉडेल निर्देशांक 3.1 Flash TTS ला जुना Preview म्हणतो आणि Gemini 3.8 Flash TTS किंवा Flash-Lite TTS कडे अद्ययावत करण्याची शिफारस करतो.
- [Gemini 3.8 Flash TTS: गुणवत्ता, वेग आणि किंमत विश्लेषण](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — लाँच-दिवशीची स्वतंत्र नोंद, नेमक्या Flash मॉडेलसाठी: पुनरावलोकनावेळी १२६०.१५ Arena Elo आणि ९५ पैकी २७वा क्रमांक. क्रमवारी बदलू शकते; बहुभाषिक किंवा दीर्घ मजकुराच्या पडताळणीसाठी ती पुरेशी नाही.
BIG CHANGE वृत्तपत्र
मोठे चित्र. तुमच्या गतीने.
AI आणि रोबोटिक्सवरील ताज्या बातम्या, पाहण्यासारखे बदल आणि वापरता येतील अशा व्यावहारिक कल्पना. दैनिक माहिती, साप्ताहिक सारांश किंवा मासिक दृष्टिकोन निवडा.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
तुमची गोपनीयता, तुमची निवड.
आवश्यक स्टोरेज साइट सुरक्षित ठेवण्यास आणि तुमच्या निवडी लक्षात ठेवण्यास मदत करते. तुमची परवानगी मिळेपर्यंत पर्यायी Google Analytics बंद राहते. फक्त आवश्यक स्टोरेज वापरून प्रत्येक लेख वाचता येतो. गोपनीयतेचा तपशील