AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS अब सस्ता है; 1 जनवरी को इसकी कीमत दोगुनी होगी

> Google के स्थिर Gemini 3.8 TTS मॉडल से तैयार ऑडियो की लागत कम होती है, लेकिन 1 जनवरी को कीमतें दोगुनी होंगी और माइग्रेशन में प्रॉम्प्ट तथा WAV फ़ाइलों का तरीका बदलता है।

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google का 23 सितंबर का लॉन्च](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) Gemini API और AI Studio में भाषण के दो स्थिर मॉडल लाता है: रचनात्मक काम के लिए Flash और बड़े पैमाने के उपयोग के लिए Flash-Lite। Gemini Enterprise API की पहुंच बाद में आएगी।

तैयार किए गए हर मिनट के हिसाब से दोनों की लागत 3.1 Flash TTS Preview से कम है। उनकी Standard दरें 1 जनवरी 2027 को दोगुनी होंगी। माइग्रेशन में यह भी बदलता है कि ऐप निर्देश कैसे भेजते हैं और ऑडियो कैसे सहेजते हैं।

## बड़ा बदलाव

- **क्या बदला:** नए टियर प्रतिलेख के पाठ को प्रस्तुति-संबंधी निर्देशों से अलग रखते हैं और दोबारा इस्तेमाल की जा सकने वाली आवाज़ों का समर्थन करते हैं।
- **यह क्यों मायने रखता है:** वॉइस पाइपलाइन को माइग्रेट करने की दो लागतें देखनी होंगी: अभी होने वाले इंजीनियरिंग बदलाव और तैयार ऑडियो पर तय तारीख से लागू होने वाला बढ़ा शुल्क।
- **क्या देखना है:** डबिंग, ऑडियोबुक और वॉइस एजेंट के लिए अलग-अलग भाषाओं में असली प्रोडक्शन स्क्रिप्ट पर स्पष्टता और वक्ताओं की आवाज़ की एकरूपता जांचें। इन्हीं नतीजों से पता चलेगा कि प्रति मिनट सस्ता तैयार ऑडियो इस्तेमाल लायक ऑडियो की कुल लागत भी घटाता है या नहीं।

## हर मिनट तैयार ऑडियो की लागत

[Google की कीमत तालिका](https://ai.google.dev/gemini-api/docs/pricing?hl=en) में प्रति सेकंड 25 ऑडियो टोकन, यानी प्रति मिनट 1,500 टोकन तय हैं। गणना है: आउटपुट दर × 1,500 / 1,000,000; इनपुट पाठ का शुल्क अलग है। नीचे के सभी आंकड़े Standard दर पर अमेरिकी डॉलर में हैं।

| मॉडल | सूचीबद्ध भाषाएं | 31 दिसंबर 2026 तक प्रति 10 लाख टोकन इनपुट / आउटपुट | अभी प्रति मिनट आउटपुट | 1 जनवरी 2027 से प्रति मिनट आउटपुट |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | बदलाव की कोई घोषणा नहीं |

3.8 मॉडल के लिए Batch और Flex की लागत Standard दर की आधी है; Priority की लागत Standard से 1.8 गुना है। Google का [मॉडल सूचकांक](https://ai.google.dev/gemini-api/docs/models) पुराने 3.1 Preview की जगह दोनों नए टियर में से किसी एक को अपनाने की सलाह देता है।

## प्रॉम्प्ट और ऑडियो फ़ाइलों में बदलाव जरूरी

Gemini [Flash माइग्रेशन मार्गदर्शिका](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) कहती है कि प्रतिलेख का पाठ ज्यों का त्यों बोला जाता है। लंबे निर्देश और वक्ता-लेबल `speech_metadata`; “खुशी से बोलें:” जैसा पुराना निर्देश नहीं हटाया तो उसे भी आवाज़ में पढ़ा जा सकता है। “हँसने” जैसी छोटी ध्वनि-क्रियाएं `<laugh>` पंक्ति के भीतर ही रखी जाती हैं।

कई वक्ताओं वाले हर संवाद में ऐसा वक्ता बताना जरूरी है जिसका नाम कॉन्फ़िगरेशन से मेल खाए। अब एकल-वक्ता जवाबों में WAV हेडर होता है; पहले डिफ़ॉल्ट रूप में raw PCM मिलता था। WAV हेडर जोड़ने वाला कोड हटाएं या साफ तौर पर raw फ़ॉर्मैट मांगें।

[Flash-Lite का दस्तावेज़](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) पुष्टि करता है कि दोनों टियर एक ही schema साझा करते हैं और इनपुट की सीमा 8,192 तथा आउटपुट की 16,384 टोकन है। इसलिए ऐप एक ही integration के जरिए दोनों की तुलना कर सकते हैं।

## आवाज़ की नकल और मूल्यांकन

Google 2,000 से अधिक तैयार आवाज़ों, आवाज़ बनाने की सुविधा और ऐसी आवाज़ के 30 सेकंड के नमूने से नकल की सुविधा बताता है जिसे इस्तेमाल करने का उपयोगकर्ता के पास अधिकार हो। नकल के लिए उससे मेल खाती मौखिक सहमति की रिकॉर्डिंग जरूरी है। Google का कहना है कि तैयार क्लिप में SynthID और नकल की गई आवाज़ों में C2PA प्रमाण-पत्र होते हैं।

AI Studio में आवाज़ की नकल की सुविधा इलिनॉय, टेक्सास, यूरोपीय आर्थिक क्षेत्र, ब्रिटेन, स्विट्ज़रलैंड और भारत में उपलब्ध नहीं है।

Google के अनुसार Hume के Voice Design Benchmark में Flash का कुल स्कोर 71.4 और उच्चारण मॉडलिंग का स्कोर 60.8 है। उसके Overall Quality Index में Flash और Lite क्रमशः पहले और दूसरे स्थान पर हैं।

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) ने 23 सितंबर को Flash को अलग से 1260.15 Arena Elo दिया था, जो 95 मॉडलों में 27वां स्थान था। यह भीड़ की पसंद मापता है; समीक्षा की गई सूची अलग-अलग भाषाओं या लंबी रिकॉर्डिंग में प्रदर्शन स्थापित नहीं करती। यहां Lite का कोई तुलनीय स्वतंत्र नतीजा इस्तेमाल नहीं किया गया।

दूसरी होस्टेड भाषण सेवा से तुलना के लिए हमारी [Qwen Audio 3.1 API और कीमतों का विश्लेषण](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing) देखें।

## Sources

- [Gemini 3.8 टेक्स्ट-टू-स्पीच की शुरुआत](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — लॉन्च का आधिकारिक दायरा, मॉडल की भूमिकाएं, भाषाओं की संख्या, आवाज़ की सुविधाएं, सहमति नियंत्रण, क्षेत्रीय उपलब्धता और Google द्वारा बताए गए बेंचमार्क नतीजे। गुणवत्ता संबंधी दावे Google के नाम से दिए गए हैं।
- [Gemini 3.8 Flash TTS मॉडल का दस्तावेज़](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — मौजूदा अनुरोध schema, इनपुट और आउटपुट सीमाएं, प्रतिलेख का व्यवहार, inline event tags, कई वक्ताओं के सत्यापन तथा raw PCM से डिफ़ॉल्ट WAV आउटपुट में बदलाव का विवरण।
- [Gemini 3.8 Flash-Lite TTS मॉडल का दस्तावेज़](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — अधिक मात्रा के उपयोग वाले टियर का मौजूदा विवरण, इसकी 101 सूचीबद्ध भाषाएं और 3.8 के साझा interface का उल्लेख।
- [Gemini API की कीमतें](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Standard, Batch, Flex और Priority की आधिकारिक दरें; 31 दिसंबर की आरंभिक कीमत की समय-सीमा; 1 जनवरी से लागू दरें; और प्रति सेकंड 25 ऑडियो टोकन का रूपांतरण।
- [टेक्स्ट-टू-स्पीच बनाना](https://ai.google.dev/gemini-api/docs/speech-generation) — मौजूदा भाषण मार्गदर्शिका में 3.8 की भाषा तालिका, प्रतिलेख का व्यवहार और माइग्रेशन की प्रक्रिया दर्ज है। इसकी वर्तमान भाषा तालिका पुराने Preview में भाषाओं की कुल संख्या स्थापित नहीं करती।
- [Gemini मॉडल](https://ai.google.dev/gemini-api/docs/models) — मौजूदा मॉडल सूचकांक 3.1 Flash TTS को पुराना Preview बताता है और Gemini 3.8 Flash TTS या Flash-Lite TTS में अपडेट करने की सलाह देता है।
- [Gemini 3.8 Flash TTS: गुणवत्ता, गति और कीमत का विश्लेषण](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — लॉन्च के दिन की स्वतंत्र सूची में इसी Flash मॉडल को 1260.15 Arena Elo और समीक्षा के समय 95 में से 27वां स्थान दिया गया था। रैंकिंग बदल सकती है और यह कई भाषाओं या लंबे ऑडियो की पुष्टि नहीं है।
