Google का 23 सितंबर का लॉन्च Gemini API और AI Studio में भाषण के दो स्थिर मॉडल लाता है: रचनात्मक काम के लिए Flash और बड़े पैमाने के उपयोग के लिए Flash-Lite। Gemini Enterprise API की पहुंच बाद में आएगी।
तैयार किए गए हर मिनट के हिसाब से दोनों की लागत 3.1 Flash TTS Preview से कम है। उनकी Standard दरें 1 जनवरी 2027 को दोगुनी होंगी। माइग्रेशन में यह भी बदलता है कि ऐप निर्देश कैसे भेजते हैं और ऑडियो कैसे सहेजते हैं।
बड़ा बदलाव
- क्या बदला: नए टियर प्रतिलेख के पाठ को प्रस्तुति-संबंधी निर्देशों से अलग रखते हैं और दोबारा इस्तेमाल की जा सकने वाली आवाज़ों का समर्थन करते हैं।
- यह क्यों मायने रखता है: वॉइस पाइपलाइन को माइग्रेट करने की दो लागतें देखनी होंगी: अभी होने वाले इंजीनियरिंग बदलाव और तैयार ऑडियो पर तय तारीख से लागू होने वाला बढ़ा शुल्क।
- क्या देखना है: डबिंग, ऑडियोबुक और वॉइस एजेंट के लिए अलग-अलग भाषाओं में असली प्रोडक्शन स्क्रिप्ट पर स्पष्टता और वक्ताओं की आवाज़ की एकरूपता जांचें। इन्हीं नतीजों से पता चलेगा कि प्रति मिनट सस्ता तैयार ऑडियो इस्तेमाल लायक ऑडियो की कुल लागत भी घटाता है या नहीं।
हर मिनट तैयार ऑडियो की लागत
Google की कीमत तालिका में प्रति सेकंड 25 ऑडियो टोकन, यानी प्रति मिनट 1,500 टोकन तय हैं। गणना है: आउटपुट दर × 1,500 / 1,000,000; इनपुट पाठ का शुल्क अलग है। नीचे के सभी आंकड़े Standard दर पर अमेरिकी डॉलर में हैं।
मॉडल | सूचीबद्ध भाषाएं | 31 दिसंबर 2026 तक प्रति 10 लाख टोकन इनपुट / आउटपुट | अभी प्रति मिनट आउटपुट | 1 जनवरी 2027 से प्रति मिनट आउटपुट |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | बदलाव की कोई घोषणा नहीं |
3.8 मॉडल के लिए Batch और Flex की लागत Standard दर की आधी है; Priority की लागत Standard से 1.8 गुना है। Google का मॉडल सूचकांक पुराने 3.1 Preview की जगह दोनों नए टियर में से किसी एक को अपनाने की सलाह देता है।
प्रॉम्प्ट और ऑडियो फ़ाइलों में बदलाव जरूरी
Gemini Flash माइग्रेशन मार्गदर्शिका कहती है कि प्रतिलेख का पाठ ज्यों का त्यों बोला जाता है। लंबे निर्देश और वक्ता-लेबल speech_metadata; “खुशी से बोलें:” जैसा पुराना निर्देश नहीं हटाया तो उसे भी आवाज़ में पढ़ा जा सकता है। “हँसने” जैसी छोटी ध्वनि-क्रियाएं <laugh> पंक्ति के भीतर ही रखी जाती हैं।
कई वक्ताओं वाले हर संवाद में ऐसा वक्ता बताना जरूरी है जिसका नाम कॉन्फ़िगरेशन से मेल खाए। अब एकल-वक्ता जवाबों में WAV हेडर होता है; पहले डिफ़ॉल्ट रूप में raw PCM मिलता था। WAV हेडर जोड़ने वाला कोड हटाएं या साफ तौर पर raw फ़ॉर्मैट मांगें।
Flash-Lite का दस्तावेज़ पुष्टि करता है कि दोनों टियर एक ही schema साझा करते हैं और इनपुट की सीमा 8,192 तथा आउटपुट की 16,384 टोकन है। इसलिए ऐप एक ही integration के जरिए दोनों की तुलना कर सकते हैं।
आवाज़ की नकल और मूल्यांकन
Google 2,000 से अधिक तैयार आवाज़ों, आवाज़ बनाने की सुविधा और ऐसी आवाज़ के 30 सेकंड के नमूने से नकल की सुविधा बताता है जिसे इस्तेमाल करने का उपयोगकर्ता के पास अधिकार हो। नकल के लिए उससे मेल खाती मौखिक सहमति की रिकॉर्डिंग जरूरी है। Google का कहना है कि तैयार क्लिप में SynthID और नकल की गई आवाज़ों में C2PA प्रमाण-पत्र होते हैं।
AI Studio में आवाज़ की नकल की सुविधा इलिनॉय, टेक्सास, यूरोपीय आर्थिक क्षेत्र, ब्रिटेन, स्विट्ज़रलैंड और भारत में उपलब्ध नहीं है।
Google के अनुसार Hume के Voice Design Benchmark में Flash का कुल स्कोर 71.4 और उच्चारण मॉडलिंग का स्कोर 60.8 है। उसके Overall Quality Index में Flash और Lite क्रमशः पहले और दूसरे स्थान पर हैं।
Artificial Analysis ने 23 सितंबर को Flash को अलग से 1260.15 Arena Elo दिया था, जो 95 मॉडलों में 27वां स्थान था। यह भीड़ की पसंद मापता है; समीक्षा की गई सूची अलग-अलग भाषाओं या लंबी रिकॉर्डिंग में प्रदर्शन स्थापित नहीं करती। यहां Lite का कोई तुलनीय स्वतंत्र नतीजा इस्तेमाल नहीं किया गया।
दूसरी होस्टेड भाषण सेवा से तुलना के लिए हमारी Qwen Audio 3.1 API और कीमतों का विश्लेषण देखें।



