Google च्या २३ सप्टेंबरच्या लाँचमध्ये Gemini API आणि AI Studio साठी दोन स्थिर स्पीच मॉडेल्स आहेत: सर्जनशील कामांसाठी Flash आणि मोठ्या प्रमाणासाठी Flash-Lite. Gemini Enterprise API चा प्रवेश नंतर येईल.
दोन्हींचा प्रति मिनिट तयार ऑडिओचा खर्च 3.1 Flash TTS Preview पेक्षा कमी आहे. Standard दर १ जानेवारी २०२७ रोजी दुप्पट होतील. स्थलांतरामुळे अॅप्लिकेशन सूचना कशा पाठवतात आणि ऑडिओ कसा साठवतात हेही बदलेल.
मोठा बदल
- काय बदलले: नव्या स्तरांत प्रतिलेखातील मजकूर आणि सादरीकरणाच्या सूचना वेगळ्या ठेवता येतात; पुन्हा वापरता येणारे आवाजही समर्थित आहेत.
- हे का महत्त्वाचे: व्हॉइस पाइपलाइन स्थलांतरित करताना दोन खर्च लक्षात घ्यावेत: आत्ताचे अभियांत्रिकी बदल आणि नियोजित दरवाढीनंतरचे निर्मिती-शुल्क.
- कशाकडे लक्ष द्यावे: डबिंग, ऑडिओबुक आणि व्हॉइस एजंटसाठी विविध भाषांतील प्रत्यक्ष स्क्रिप्टवर स्पष्टता आणि वक्त्याच्या आवाजातील सातत्य तपासा. स्वस्त तयार-मिनिटामुळे वापरण्यायोग्य ऑडिओचा खर्च कमी होतो का हे निकाल ठरवतील.
प्रति मिनिट आउटपुटचा खर्च
Google च्या किंमत-तक्त्यात दर सेकंदाला २५ ऑडिओ टोकन, म्हणजे मिनिटाला १,५००, दिले आहेत. गणना: आउटपुट दर × १,५०० ÷ १,०००,०००; मजकूर-इनपुट शुल्क वेगळे. खालील आकडे Standard दराने अमेरिकी डॉलरमध्ये आहेत.
मॉडेल | सूचीत नमूद भाषा | ३१ डिसेंबर २०२६ पर्यंत प्रति दशलक्ष टोकन इनपुट / आउटपुट | सध्याचा प्रति-मिनिट आउटपुट खर्च | १ जानेवारी २०२७ पासूनचा प्रति-मिनिट आउटपुट खर्च |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | बदल जाहीर नाही |
3.8 मॉडेल्ससाठी Batch आणि Flex दर Standard च्या निम्मे; Priority दर १.८ पट आहेत. Google चा मॉडेल निर्देशांक जुन्या 3.1 Preview ऐवजी नव्या स्तरांपैकी एक वापरण्याची शिफारस करतो.
Prompt आणि ऑडिओ फाइल्समध्ये बदल आवश्यक
Flash साठीचा स्थलांतर मार्गदर्शकानुसार प्रतिलेखातील मजकूर जसाच्या तसा बोलला जातो. टिकणाऱ्या सूचना आणि वक्त्याची लेबले speech_metadata मध्ये द्या; “आनंदाने म्हणा:” अशी जुनी सूचना अन्यथा मोठ्याने वाचली जाऊ शकते. लहान ध्वनी-घटना जसे <laugh> मजकूराच्या ओघात ठेवा.
अनेक वक्त्यांच्या प्रत्येक संवादात सेटिंगमधील नावाशी जुळणारा वक्ता नमूद करावा. एकाच वक्त्याच्या प्रतिसादांत आता WAV हेडर असतात; जुन्या डीफॉल्ट raw PCM ऐवजी. कोड WAV हेडर जोडत असल्यास तो भाग काढा किंवा raw format स्पष्टपणे मागवा.
Flash-Lite च्या कागदपत्रांत दोन्ही स्तरांसाठी समान schema आणि ८,१९२ इनपुट व १६,३८४ आउटपुट टोकन मर्यादा आहेत. अॅप्लिकेशन्स एकाच एकत्रीकरणातून त्यांची तुलना करू शकतात.
आवाजाची प्रतिकृती आणि मूल्यमापन
२,०००हून अधिक तयार आवाज, आवाजाची रचना आणि वापराचा अधिकार असलेल्या आवाजाच्या ३० सेकंदांच्या नमुन्यावरून प्रतिकृती तयार करता येते, असे Google सांगते. प्रतिकृतीसाठी जुळणारे मौखिक-संमतीचे ध्वनिमुद्रण आवश्यक आहे. तयार क्लिपमध्ये SynthID आणि प्रतिकृती केलेल्या आवाजांत C2PA ओळखपत्रे असतात, असे कंपनी म्हणते.
AI Studio मधील आवाज-प्रतिकृती सेवा इलिनॉय, टेक्सास, युरोपियन आर्थिक क्षेत्र, यूके, स्वित्झर्लंड आणि भारतात उपलब्ध नाही.
Hume Voice Design Benchmark वर Flash ला एकूण ७१.४ आणि उच्चार-मॉडेलिंगसाठी ६०.८ गुण मिळाल्याचे Google सांगते. Hume च्या Overall Quality Index मध्ये Flash आणि Lite पहिल्या व दुसऱ्या क्रमांकावर असल्याचेही ते म्हणते.
Artificial Analysis ने २३ सप्टेंबरला Flash साठी १२६०.१५ Arena Elo नोंदवले; ९५ मॉडेल्सपैकी तो २७वा होता. हे गर्दीच्या पसंतीचे मोजमाप आहे; या नोंदीतून भाषा-निहाय किंवा दीर्घ रेकॉर्डिंगची कामगिरी सिद्ध होत नाही. Lite साठीचा समतुल्य स्वतंत्र निकाल येथे वापरलेला नाही.
दुसऱ्या होस्टेड स्पीच संचाशी तुलना करण्यासाठी आमचे Qwen Audio 3.1 API आणि किंमत विश्लेषण.



