Google کے 23 ستمبر کے اجرا سے Gemini API اور AI Studio میں آواز بنانے کے دو مستحکم ماڈل آئے: تخلیقی کام کے لیے Flash اور زیادہ حجم کے لیے Flash-Lite۔ Gemini Enterprise API تک رسائی بعد میں آئے گی۔
دونوں کی فی تیار شدہ منٹ لاگت 3.1 Flash TTS Preview سے کم ہے۔ ان کی Standard قیمتیں یکم جنوری 2027 کو دگنی ہوجائیں گی۔ منتقلی میں یہ بھی بدلتا ہے کہ ایپلی کیشنز ہدایات کیسے بھیجتی اور آڈیو کیسے محفوظ کرتی ہیں۔
بڑی تبدیلی
- کیا بدلا: نئے درجے نقل کے متن کو ادائیگی کی ہدایات سے الگ کرتے ہیں اور دوبارہ استعمال کی جا سکنے والی آوازوں کی معاونت دیتے ہیں۔
- یہ کیوں اہم ہے: آواز بنانے والی پائپ لائن منتقل کرتے وقت دو اخراجات پر غور کرنا ہوگا: ابھی انجینئرنگ میں تبدیلیاں، اور تیار کردہ آواز کے نرخ میں طے شدہ اضافہ۔
- کس بات پر نظر رکھیں: ڈبنگ، آڈیو بکس اور صوتی ایجنٹوں کے لیے مختلف زبانوں کے حقیقی پیداواری اسکرپٹس پر فہم پذیری اور اسپیکر کی یکسانیت کا موازنہ کریں۔ ان نتائج سے پتا چلے گا کہ فی تیار شدہ منٹ کم قیمت سے قابلِ استعمال آڈیو کی لاگت بھی گھٹتی ہے یا نہیں۔
فی منٹ آؤٹ پٹ کی لاگت
Google کی قیمتوں کی جدول کے مطابق فی سیکنڈ 25 آڈیو ٹوکن، یعنی فی منٹ 1,500 ٹوکن ہیں۔ حساب کا طریقہ آؤٹ پٹ کی شرح × 1,500 / 1,000,000 ہے؛ متن کے اِن پٹ کے اخراجات الگ ہیں۔ ذیل کے تمام اعداد Standard نرخوں پر امریکی ڈالر میں ہیں۔
ماڈل | درج شدہ زبانیں | 31 دسمبر 2026 تک فی 10 لاکھ ٹوکن اِن پٹ / آؤٹ پٹ | اب فی منٹ آؤٹ پٹ | یکم جنوری 2027 سے فی منٹ آؤٹ پٹ |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | قیمت میں تبدیلی کا اعلان نہیں |
3.8 ماڈلز کے لیے Batch اور Flex کی قیمت Standard کا نصف، جبکہ Priority کی قیمت Standard سے 1.8 گنا ہے۔ Google کا ماڈل انڈیکس تجویز کرتا ہے کہ پرانے 3.1 Preview کی جگہ کسی نئے درجے کو استعمال کیا جائے۔
پرامپٹ اور آڈیو فائلوں میں تبدیلیاں درکار ہیں
Gemini 3.8 Flash کی منتقلی کی رہنمائی کہتی ہے کہ نقل کا متن بعینہٖ بولا جاتا ہے۔ جاری رہنے والی ہدایات اور اسپیکر کے لیبل speech_metadata میں رکھیں؛ پرانی ہدایت مثلاً “خوش دلی سے کہیں:” ورنہ بلند آواز سے پڑھی جا سکتی ہے۔ مختصر صوتی واقعات، مثلاً <laugh> بھی متن کے اندر رہتے ہیں۔
متعدد اسپیکروں والی ہر باری میں ایسا اسپیکر نام دینا ضروری ہے جو ترتیب سے میل کھاتا ہو۔ اب ایک اسپیکر والے جوابات میں WAV ہیڈر شامل ہوتے ہیں، جس سے پرانا طے شدہ خام PCM طریقہ بدل گیا ہے۔ WAV ہیڈر خود شامل کرنے والا کوڈ ہٹائیں یا واضح طور پر خام آڈیو فارمیٹ مانگیں۔
Flash-Lite کی دستاویزات دونوں درجوں کے لیے مشترک اسکیما اور 8,192 اِن پٹ ٹوکن اور 16,384 آؤٹ پٹ ٹوکن کی حدوں کی تصدیق کرتی ہیں۔ لہٰذا ایپلی کیشنز انہیں ایک ہی انضمامی طریقے سے موازنہ کرسکتی ہیں۔
آواز کی نقل اور معیار کا جائزہ
Google کے مطابق 2,000 سے زیادہ تیار آوازیں، آواز تیار کرنے کا ٹول، اور ایسی آواز کے 30 سیکنڈ نمونے سے نقل کی سہولت دستیاب ہے جسے استعمال کرنے کا حق صارف کے پاس ہو۔ نقل کے لیے زبانی رضامندی کی ایسی ریکارڈنگ درکار ہے جو اس آواز سے میل کھاتی ہو۔ Google کا کہنا ہے کہ تیار کردہ کلپس میں SynthID اور نقل شدہ آوازوں میں C2PA اسناد ہوتی ہیں۔
AI Studio میں آواز کی نقل Illinois، Texas، یورپی اکنامک ایریا، برطانیہ، سوئٹزرلینڈ اور بھارت میں دستیاب نہیں۔
Google کے مطابق Hume کے Voice Design Benchmark پر Flash کے مجموعی 71.4 اور لہجے کی ماڈلنگ میں 60.8 اسکور ہیں۔ کمپنی Flash اور Flash-Lite کو Hume کے Overall Quality Index میں بالترتیب پہلے اور دوسرے نمبر پر رکھتی ہے۔
Artificial Analysis نے الگ سے 23 ستمبر کو Flash کو 1260.15 Arena Elo پر درج کیا، جو 95 ماڈلز میں 27واں نمبر تھا۔ یہ ہجوم کی ترجیح ناپتا ہے؛ زیرِجائزہ اندراج زبانوں کے لحاظ سے یا طویل ریکارڈنگز میں کارکردگی ثابت نہیں کرتا۔ Flash-Lite کے مساوی آزادانہ نتیجے کو یہاں استعمال نہیں کیا گیا۔
دوسری میزبانی شدہ صوتی مصنوعات کے ساتھ موازنے کے لیے ہمارا Qwen Audio 3.1 API اور قیمتوں کا تجزیہ دیکھیں۔



