يقدم إطلاق Google في 23 سبتمبر نموذجين مستقرين للصوت ضمن Gemini API وAI Studio: Flash للأعمال الإبداعية وFlash-Lite للاستخدام واسع النطاق. وسيأتي الوصول عبر Gemini Enterprise API لاحقًا.

تكلفة كل منهما أقل من نموذج 3.1 Flash TTS Preview لكل دقيقة صوت مُنشأ. لكن أسعار Standard ستتضاعف في 1 يناير 2027. كما يغيّر الترحيل طريقة إرسال التطبيقات للتعليمات وحفظ الصوت.

التغيير الأبرز

  • ما الذي تغيّر: تفصل المستويات الجديدة بين نص التفريغ الصوتي وتوجيهات الأداء، وتدعم أصواتًا قابلة لإعادة الاستخدام.
  • لماذا يهم: على مطوري أنظمة الصوت أخذ تكلفتين للترحيل في الحسبان: تغييرات الهندسة المطلوبة الآن والزيادة المقررة في رسوم التوليد.
  • ما الذي ينبغي مراقبته: في الدبلجة والكتب الصوتية ووكلاء الصوت، قارن وضوح الكلام واتساق المتحدثين باستخدام نصوص إنتاج فعلية بلغات مختلفة. وتحدد هذه النتائج ما إذا كان انخفاض سعر دقيقة الصوت المُنشأ يخفض أيضًا تكلفة الصوت القابل للاستخدام.

تكلفة الإخراج لكل دقيقة

يحدد جدول أسعار Google 25 رمزًا صوتيًا في الثانية، أي 1,500 في الدقيقة. والحساب هو سعر الإخراج × 1,500 / 1,000,000؛ وتُضاف رسوم إدخال النص. جميع الأرقام أدناه بالدولار الأمريكي وفق أسعار Standard.

الطراز

اللغات المدرجة

سعر الإدخال / الإخراج لكل مليون رمز حتى 31 ديسمبر 2026

تكلفة الإخراج/الدقيقة حاليًا

تكلفة الإخراج/الدقيقة ابتداءً من 1 يناير 2027

Gemini 3.8 Flash TTS

130

$0.50 / $9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

101

$0.50 / $6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0.03

لم يُعلن عن تغيير

في نموذجي 3.8، تبلغ تكلفة Batch وFlex نصف سعر Standard، بينما تكلف Priority ما يعادل 1.8 مرة من Standard. ويقترح فهرس النماذج لدى Google استبدال إصدار 3.1 Preview القديم بأي من المستويين الجديدين.

الطلبات والملفات الصوتية تتطلب تغييرات

يقول دليل الترحيل لنموذج Flash إن نص التفريغ يُنطق حرفيًا. ضع التوجيهات المستمرة وتسميات المتحدثين ضمن speech_metadata; وإلا فقد تُقرأ تعليمات قديمة مثل «قل بمرح:» بصوت مسموع. أما المؤثرات الموجزة مثل <laugh> فتظل داخل النص.

يجب أن يحدد كل دور متعدد المتحدثين اسم متحدث يطابق الإعداد. وتحتوي الاستجابات أحادية الطلب الآن على ترويسات WAV بدلًا من PCM الخام الذي كان الافتراضي سابقًا. احذف الشيفرة التي تضيف ترويسة WAV، أو اطلب صراحةً تنسيقًا خامًا.

تؤكد وثائق Flash-Lite استخدام المخطط نفسه وحدود 8,192 رمزًا للإدخال و16,384 رمزًا للإخراج في كلا المستويين. وبذلك تستطيع التطبيقات مقارنتهما عبر التكامل نفسه.

استنساخ الصوت وتقييمه

تصف Google أكثر من 2,000 صوت جاهز، وتصميم الأصوات واستنساخها انطلاقًا من عينة مدتها 30 ثانية لصوت يملك المستخدم حق استعماله. ويتطلب الاستنساخ تسجيلًا مطابقًا للموافقة الشفهية. وتقول Google إن المقاطع المُنشأة تحمل SynthID، وإن الأصوات المستنسخة تتضمن بيانات اعتماد C2PA.

لا تتاح ميزة استنساخ الصوت في AI Studio في إلينوي وتكساس والمنطقة الاقتصادية الأوروبية والمملكة المتحدة وسويسرا والهند.

تذكر Google أن Flash حقق 71.4 إجمالًا و60.8 في نمذجة اللهجات ضمن معيار Voice Design Benchmark من Hume. وتضع Flash وLite في المركزين الأول والثاني على مؤشر Overall Quality Index من Hume.

وتدرج Artificial Analysis Flash بصورة منفصلة بتقييم Arena Elo قدره 1260.15، في المرتبة 27 من أصل 95 نموذجًا، بتاريخ 23 سبتمبر. ويقيس ذلك تفضيل الجمهور؛ ولا يثبت التصنيف المعروض الأداء بحسب اللغة أو في التسجيلات الطويلة. ولم نستخدم نتيجة مستقلة مكافئة لـLite هنا.

للمقارنة مع مجموعة أخرى من خدمات الصوت المستضافة، اطلع على تحليلنا لـ Qwen Audio 3.1 API والأسعار.