أعلن فريق Qwen في Alibaba عن خمسة نماذج Qwen Audio 3.1 تشمل التفريغ الصوتي وتوليد الكلام والتفاعل الصوتي المباشر. وتتوفر نقاط API مستضافة وموثقة لكل من ASR وTTS-Next وRealtime Plus. ولدى TTS Flash معرّف نموذج وسعر منشوران، لكن وثائق التكامل أقل اكتمالًا؛ أما ASR-Next فلا يرد له معرّف نموذج أو منطقة أو سعر في وثائق المطورين العامة التي راجعتها BIG CHANGE.

وأفاد The Decoder بخفض Qwen المعلن بنحو 70% لتحويل النص إلى كلام، و85% للصوت الآني، وما يصل إلى 95% للتعرف على الكلام. وتهم وحدات الفوترة عند التحقق من هذه الأرقام.

التغيير الأبرز

  • ما الذي تغيّر: بات Qwen يغطي أجزاء أكثر من منتج صوتي ضمن عائلة مستضافة واحدة، من التفريغ الصوتي والكلام المُنشأ إلى إنتاج المشاهد الصوتية والمحادثة المباشرة. لكن مكونات العائلة الخمسة لا تتمتع حتى الآن بالقدر نفسه من اكتمال إتاحة المطورين لها.
  • لماذا يهم: بالنسبة إلى المطورين الذين يضعون ميزانية لخدمات التفريغ الصوتي أو الصوت، لم تعد دقيقة الصوت وحدها كافية لتسعير كل نقطة API. ففوترة ASR القائمة على الرموز تشمل الصوت الوارد والنص الناتج معًا؛ وللمحادثة المباشرة أربعة مسارات فوترة منفصلة.
  • ما الذي ينبغي مراقبته: إلى جانب إتاحة ASR-Next، راقب ما إذا كانت اختبارات مستقلة للغات وزمن الاستجابة تؤكد وجود توفير عملي. وإذا أكدته، يبقى السؤال الأوسع ما إذا كان مزودو وكلاء الصوت والتفريغ والدبلجة سيمررون هذا التوفير إلى العملاء، وما إذا كانت واجهات الكلام المنافسة ستتبع ذلك.

خريطة النماذج الخمسة

النموذج المُعلن

المهمة المقصودة

الإتاحة الموثقة في 23 سبتمبر

السعر والحد العملي

Qwen Audio 3.1 ASR

التفريغ المتدفق ومن الملفات والمقاطع القصيرة؛ مع فصل اختياري للمتحدثين في نقاط API الخاصة بالملفات والمقاطع القصيرة

واجهات API مستضافة عبر WebSocket أو HTTP في سنغافورة وبكين. ويورد الدليل الدولي 30 لغة و10 تنويعات من اللهجات الصينية.

تتراوح أسعار سنغافورة من $0.15 لكل مليون رمز صوتي للإدخال + $0.47 لكل مليون رمز نصي للإخراج للملفات والمقاطع القصيرة إلى $0.93 + $0.70 للبث/الرسالة. ويتيح تفريغ الملفات حتى 12 ساعة/2GB، والمقاطع القصيرة حتى 5 دقائق/2GB.

Qwen Audio 3.1 ASR-Next

نَسب المتحدث والطوابع الزمنية، إلى جانب التعرف على المشاعر والأحداث المحيطة والأصوات الآلية

أعلنه Qwen؛ ولم نعثر على معرّف نموذج API أو منطقة أو سعر أو حد استخدام منشور في وثائق Model Studio وQwenCloud الحالية

غير موثق علنًا

Qwen Audio 3.1 TTS

كلام متعدد اللغات ونقل الصوت بين اللغات والتحكم في طريقة الإلقاء عبر المطالبات

qwen-audio-3.1-tts-flash ورد في إشعار أسعار Alibaba. لكن واجهة API لاستنساخ الصوت التي راجعناها لا تزال تسمي TTS Flash 3.0.

سنغافورة: $0.23 لكل مليون رمز نصي للإدخال + $1.87 لكل مليون رمز صوتي للإخراج. لم تُحدد حدود الاستخدام العامة الحالية في مواد 3.1 التي راجعناها.

Qwen Audio 3.1 TTS-Next

توليد مشترك للكلام والمؤثرات والصوت الخلفي

واجهة API مستضافة عبر HTTPS وغير متدفقة في بكين، موثقة للصينية والإنجليزية

$0.848 لكل مليون رمز إدخال + $1.696 لكل مليون رمز إخراج. حتى 3,000 حرف للإدخال؛ وأربع دقائق لمخرجات البودكاست ودقيقتان فيما عدا ذلك.

Qwen Audio 3.1 Realtime Plus

محادثة صوتية كاملة الازدواج مع المقاطعة واستدعاء الأدوات

واجهة API مستضافة عبر WebSocket في سنغافورة وبكين. ويذكر الدليل 11 لغة.

سنغافورة: $0.80 لكل مليون رمز نصي للإدخال، و$6.40 لكل مليون رمز صوتي للإدخال، و$6.40 لكل مليون رمز نصي للإخراج، و$24 لكل مليون رمز صوتي للإخراج. ويحتفظ بما يصل إلى 50 دورًا صوتيًا أو 300 ثانية من سجل الصوت.

هذه منتجات عبر API مستضافة. ولم تعثر BIG CHANGE على أوزان قابلة للتنزيل لنماذج 3.1 أو ترخيص لأوزان النماذج. ويغطي ترخيص MIT في مستودع QwenAudio موقع المشروع، ولذلك لا ينبغي اعتباره ترخيصًا للنماذج.

ويعتمد عدد اللغات أيضًا على الوثيقة. يقول منشور الإطلاق الموثق من Qwen إن ASR يدعم 30 لغة و16 لهجة صينية؛ أما دليل API الدولي فيورد 30 لغة و10 تنويعات للهجات. وينبغي للمطورين اعتماد القائمة المرتبطة بنقطة API التي يمكنهم استدعاؤها فعليًا.

ادعاء الخفض 95% لا يطابق جدول الأسعار العام

دخل إشعار تغيير الأسعار لدى Alibaba حيز التنفيذ في 22 سبتمبر. وتشمل المقارنة الدقيقة فيه qwen-audio-3.0-realtime-flash، لا نموذج 3.1 Realtime Plus الجديد. وتحسب التخفيضات في سنغافورة وفق المعادلة (السعر القديم − السعر الجديد) / السعر القديم:

بث Realtime Flash

قبل (دولار أمريكي)

بعد (دولار أمريكي)

نسبة التخفيض

إدخال نصي، لكل مليون رمز

$0.45

$0.23

48.89%

إدخال صوتي، لكل مليون رمز

$4.50

$0.93

79.33%

إخراج نصي، لكل مليون رمز

$4.50

$0.70

84.44%

الإخراج (نص + صوت)، لكل مليون رمز

$15.00

$1.87

87.53%

وينقل الإشعار نفسه نموذج 3.1 TTS Flash من سعر قدره $0.15 لكل 10,000 حرف إلى أسعار منفصلة لرموز الإدخال والإخراج. وتعرض صفحة الأسعار الحالية كذلك ASR 3.1 وفق رموز الإدخال والإخراج، بينما يحاسب ASR 3.0 على ثانية الصوت مع إخراج مجاني. وتعتمد النسبة عبر أي من هذين الزوجين على النص ومدة الصوت وتجزئته إلى رموز. لذا لا تعيد الجداول العامة التي راجعناها إنتاج خفض دقيق قدره 95% لـASR.

الأدلة المستقلة لا تزال تخص Qwen 3.0

لم يتوفر اختبار مستقل للنماذج الخمسة 3.1 ضمن المصادر التي راجعناها يوم الإطلاق. وتورد صفحة مشروع Qwen الخاصة بـ ASR نتائج معايير، لكنها تقول إنها لم تُعَد بصورة مستقلة.

وتضع Artificial Analysis نموذج Qwen Audio 3.0 TTS Plus في المركز الثاني ضمن ساحة أصوات المزودين (جميع اللهجات والفئات)، بتقييم Elo قدره 1,259 وفاصل ثقة 95% يبلغ ±17، استنادًا إلى 1,447 عينة من المقارنات العمياء. وفي ساحة وكلاء الكلام المنفصلة، سجل Qwen Audio 3.0 Realtime Plus تقييم تفضيل Elo قدره 699 وزمنًا قدره 1.54 ثانية حتى أول صوت. ويقارن المشاركون نماذج مخفية في محادثات مباشرة وفق سيناريوهات محددة لهم.