AI-translated from English; not yet reviewed by a fluent editor.

# يوسّع Qwen Audio 3.1 مجموعة أدوات الصوت. لكن خفض السعر 95% يحتاج إلى سياق

> يضيف Qwen Audio 3.1 إنشاء الأصوات وفهمها. لكن توثيق واجهة API متفاوت، كما أن تغيير وحدات الفوترة يعقد ادعاء التوفير في التعرف على الكلام.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

أعلن فريق Qwen في Alibaba عن خمسة نماذج Qwen Audio 3.1 تشمل التفريغ الصوتي وتوليد الكلام والتفاعل الصوتي المباشر. وتتوفر نقاط API مستضافة وموثقة لكل من ASR وTTS-Next وRealtime Plus. ولدى TTS Flash معرّف نموذج وسعر منشوران، لكن وثائق التكامل أقل اكتمالًا؛ أما ASR-Next فلا يرد له معرّف نموذج أو منطقة أو سعر في وثائق المطورين العامة التي راجعتها BIG CHANGE.

[وأفاد The Decoder](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) بخفض Qwen المعلن بنحو 70% لتحويل النص إلى كلام، و85% للصوت الآني، وما يصل إلى 95% للتعرف على الكلام. وتهم وحدات الفوترة عند التحقق من هذه الأرقام.

## التغيير الأبرز

- **ما الذي تغيّر:** بات Qwen يغطي أجزاء أكثر من منتج صوتي ضمن عائلة مستضافة واحدة، من التفريغ الصوتي والكلام المُنشأ إلى إنتاج المشاهد الصوتية والمحادثة المباشرة. لكن مكونات العائلة الخمسة لا تتمتع حتى الآن بالقدر نفسه من اكتمال إتاحة المطورين لها.
- **لماذا يهم:** بالنسبة إلى المطورين الذين يضعون ميزانية لخدمات التفريغ الصوتي أو الصوت، لم تعد دقيقة الصوت وحدها كافية لتسعير كل نقطة API. ففوترة ASR القائمة على الرموز تشمل الصوت الوارد والنص الناتج معًا؛ وللمحادثة المباشرة أربعة مسارات فوترة منفصلة.
- **ما الذي ينبغي مراقبته:** إلى جانب إتاحة ASR-Next، راقب ما إذا كانت اختبارات مستقلة للغات وزمن الاستجابة تؤكد وجود توفير عملي. وإذا أكدته، يبقى السؤال الأوسع ما إذا كان مزودو وكلاء الصوت والتفريغ والدبلجة سيمررون هذا التوفير إلى العملاء، وما إذا كانت واجهات الكلام المنافسة ستتبع ذلك.

## خريطة النماذج الخمسة

| النموذج المُعلن | المهمة المقصودة | الإتاحة الموثقة في 23 سبتمبر | السعر والحد العملي |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | التفريغ المتدفق ومن الملفات والمقاطع القصيرة؛ مع فصل اختياري للمتحدثين في نقاط API الخاصة بالملفات والمقاطع القصيرة | واجهات API مستضافة عبر WebSocket أو HTTP في سنغافورة وبكين. ويورد [الدليل الدولي](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) 30 لغة و10 تنويعات من اللهجات الصينية. | تتراوح أسعار سنغافورة من **$0.15 لكل مليون رمز صوتي للإدخال + $0.47 لكل مليون رمز نصي للإخراج** للملفات والمقاطع القصيرة إلى **$0.93 + $0.70** للبث/الرسالة. ويتيح تفريغ الملفات حتى 12 ساعة/2GB، والمقاطع القصيرة حتى 5 دقائق/2GB. |
| **Qwen Audio 3.1 ASR-Next** | نَسب المتحدث والطوابع الزمنية، إلى جانب التعرف على المشاعر والأحداث المحيطة والأصوات الآلية | أعلنه Qwen؛ ولم نعثر على معرّف نموذج API أو منطقة أو سعر أو حد استخدام منشور في وثائق Model Studio وQwenCloud الحالية | **غير موثق علنًا** |
| **Qwen Audio 3.1 TTS** | كلام متعدد اللغات ونقل الصوت بين اللغات والتحكم في طريقة الإلقاء عبر المطالبات | `qwen-audio-3.1-tts-flash` ورد في إشعار أسعار Alibaba. لكن [واجهة API لاستنساخ الصوت](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) التي راجعناها لا تزال تسمي TTS Flash 3.0. | سنغافورة: **$0.23 لكل مليون رمز نصي للإدخال + $1.87 لكل مليون رمز صوتي للإخراج**. لم تُحدد حدود الاستخدام العامة الحالية في مواد 3.1 التي راجعناها. |
| **Qwen Audio 3.1 TTS-Next** | توليد مشترك للكلام والمؤثرات والصوت الخلفي | واجهة API مستضافة عبر HTTPS وغير متدفقة في بكين، موثقة للصينية والإنجليزية | **$0.848 لكل مليون رمز إدخال + $1.696 لكل مليون رمز إخراج**. حتى 3,000 حرف للإدخال؛ وأربع دقائق لمخرجات البودكاست ودقيقتان فيما عدا ذلك. |
| **Qwen Audio 3.1 Realtime Plus** | محادثة صوتية كاملة الازدواج مع المقاطعة واستدعاء الأدوات | واجهة API مستضافة عبر WebSocket في سنغافورة وبكين. ويذكر [الدليل](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) 11 لغة. | سنغافورة: **$0.80 لكل مليون رمز نصي للإدخال، و$6.40 لكل مليون رمز صوتي للإدخال، و$6.40 لكل مليون رمز نصي للإخراج، و$24 لكل مليون رمز صوتي للإخراج**. ويحتفظ بما يصل إلى 50 دورًا صوتيًا أو 300 ثانية من سجل الصوت. |

هذه منتجات عبر API مستضافة. ولم تعثر BIG CHANGE على أوزان قابلة للتنزيل لنماذج 3.1 أو ترخيص لأوزان النماذج. ويغطي ترخيص MIT في مستودع QwenAudio موقع المشروع، ولذلك لا ينبغي اعتباره ترخيصًا للنماذج.

ويعتمد عدد اللغات أيضًا على الوثيقة. يقول [منشور الإطلاق الموثق من Qwen](https://www.sina.cn/news/detail/5346330620985983.html) إن ASR يدعم 30 لغة و16 لهجة صينية؛ أما دليل API الدولي فيورد 30 لغة و10 تنويعات للهجات. وينبغي للمطورين اعتماد القائمة المرتبطة بنقطة API التي يمكنهم استدعاؤها فعليًا.

## ادعاء الخفض 95% لا يطابق جدول الأسعار العام

دخل [إشعار تغيير الأسعار](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) لدى Alibaba حيز التنفيذ في 22 سبتمبر. وتشمل المقارنة الدقيقة فيه `qwen-audio-3.0-realtime-flash`، لا نموذج 3.1 Realtime Plus الجديد. وتحسب التخفيضات في سنغافورة وفق المعادلة (السعر القديم − السعر الجديد) / السعر القديم:

| بث Realtime Flash | قبل (دولار أمريكي) | بعد (دولار أمريكي) | نسبة التخفيض |
| --- | --- | --- | --- |
| إدخال نصي، لكل مليون رمز | $0.45 | $0.23 | 48.89% |
| إدخال صوتي، لكل مليون رمز | $4.50 | $0.93 | 79.33% |
| إخراج نصي، لكل مليون رمز | $4.50 | $0.70 | 84.44% |
| الإخراج (نص + صوت)، لكل مليون رمز | $15.00 | $1.87 | **87.53%** |

وينقل الإشعار نفسه نموذج 3.1 TTS Flash من سعر قدره $0.15 لكل 10,000 حرف إلى أسعار منفصلة لرموز الإدخال والإخراج. وتعرض [صفحة الأسعار الحالية](https://www.alibabacloud.com/help/en/model-studio/model-pricing) كذلك ASR 3.1 وفق رموز الإدخال والإخراج، بينما يحاسب ASR 3.0 على ثانية الصوت مع إخراج مجاني. وتعتمد النسبة عبر أي من هذين الزوجين على النص ومدة الصوت وتجزئته إلى رموز. لذا لا تعيد الجداول العامة التي راجعناها إنتاج خفض دقيق قدره 95% لـASR.

## الأدلة المستقلة لا تزال تخص Qwen 3.0

لم يتوفر اختبار مستقل للنماذج الخمسة 3.1 ضمن المصادر التي راجعناها يوم الإطلاق. وتورد صفحة مشروع Qwen الخاصة بـ [ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) نتائج معايير، لكنها تقول إنها لم تُعَد بصورة مستقلة.

وتضع Artificial Analysis نموذج [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) في المركز الثاني ضمن ساحة أصوات المزودين (جميع اللهجات والفئات)، بتقييم Elo قدره 1,259 وفاصل ثقة 95% يبلغ ±17، استنادًا إلى 1,447 عينة من المقارنات العمياء. وفي [ساحة وكلاء الكلام](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) المنفصلة، سجل Qwen Audio 3.0 Realtime Plus تقييم تفضيل Elo قدره 699 وزمنًا قدره 1.54 ثانية حتى أول صوت. ويقارن المشاركون نماذج مخفية في محادثات مباشرة وفق سيناريوهات محددة لهم.

## Sources

- [Alibaba تطلق Qwen Audio 3.1 بخمسة نماذج جديدة](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — تقرير استكشاف يلخص إطلاق النماذج الخمسة وينسب إلى Qwen تخفيضات تقريبية لأسعار TTS والصوت الآني وASR. وتحققت BIG CHANGE من الأسعار بالرجوع إلى جداول Alibaba نفسها.
- [منشور إطلاق Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — منشور من حساب Qwen الموثق يسمي النماذج الخمسة وقدراتها المقصودة. وتظل ادعاءات القدرات والسرعة منسوبة إلى البائع.
- [إشعار Model Studio بشأن خفض أسعار نماذج صوتية مختارة](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — تغيير رسمي للأسعار في 22 سبتمبر، يتضمن المعدلات الدقيقة قبل وبعد لـ3.0 Realtime Flash في سنغافورة وتغيير وحدة فوترة 3.1 TTS Flash.
- [أسعار نماذج Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — الأسعار الرسمية الحالية بحسب النموذج ونوع البيانات والمنطقة، وتشمل 3.1 ASR وRealtime Plus.
- [نماذج تحويل الكلام إلى نص في QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — معرّفات نقاط ASR الحالية وأساليب الوصول وقوائم اللغات ودعم فصل المتحدثين وحدود المدة.
- [محادثة الصوت الآنية في QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — مثال WebSocket الحالي لـ3.1 Realtime Plus، ودعم الأصوات واللغات وحدود سجل المحادثة المحتفَظ به.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — إتاحة API الرسمية في بكين فقط والأسعار واللغات وطول الإدخال وحدود مدة الإخراج.
- [صفحة مشروع Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — صفحة مشروع Qwen ثابتة توثق قدرات ASR وASR-Next ومعايير البائع؛ وتذكر أن النتائج لم تُعَد بصورة مستقلة.
- [لوحة ترتيب تحويل النص إلى كلام من Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — نتيجة تفضيل أعمى للنموذج السابق Qwen Audio 3.0 TTS Plus، وتشمل عدد العينات وفاصل الثقة.
- [ساحة وكلاء الكلام من Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — نتيجة مستقلة للتفضيل والزمن حتى أول صوت لنموذج Qwen Audio 3.0 Realtime Plus؛ وليست تقييمًا لـ3.1.
- [مرجع واجهة API لاستنساخ الصوت](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — تسمي أمثلة النموذج المستهدف الحالية 3.0 TTS Flash. وهي لا تؤكد بصورة مستقلة وجود مسار تكامل للتوليد في 3.1.
