دنیا ٹھہری نہیں ہے۔RSS
BIG CHANGE.

Markdown ایڈیشن

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 نے اپنی صوتی خدمات کا دائرہ بڑھایا ہے؛ 95 فیصد قیمت میں کمی کے دعوے کو سیاق کے ساتھ دیکھیں

> Qwen Audio 3.1 میں آواز بنانا اور سمجھنا شامل ہے۔ اس کی API دستاویزات میں یکسانیت نہیں، اور بلنگ کی اکائی بدلنے سے ASR کی مشتہر بچت کا موازنہ پیچیدہ ہوجاتا ہے۔

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Alibaba کی Qwen ٹیم نے Qwen Audio 3.1 کے پانچ ماڈل متعارف کرائے ہیں، جو نقلِ گفتار، تقریر کی تخلیق اور براہِ راست صوتی گفتگو پر محیط ہیں۔ ASR، TTS-Next اور Realtime Plus کے ہوسٹڈ اینڈپوائنٹس کی دستاویزات موجود ہیں۔ TTS Flash کا ماڈل آئی ڈی اور قیمت شائع ہے، لیکن انضمام کی دستاویزات کم مکمل ہیں؛ BIG CHANGE کے زیرِجائزہ عوامی ڈیولپر دستاویزات میں ASR-Next کا ماڈل آئی ڈی، علاقہ یا قیمت درج نہیں۔

[The Decoder نے رپورٹ کیا کہ](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) Qwen نے ٹیکسٹ ٹو اسپیچ کے لیے تقریباً 70 فیصد، ریئل ٹائم آڈیو کے لیے 85 فیصد اور اسپیچ ریکگنیشن کے لیے 95 فیصد تک کمی مشتہر کی۔ ان اعداد کو جانچتے وقت بلنگ کی اکائیاں اہم ہیں۔

## بڑی تبدیلی

- **کیا بدلا:** Qwen نے ایک ہی ہوسٹڈ خاندان میں صوتی مصنوعات کے مزید حصے سمیٹ لیے ہیں: نقلِ گفتار اور تیار کردہ آواز سے لے کر صوتی منظر کی تیاری اور براہِ راست گفتگو تک۔ تاہم، اس کے پانچ اجزا میں ڈیولپرز کی رسائی سے متعلق دستاویزات ابھی یکساں طور پر مکمل نہیں۔
- **یہ کیوں اہم ہے:** نقلِ گفتار یا صوتی خدمات کا بجٹ بنانے والے ڈیولپرز کے لیے اب ہر اینڈپوائنٹ کی قیمت صرف آڈیو کے منٹوں سے طے نہیں ہوتی۔ ٹوکن پر مبنی ASR بل میں آنے والا آڈیو اور اس سے بننے والا متن، دونوں شامل ہیں؛ براہِ راست گفتگو کے چار سلسلوں کی قیمت الگ الگ ہے۔
- **کس بات پر نظر رکھیں:** ASR-Next تک رسائی کے ساتھ یہ بھی دیکھیں کہ آیا زبان اور تاخیر کے آزادانہ ٹیسٹ مفید بچت کی تصدیق کرتے ہیں۔ اگر ایسا ہو تو اگلا سوال یہ ہے کہ صوتی ایجنٹ، نقلِ گفتار اور ڈبنگ فراہم کرنے والے یہ بچت صارفین تک پہنچاتے ہیں یا نہیں، اور کیا حریف اسپیچ APIs بھی اسی راہ پر چلتی ہیں۔

## پانچ ماڈلوں کا خاکہ

| متعارف کرایا گیا ماڈل | مقصد | 23 ستمبر کو دستاویزی رسائی | قیمت اور عملی حد |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | اسٹریمنگ، فائل اور مختصر نقلِ گفتار؛ فائل اور مختصر اینڈپوائنٹس پر اختیاری مقرر کی شناخت | سنگاپور اور بیجنگ میں ہوسٹڈ WebSocket یا HTTP APIs۔ [بین الاقوامی گائیڈ](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) میں 30 زبانیں اور چینی بولیوں کی 10 اقسام درج ہیں۔ | سنگاپور میں قیمت **$0.15/M آڈیو ان پٹ ٹوکن + $0.47/M متن آؤٹ پٹ ٹوکن** فائل/مختصر نقل کے لیے، جبکہ **$0.93 + $0.70** اسٹریمنگ/پیغام کے لیے ہے۔ فائل نقلِ گفتار کی حد 12 گھنٹے/2GB، اور مختصر نقل کی 5 منٹ/2GB ہے۔ |
| **Qwen Audio 3.1 ASR-Next** | مقرر کی نسبت اور وقت کے نشانات، نیز جذبات، ماحول کی آوازوں اور مشینی آوازوں کی شناخت | Qwen نے اس کا اعلان کیا؛ موجودہ Model Studio اور QwenCloud دستاویزات میں کوئی عوامی API ماڈل آئی ڈی، علاقہ، نرخ یا حد نہیں ملی۔ | **عوامی دستاویزات میں درج نہیں** |
| **Qwen Audio 3.1 TTS** | کثیر لسانی تقریر، زبانوں کے درمیان آواز کی منتقلی، اور پرامپٹ کے ذریعے ادائیگی پر قابو | `qwen-audio-3.1-tts-flash` Alibaba کے قیمت کے نوٹس میں شامل ہے۔ زیرِجائزہ [آواز کی نقل بنانے والی API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) اب بھی 3.0 TTS Flash کا نام لیتی ہے۔ | سنگاپور: **$0.23/M متن ان پٹ ٹوکن + $1.87/M آڈیو آؤٹ پٹ ٹوکن**۔ زیرِجائزہ 3.1 مواد میں موجودہ عوامی حدیں واضح نہیں کی گئیں۔ |
| **Qwen Audio 3.1 TTS-Next** | تقریر، صوتی اثرات اور پس منظر کی آواز کی مشترکہ تخلیق | بیجنگ میں ہوسٹڈ، غیر اسٹریمنگ HTTPS API؛ چینی اور انگریزی کی دستاویزات موجود ہیں۔ | **$0.848/M ان پٹ ٹوکن + $1.696/M آؤٹ پٹ ٹوکن**۔ ان پٹ زیادہ سے زیادہ 3,000 حروف؛ پوڈکاسٹ آؤٹ پٹ چار منٹ اور دیگر آؤٹ پٹ دو منٹ تک۔ |
| **Qwen Audio 3.1 Realtime Plus** | مکمل دو طرفہ صوتی گفتگو، جس میں بات کاٹنے اور ٹول کال کرنے کی سہولت ہے | سنگاپور اور بیجنگ میں ہوسٹڈ WebSocket API۔ [گائیڈ](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) میں 11 زبانیں درج ہیں۔ | سنگاپور میں نرخ: **$0.80/M متن ان پٹ، $6.40/M آڈیو ان پٹ، $6.40/M متن آؤٹ پٹ، اور $24/M آڈیو آؤٹ پٹ**۔ یہ زیادہ سے زیادہ 50 آڈیو باریوں یا 300 سیکنڈ کی آڈیو تاریخ محفوظ رکھتا ہے۔ |

یہ ہوسٹڈ API مصنوعات ہیں۔ BIG CHANGE کو Qwen 3.1 کے ماڈل وزن ڈاؤن لوڈ کرنے کے لیے دستیاب نہیں ملے اور نہ ہی ان کے ماڈل وزن کا لائسنس ملا۔ QwenAudio کے GitHub ذخیرے کا MIT لائسنس منصوبے کی ویب سائٹ پر لاگو ہوتا ہے؛ اسے ماڈلوں کا لائسنس نہ سمجھا جائے۔

زبانوں کی تعداد بھی دستاویز کے لحاظ سے بدلتی ہے۔ Qwen کی [تصدیق شدہ لانچ پوسٹ](https://www.sina.cn/news/detail/5346330620985983.html) کے مطابق ASR میں 30 زبانیں اور چینی بولیوں کی 16 اقسام شامل ہیں؛ بین الاقوامی API گائیڈ میں 30 زبانیں اور بولیوں کی 10 اقسام درج ہیں۔ ڈیولپرز کو اسی اینڈپوائنٹ کی فہرست دیکھنی چاہیے جس تک انہیں حقیقتاً رسائی حاصل ہو۔

## 95 فیصد کا دعویٰ عوامی نرخوں کی جدول سے براہِ راست نہیں نکلتا

Alibaba کا [قیمتوں میں تبدیلی کا نوٹس](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) 22 ستمبر سے نافذ ہوا۔ اس میں عین موازنہ `qwen-audio-3.0-realtime-flash` پر ہے، نہ کہ نئے 3.1 Realtime Plus پر۔ سنگاپور میں کمی کا حساب یہ ہے: (پرانا نرخ − نیا نرخ) / پرانا نرخ۔

| Realtime Flash سلسلہ | پہلے (امریکی ڈالر) | بعد میں (امریکی ڈالر) | کمی |
| --- | --- | --- | --- |
| متن ان پٹ، فی دس لاکھ ٹوکن | $0.45 | $0.23 | 48.89% |
| آڈیو ان پٹ، فی دس لاکھ ٹوکن | $4.50 | $0.93 | 79.33% |
| متن آؤٹ پٹ، فی دس لاکھ ٹوکن | $4.50 | $0.70 | 84.44% |
| آؤٹ پٹ (متن + آڈیو)، فی دس لاکھ ٹوکن | $15.00 | $1.87 | **87.53%** |

اسی نوٹس میں 3.1 TTS Flash کی قیمت بھی 10,000 حروف کے لیے $0.15 سے بدل کر ان پٹ اور آؤٹ پٹ ٹوکن کے الگ الگ نرخ کردی گئی ہے۔ [موجودہ قیمتوں کا صفحہ](https://www.alibabacloud.com/help/en/model-studio/model-pricing) بھی 3.1 ASR کے لیے ان پٹ اور آؤٹ پٹ ٹوکن کے حساب سے قیمت دکھاتا ہے، جبکہ 3.0 ASR فی آڈیو سیکنڈ نرخ لیتا ہے اور آؤٹ پٹ مفت ہے۔ دونوں میں فیصدی موازنہ متن، آڈیو کے دورانیے اور ٹوکن بنانے کے طریقے پر منحصر ہے۔ اس لیے یہاں زیرِجائزہ عوامی جدولوں سے ASR کی عین 95 فیصد کمی ثابت نہیں ہوتی۔

## آزاد شواہد اب بھی Qwen 3.0 سے متعلق ہیں

لانچ کے دن زیرِجائزہ ذرائع میں ان پانچ 3.1 ماڈلوں کا کوئی آزاد ٹیسٹ دستیاب نہیں تھا۔ Qwen کا اپنا [ASR منصوبے کا صفحہ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) بینچ مارک کے نتائج دیتا ہے، مگر ساتھ کہتا ہے کہ انہیں آزادانہ طور پر دوبارہ نہیں جانچا گیا۔

Artificial Analysis کی درجہ بندی میں [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) آواز فراہم کرنے والوں کے میدان (تمام لہجوں اور زمروں) میں 1,259 Elo کے ساتھ دوسرے نمبر پر ہے؛ 95 فیصد اعتماد کا وقفہ پلس یا مائنس 17 ہے اور اندھے موازنے میں 1,447 نمونے شامل تھے۔ الگ [اسپیچ ایجنٹ میدان](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) میں Qwen Audio 3.0 Realtime Plus نے 699 ترجیحی Elo اور پہلی آواز تک 1.54 سیکنڈ کا وقت حاصل کیا۔ اس میں شریک فریق مخصوص منظرناموں میں براہِ راست گفتگو کے دوران پوشیدہ ماڈلوں کا موازنہ کرتے ہیں۔

## Sources

- [Alibaba کا Qwen Audio 3.1 پانچ نئے ماڈلوں کے ساتھ متعارف](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) —  پانچ ماڈلوں کے اجرا کی خبر، جس میں TTS، ریئل ٹائم آڈیو اور ASR کی قیمتوں میں تقریباً کمی Qwen سے منسوب ہے۔ BIG CHANGE نے نرخ Alibaba کے اپنے جدولوں سے جانچے۔
- [Qwen Audio 3.1 کی لانچ پوسٹ](https://www.sina.cn/news/detail/5346330620985983.html) —  Qwen کے تصدیق شدہ اکاؤنٹ کی پوسٹ، جس میں پانچ ماڈلوں کے نام اور ان کی مطلوبہ صلاحیتیں درج ہیں۔ صلاحیت اور رفتار کے بیانات کمپنی سے منسوب ہیں۔
- [منتخب آڈیو ماڈلوں کی قیمتوں میں کمی کا Model Studio نوٹس](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) —  22 ستمبر کی آفیشل قیمت تبدیلی: 3.0 Realtime Flash کے سنگاپور کے عین سابقہ و نئے نرخ، اور 3.1 TTS Flash کی بلنگ اکائی میں تبدیلی۔
- [Model Studio ماڈل قیمتیں](https://www.alibabacloud.com/help/en/model-studio/model-pricing) —  ماڈل، طریقۂ استعمال اور علاقے کے لحاظ سے موجودہ آفیشل قیمتیں، جن میں 3.1 ASR اور Realtime Plus شامل ہیں۔
- [QwenCloud کے اسپیچ ٹو ٹیکسٹ ماڈل](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) —  ASR اینڈپوائنٹس کے موجودہ آئی ڈی، رسائی کے طریقے، زبانوں کی فہرستیں، مقرر کی شناخت اور دورانیے کی حدیں۔
- [QwenCloud ریئل ٹائم آڈیو چیٹ](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) —  3.1 Realtime Plus کی موجودہ WebSocket مثال، آواز اور زبانوں کی معاونت، اور محفوظ رکھی جانے والی گفتگو کی حدیں۔
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) —  بیجنگ تک محدود آفیشل API دستیابی، قیمتیں، زبانیں، ان پٹ کی طوالت اور آؤٹ پٹ دورانیے کی حدیں۔
- [Qwen Audio 3.1 ASR منصوبے کا صفحہ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) —  ASR اور ASR-Next کی صلاحیتوں اور کمپنی کے بتائے ہوئے بینچ مارک کی Qwen کی ناقابلِ تغیر منصوبہ صفحہ دستاویز؛ اس کے مطابق نتائج کی آزادانہ طور پر دوبارہ توثیق نہیں ہوئی۔
- [Artificial Analysis کی ٹیکسٹ ٹو اسپیچ درجہ بندی](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) —  سابقہ Qwen Audio 3.0 TTS Plus کا اندھے ترجیحی موازنے کا نتیجہ، جس میں نمونوں کی تعداد اور اعتماد کا وقفہ شامل ہے۔
- [Artificial Analysis کا اسپیچ ایجنٹ میدان](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) —  سابقہ Qwen Audio 3.0 Realtime Plus کے لیے ترجیح اور پہلی آڈیو تک وقت کا الگ نتیجہ؛ یہ 3.1 کا جائزہ نہیں۔
- [آواز کی نقل بنانے کے HTTP API کی حوالہ دستاویز](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) —  موجودہ ہدفی ماڈل کی مثالوں میں 3.0 TTS Flash کا نام ہے۔ ان سے 3.1 کی صوتی تخلیق کے انضمام کا راستہ آزادانہ طور پر ثابت نہیں ہوتا۔