AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 ने व्हॉइस मॉडेल्सची व्याप्ती वाढवली; ९५% दरकपातीचा संदर्भ समजून घ्या

> Qwen Audio 3.1 मध्ये ध्वनीनिर्मिती आणि आकलनाची भर पडली आहे. API दस्तऐवजीकरण सर्व मॉडेल्ससाठी सारखे पूर्ण नाही आणि बिलिंगच्या एककांतील बदलांमुळे ASR वरील जाहिरात केलेल्या बचतीची तुलना गुंतागुंतीची होते.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Alibaba च्या Qwen टीमने प्रतिलेखन, वाणी-निर्मिती आणि थेट व्हॉइस संवाद यांचा समावेश असलेली Qwen Audio 3.1 ची पाच मॉडेल्स सादर केली आहेत. ASR, TTS-Next आणि Realtime Plus साठी होस्टेड एंडपॉइंट्सचे दस्तऐवजीकरण उपलब्ध आहे. TTS Flash साठी मॉडेल ID आणि किंमत प्रकाशित झाली आहे, मात्र इंटिग्रेशनचे दस्तऐवजीकरण कमी पूर्ण आहे; BIG CHANGE ने तपासलेल्या सार्वजनिक डेव्हलपर दस्तऐवजांत ASR-Next साठी मॉडेल ID, प्रदेश किंवा किंमत दिलेली नाही.

[The Decoder ने वृत्त दिले](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) Qwen ने मजकूर-वाणी रूपांतरणासाठी सुमारे ७०%, रिअल-टाइम ऑडिओसाठी ८५% आणि वाणी-ओळखीसाठी ९५% पर्यंत दरकपात जाहीर केली आहे. या आकड्यांची पडताळणी करताना बिलिंगची एकके महत्त्वाची ठरतात.

## मोठा बदल

- **काय बदलले:** Qwen आता एका होस्टेड मॉडेल-कुटुंबात व्हॉइस उत्पादनाचे अधिक पैलू समाविष्ट करते—प्रतिलेखन आणि तयार केलेल्या वाणीपासून ध्वनी-दृश्यनिर्मिती व थेट संभाषणापर्यंत. मात्र या पाच घटकांसाठी डेव्हलपर प्रवेशाचे दस्तऐवजीकरण अद्याप समान प्रमाणात पूर्ण नाही.
- **हे का महत्त्वाचे:** प्रतिलेखन किंवा व्हॉइस सेवा बजेटमध्ये बसवणाऱ्या डेव्हलपरसाठी, प्रत्येक एंडपॉइंटची किंमत ठरवताना केवळ ऑडिओचा कालावधी पुरेसा राहिलेला नाही. टोकन-आधारित ASR बिलिंगमध्ये येणारा ऑडिओ आणि त्यातून तयार होणारा मजकूर या दोन्हींचे शुल्क असते; थेट संभाषणासाठी चार स्वतंत्र दरांची स्ट्रीम्स आहेत.
- **कशाकडे लक्ष द्यावे:** ASR-Next चा प्रवेश उपलब्ध होण्याबरोबरच, स्वतंत्र भाषा आणि विलंब-काल चाचण्या उपयुक्त बचत सिद्ध करतात का ते पाहा. तसे झाल्यास, व्हॉइस-एजंट, प्रतिलेखन आणि डबिंग सेवा पुरवठादार ही बचत ग्राहकांना देतात का आणि प्रतिस्पर्धी वाणी API त्यानुसार दर बदलतात का, हा व्यापक प्रश्न असेल.

## पाच मॉडेल्सचा आढावा

| जाहीर केलेले मॉडेल | अपेक्षित काम | २३ सप्टेंबर रोजी दस्तऐवजीकृत प्रवेश | किंमत आणि व्यावहारिक मर्यादा |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | स्ट्रीमिंग, फाइल आणि लघु-स्वरूप प्रतिलेखन; फाइल व लघु-स्वरूप एंडपॉइंट्सवर पर्यायी वक्ता-विभाजन | सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket किंवा HTTP API. [आंतरराष्ट्रीय मार्गदर्शक](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) ३० भाषा आणि चिनी भाषेच्या १० बोली-प्रकारांची यादी देतो. | सिंगापूरमध्ये दर **$0.15/M ऑडिओ-इनपुट टोकन्स + $0.47/M मजकूर-आउटपुट टोकन्स** फाइल/लघु-स्वरूपासाठी ते **$0.93 + $0.70** स्ट्रीमिंग/मेसेजसाठी आहेत. फाइल प्रतिलेखनाची मर्यादा १२ तास/२GB; लघु-स्वरूपाची ५ मिनिटे/२GB आहे. |
| **Qwen Audio 3.1 ASR-Next** | वक्त्याची ओळख आणि टाइमस्टॅम्प्स, तसेच भावना, सभोवतालच्या घटना आणि यंत्रांचे आवाज ओळखणे | Qwen ने जाहीर केले; सध्याच्या Model Studio आणि QwenCloud दस्तऐवजांत सार्वजनिक API मॉडेल ID, प्रदेश, दर किंवा मर्यादा आढळली नाही | **सार्वजनिक दस्तऐवजीकरण उपलब्ध नाही** |
| **Qwen Audio 3.1 TTS** | बहुभाषिक वाणी, भाषांमधील व्हॉइस ट्रान्सफर आणि बोलण्याच्या शैलीवर प्रॉम्प्टद्वारे नियंत्रण | `qwen-audio-3.1-tts-flash` Alibaba च्या किंमत-सूचनेत नमूद आहे. तपासलेल्या [व्हॉइस-क्लोनिंग API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) मध्ये अद्याप 3.0 TTS Flash चाच उल्लेख आहे. | सिंगापूर: **$0.23/M मजकूर-इनपुट टोकन्स + $1.87/M ऑडिओ-आउटपुट टोकन्स**. तपासलेल्या 3.1 दस्तऐवजांत सध्याच्या सार्वजनिक मर्यादा दिलेल्या नाहीत. |
| **Qwen Audio 3.1 TTS-Next** | वाणी, ध्वनी-प्रभाव आणि पार्श्वध्वनी यांची संयुक्त निर्मिती | बीजिंगमध्ये होस्टेड, नॉन-स्ट्रीमिंग HTTPS API; चिनी आणि इंग्रजी भाषांसाठी दस्तऐवजीकृत | **$0.848/M इनपुट टोकन्स + $1.696/M आउटपुट टोकन्स**. इनपुटची कमाल मर्यादा ३,००० अक्षरे; पॉडकास्ट आउटपुटसाठी चार मिनिटे, इतरांसाठी दोन मिनिटे. |
| **Qwen Audio 3.1 Realtime Plus** | मध्ये व्यत्यय स्वीकारणे आणि टूल कॉल्ससह फुल-डुप्लेक्स व्हॉइस संभाषण | सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket API. [मार्गदर्शक](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) ११ भाषांची यादी देतो. | सिंगापूर: **$0.80/M मजकूर इनपुट, $6.40/M ऑडिओ इनपुट, $6.40/M मजकूर आउटपुट आणि $24/M ऑडिओ आउटपुट**. यात ऑडिओचे ५० संवाद-टप्पे किंवा ३०० सेकंदांचा ऑडिओ इतिहास साठवता येतो. |

ही होस्टेड API उत्पादने आहेत. BIG CHANGE ला डाउनलोड करता येतील असे 3.1 मॉडेल-वेट्स किंवा त्यांचा परवाना आढळला नाही. QwenAudio च्या GitHub रिपॉझिटरीतील MIT परवाना प्रकल्पाच्या वेबसाइटसाठी आहे; तो मॉडेल्सचा परवाना समजू नये.

भाषांची संख्या कोणता दस्तऐवज पाहता यावरही अवलंबून आहे. Qwen च्या [पडताळलेल्या लाँच पोस्टमध्ये](https://www.sina.cn/news/detail/5346330620985983.html) ASR साठी ३० भाषा आणि चिनी भाषेच्या १६ बोली असल्याचे म्हटले आहे; आंतरराष्ट्रीय API मार्गदर्शकात ३० भाषा आणि १० बोली-प्रकार दिले आहेत. डेव्हलपरनी प्रत्यक्ष वापरता येणाऱ्या एंडपॉइंटला जोडलेली यादी पाहावी.

## ९५% चा दावा सार्वजनिक दरतक्त्याशी जुळत नाही

Alibaba ची [दरबदलाची सूचना](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) २२ सप्टेंबरपासून लागू झाली. तिची अचूक तुलना `qwen-audio-3.0-realtime-flash` नवीन 3.1 Realtime Plus ऐवजी 3.0 Realtime Flash ची आहे. सिंगापूरमधील कपात (जुना दर − नवा दर) / जुना दर या सूत्राने मोजली आहे:

| Realtime Flash स्ट्रीम | आधी (USD) | नंतर (USD) | कपात |
| --- | --- | --- | --- |
| दहा लाख टोकन्समागे मजकूर इनपुट | $0.45 | $0.23 | 48.89% |
| दहा लाख टोकन्समागे ऑडिओ इनपुट | $4.50 | $0.93 | 79.33% |
| दहा लाख टोकन्समागे मजकूर आउटपुट | $4.50 | $0.70 | 84.44% |
| दहा लाख टोकन्समागे आउटपुट (मजकूर + ऑडिओ) | $15.00 | $1.87 | **87.53%** |

याच सूचनेनुसार 3.1 TTS Flash चे दर १०,००० अक्षरांमागे $0.15 वरून स्वतंत्र इनपुट आणि आउटपुट टोकन-दरांत बदलतात. [सध्याच्या किंमत-पृष्ठावर](https://www.alibabacloud.com/help/en/model-studio/model-pricing) 3.1 ASR चे दरही इनपुट आणि आउटपुट टोकननुसार दिले आहेत, तर 3.0 ASR मध्ये प्रत्येक ऑडिओ-सेकंदासाठी शुल्क असून आउटपुट मोफत आहे. या दोन्ही जोड्यांमधील टक्केवारी मजकूर, ऑडिओचा कालावधी आणि टोकन-विभाजनावर अवलंबून असते. त्यामुळे येथे तपासलेल्या सार्वजनिक दरतक्त्यांतून ASR साठी नेमकी ९५% दरकपात सिद्ध होत नाही.

## स्वतंत्र पुरावे अद्याप Qwen 3.0 शी संबंधित आहेत

लाँचच्या दिवशी तपासलेल्या स्रोतांमध्ये पाचही 3.1 मॉडेल्सची स्वतंत्र चाचणी उपलब्ध नव्हती. Qwen चे स्वतःचे [ASR प्रकल्प-पृष्ठ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) बेंचमार्कचे निकाल देते, पण ते स्वतंत्रपणे पुन्हा तपासले गेले नसल्याचेही नमूद करते.

Artificial Analysis च्या क्रमवारीत [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) सर्व उच्चार आणि श्रेणींचा समावेश असलेल्या पुरवठादार-व्हॉइस स्पर्धेत १,२५९ Elo गुणांसह दुसऱ्या क्रमांकावर आहे; ९५% विश्वास-अंतर ±१७ आणि अंध तुलनेचे १,४४७ नमुने होते. स्वतंत्र [स्पीच-एजंट स्पर्धेत](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) Qwen Audio 3.0 Realtime Plus ला ६९९ प्राधान्य Elo गुण आणि पहिला ऑडिओ ऐकू येण्यासाठी १.५४ सेकंद लागले. त्यात सहभागी दिलेल्या प्रसंगांनुसार थेट संभाषणांत लपवलेली मॉडेल्स तुलना करतात.

## Sources

- [Alibaba ने पाच नव्या मॉडेल्ससह Qwen Audio 3.1 लाँच केले](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — पाच मॉडेल्सच्या लाँचचा आढावा घेणारा आणि TTS, रिअल-टाइम ऑडिओ व ASR मधील अंदाजे दरकपातीचे श्रेय Qwen ला देणारा वृत्तांत. BIG CHANGE ने Alibaba च्या स्वतःच्या दरतक्त्यांशी दर तपासले.
- [Qwen Audio 3.1 लाँच पोस्ट](https://www.sina.cn/news/detail/5346330620985983.html) — पाच मॉडेल्सची नावे आणि त्यांची अपेक्षित क्षमता देणारी पडताळलेली Qwen खात्याची पोस्ट. क्षमता आणि वेगाविषयीची विधाने विक्रेत्याचे दावे आहेत.
- [निवडक ऑडिओ मॉडेल्ससाठी Model Studio ची दरकपात सूचना](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 3.0 Realtime Flash साठी सिंगापूरमधील नेमके जुने-नवे दर आणि 3.1 TTS Flash मधील बिलिंग-एकक बदल नमूद करणारी २२ सप्टेंबरची अधिकृत दरबदल सूचना.
- [Model Studio मॉडेल किंमत](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 3.1 ASR आणि Realtime Plus सह मॉडेल, माध्यम आणि प्रदेशानुसार सध्याचे अधिकृत दर.
- [QwenCloud वाणी-ते-मजकूर मॉडेल्स](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — सध्याचे ASR एंडपॉइंट ID, प्रवेशाच्या पद्धती, भाषांच्या याद्या, वक्ता-विभाजनाचा आधार आणि कालावधीच्या मर्यादा.
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — सध्याचे 3.1 Realtime Plus WebSocket उदाहरण, व्हॉइस व भाषा समर्थन आणि संभाषणासाठी राखल्या जाणाऱ्या मर्यादा.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — बीजिंगपुरत्या अधिकृत API उपलब्धतेची माहिती, दर, भाषा, इनपुट लांबी आणि आउटपुट कालावधीच्या मर्यादा.
- [Qwen Audio 3.1 ASR प्रकल्प-पृष्ठ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR व ASR-Next क्षमता आणि विक्रेत्याने नोंदवलेले बेंचमार्क यांचे अपरिवर्तनीय Qwen प्रकल्प-पृष्ठ; निकाल स्वतंत्रपणे पुन्हा तयार केले नसल्याचे त्यात म्हटले आहे.
- [Artificial Analysis Text to Speech क्रमवारी](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — पूर्वीच्या Qwen Audio 3.0 TTS Plus मॉडेलचे अंध-पसंतीचे निकाल, नमुन्यांची संख्या आणि विश्वास-अंतरासह.
- [Artificial Analysis Speech Agent Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plus साठी स्वतंत्र पसंती आणि पहिल्या ऑडिओपर्यंतचा कालावधी; ही 3.1 ची चाचणी नाही.
- [व्हॉइस-क्लोनिंग HTTP API संदर्भ](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — सध्याच्या लक्ष्य-मॉडेलच्या उदाहरणांत 3.0 TTS Flash दिले आहे. ते 3.1 साठी संश्लेषण-इंटिग्रेशनची स्वतंत्र पुष्टी करत नाहीत.
