AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 ने अपना वॉइस-स्टैक बढ़ाया; 95% कीमत-कटौती को संदर्भ के साथ समझें
> Qwen Audio 3.1 में आवाज़ बनाना और समझना दोनों जुड़ते हैं। इसकी API जानकारी में असमानताएं हैं, और बिलिंग इकाइयों के बदलाव से विज्ञापित ASR बचत की तुलना जटिल हो जाती है।
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Alibaba की Qwen टीम ने ट्रांसक्रिप्शन, वाक्-निर्माण और लाइव आवाज़ी संवाद वाले पांच Qwen Audio 3.1 मॉडल पेश किए हैं। ASR, TTS-Next और Realtime Plus के होस्टेड एंडपॉइंट का दस्तावेज़ीकरण उपलब्ध है। TTS Flash का मॉडल ID और कीमत प्रकाशित है, लेकिन एकीकरण का दस्तावेज़ अधूरा है; BIG CHANGE द्वारा देखे गए सार्वजनिक डेवलपर दस्तावेज़ों में ASR-Next का मॉडल ID, क्षेत्र या कीमत नहीं है।
[The Decoder ने रिपोर्ट किया](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) कि Qwen ने टेक्स्ट-टू-स्पीच में लगभग 70%, रियल-टाइम ऑडियो में 85% और वाक्-पहचान में 95% तक कीमतें घटाने का दावा किया। इन आंकड़ों को परखते समय बिलिंग इकाइयां मायने रखती हैं।
## बड़ा बदलाव
- **क्या बदला:** Qwen अब एक ही होस्टेड परिवार में आवाज़ वाले उत्पाद की अधिक जरूरतें पूरी करता है: ट्रांसक्रिप्शन और तैयार भाषण से लेकर ध्वनि-दृश्य निर्माण तथा लाइव बातचीत तक। उसके पांचों घटकों के लिए डेवलपर पहुंच का दस्तावेज़ समान रूप से पूरा नहीं है।
- **यह क्यों मायने रखता है:** ट्रांसक्रिप्शन या वॉइस सेवा का बजट बनाने वाले डेवलपर हर एंडपॉइंट की कीमत केवल ऑडियो के मिनट से नहीं तय कर सकते। टोकन के आधार पर ASR बिल में आने वाला ऑडियो और उससे निकला पाठ, दोनों शामिल होते हैं; लाइव संवाद में चार अलग-अलग स्ट्रीम की कीमतें हैं।
- **क्या देखना है:** ASR-Next की उपलब्धता के साथ देखें कि स्वतंत्र भाषा और विलंबता परीक्षण उपयोगी बचत की पुष्टि करते हैं या नहीं। यदि ऐसा होता है, तो अगला सवाल होगा कि वॉइस-एजेंट, ट्रांसक्रिप्शन और डबिंग प्रदाता यह बचत ग्राहकों तक पहुंचाते हैं या नहीं और प्रतिस्पर्धी वाक्-API भी कीमत घटाते हैं या नहीं।
## पांच मॉडलों का खाका
| घोषित मॉडल | इच्छित काम | 23 सितंबर को दस्तावेज़ में दर्ज पहुंच | कीमत और व्यावहारिक सीमा |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | स्ट्रीमिंग, फ़ाइल और छोटे ऑडियो का ट्रांसक्रिप्शन; फ़ाइल और छोटे ऑडियो एंडपॉइंट पर वैकल्पिक वक्ता-पहचान | सिंगापुर और बीजिंग में होस्टेड WebSocket या HTTP API। अंतरराष्ट्रीय [मार्गदर्शिका](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) में 30 भाषाएं और चीनी की 10 बोली-प्रकार सूचीबद्ध हैं। | सिंगापुर में फ़ाइल/छोटे ऑडियो ट्रांसक्रिप्शन की दरें **$0.15/M ऑडियो-इनपुट टोकन + $0.47/M टेक्स्ट-आउटपुट टोकन** से लेकर स्ट्रीमिंग/संदेशों के लिए **$0.93 + $0.70** तक हैं। फ़ाइल ट्रांसक्रिप्शन की सीमा 12 घंटे/2GB और छोटे ऑडियो की 5 मिनट/2GB है। |
| **Qwen Audio 3.1 ASR-Next** | वक्ता की पहचान और टाइमस्टैम्प; भावनाओं, आसपास की घटनाओं और मशीन की आवाज़ों की पहचान | Qwen ने इसकी घोषणा की है; मौजूदा Model Studio और QwenCloud दस्तावेज़ों में सार्वजनिक API मॉडल ID, क्षेत्र, दर या सीमा नहीं मिली। | **सार्वजनिक दस्तावेज़ उपलब्ध नहीं** |
| **Qwen Audio 3.1 TTS** | बहुभाषी वाक्, भाषाओं के पार आवाज़ का रूपांतरण और बोलने के ढंग पर प्रॉम्प्ट का नियंत्रण | `qwen-audio-3.1-tts-flash` का नाम Alibaba की कीमत-सूचना में है। समीक्षा किया गया [आवाज़-क्लोनिंग API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) अब भी 3.0 TTS Flash का नाम बताता है। | सिंगापुर: **$0.23/M टेक्स्ट-इनपुट टोकन + $1.87/M ऑडियो-आउटपुट टोकन**. समीक्षा की गई 3.1 सामग्री में मौजूदा सार्वजनिक सीमाएं नहीं बताई गईं। |
| **Qwen Audio 3.1 TTS-Next** | भाषण, ध्वनि-प्रभाव और पृष्ठभूमि ऑडियो एक साथ बनाना | बीजिंग में होस्टेड, नॉन-स्ट्रीमिंग HTTPS API; चीनी और अंग्रेज़ी के लिए दस्तावेज़ उपलब्ध | **$0.848/M इनपुट टोकन + $1.696/M आउटपुट टोकन**। इनपुट की सीमा 3,000 अक्षर तक; पॉडकास्ट आउटपुट चार मिनट और अन्य आउटपुट दो मिनट तक। |
| **Qwen Audio 3.1 Realtime Plus** | बीच में रोकने और टूल कॉल करने की सुविधा वाली फुल-डुप्लेक्स आवाज़ी बातचीत | सिंगापुर और बीजिंग में होस्टेड WebSocket API। इसकी [मार्गदर्शिका](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) में 11 भाषाएं सूचीबद्ध हैं। | सिंगापुर: **$0.80/M टेक्स्ट इनपुट, $6.40/M ऑडियो इनपुट, $6.40/M टेक्स्ट आउटपुट और $24/M ऑडियो आउटपुट**। इसमें 50 ऑडियो टर्न या ऑडियो इतिहास के 300 सेकंड तक रखे जाते हैं। |
ये होस्टेड API उत्पाद हैं। BIG CHANGE को 3.1 मॉडल के डाउनलोड योग्य वेट या मॉडल-वेट लाइसेंस नहीं मिले। QwenAudio की GitHub रिपॉज़िटरी में MIT लाइसेंस परियोजना की वेबसाइट को कवर करता है; इसे मॉडल का लाइसेंस नहीं समझना चाहिए।
भाषाओं की गिनती भी दस्तावेज़ पर निर्भर करती है। Qwen की [सत्यापित लॉन्च पोस्ट](https://www.sina.cn/news/detail/5346330620985983.html) में ASR के लिए 30 भाषाएं और चीनी की 16 बोलियां बताई गई हैं; अंतरराष्ट्रीय API मार्गदर्शिका में 30 भाषाएं और 10 बोली-प्रकार हैं। डेवलपर को उसी एंडपॉइंट की सूची देखनी चाहिए जिसे वह सचमुच कॉल कर सकता है।
## 95% का दावा सार्वजनिक दर-तालिका से मेल नहीं खाता
Alibaba की [कीमत-बदलाव सूचना](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) 22 सितंबर से लागू हुई। उसकी सटीक तुलना नए 3.1 Realtime Plus के बजाय `qwen-audio-3.0-realtime-flash` के बारे में है। सिंगापुर की कटौती इस सूत्र से निकाली गई है: (पुरानी दर − नई दर) / पुरानी दर:
| Realtime Flash स्ट्रीम | पहले (USD) | बाद में (USD) | कमी |
| --- | --- | --- | --- |
| प्रति दस लाख टोकन टेक्स्ट इनपुट | $0.45 | $0.23 | 48.89% |
| प्रति दस लाख टोकन ऑडियो इनपुट | $4.50 | $0.93 | 79.33% |
| प्रति दस लाख टोकन टेक्स्ट आउटपुट | $4.50 | $0.70 | 84.44% |
| प्रति दस लाख टोकन आउटपुट (टेक्स्ट + ऑडियो) | $15.00 | $1.87 | **87.53%** |
इसी सूचना में 3.1 TTS Flash की कीमत हर 10,000 अक्षरों पर $0.15 से बदलकर अलग इनपुट और आउटपुट टोकन दरों में रखी गई है। [मौजूदा कीमत पृष्ठ](https://www.alibabacloud.com/help/en/model-studio/model-pricing) भी 3.1 ASR को इनपुट और आउटपुट टोकन के आधार पर सूचीबद्ध करता है, जबकि 3.0 ASR में हर ऑडियो सेकंड का शुल्क है और आउटपुट मुफ़्त है। इन दोनों में कटौती का प्रतिशत पाठ, ऑडियो अवधि और टोकनाइज़ेशन पर निर्भर करता है। इसलिए यहां देखी गई सार्वजनिक तालिकाओं से ASR में ठीक 95% कटौती दोहराकर नहीं निकाली जा सकती।
## स्वतंत्र प्रमाण अब भी Qwen 3.0 के लिए हैं
लॉन्च के दिन देखे गए स्रोतों में पांचों 3.1 मॉडलों का कोई स्वतंत्र परीक्षण उपलब्ध नहीं था। Qwen का अपना [ASR परियोजना पृष्ठ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) बेंचमार्क नतीजे देता है, लेकिन कहता है कि उनका स्वतंत्र रूप से दोबारा परीक्षण नहीं हुआ है।
Artificial Analysis की रैंकिंग में [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) सभी उच्चारणों और श्रेणियों वाले प्रदाता-वॉइस एरिना में दूसरे स्थान पर है: 1,259 Elo, 95% विश्वास-अंतराल प्लस या माइनस 17 और 1,447 अंध-तुलना नमूनों के साथ। अलग [वाक्-एजेंट एरिना](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) में Qwen Audio 3.0 Realtime Plus का पसंदगी Elo 699 और पहली ऑडियो तक का समय 1.54 सेकंड था। इसमें प्रतिभागी तय परिदृश्यों वाली लाइव बातचीत में छिपे हुए मॉडलों की तुलना करते हैं।
## Sources
- [Alibaba ने पांच नए मॉडलों के साथ Qwen Audio 3.1 लॉन्च किया](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — पांच-मॉडल रिलीज़ का खोजपरक विवरण; इसमें TTS, रियल-टाइम ऑडियो और ASR की लगभग कीमत-कटौतियों को Qwen के नाम से बताया गया है। BIG CHANGE ने दरों की जांच Alibaba की अपनी तालिकाओं से की।
- [Qwen Audio 3.1 लॉन्च पोस्ट](https://www.sina.cn/news/detail/5346330620985983.html) — Qwen के सत्यापित खाते की पोस्ट, जिसमें पांच मॉडल और उनके इच्छित काम दिए गए हैं। क्षमता और गति संबंधी कथन विक्रेता के दावे हैं।
- [चुने गए ऑडियो मॉडलों के लिए Model Studio की कीमत-कटौती सूचना](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 22 सितंबर का आधिकारिक कीमत-बदलाव: 3.0 Realtime Flash की सिंगापुर दरें पहले और बाद में, तथा 3.1 TTS Flash में बिलिंग इकाई का बदलाव।
- [Model Studio मॉडल कीमतें](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — क्षेत्र और माध्यम के अनुसार मौजूदा आधिकारिक कीमतें, जिनमें 3.1 ASR और Realtime Plus शामिल हैं।
- [QwenCloud वाक्-से-पाठ मॉडल](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — मौजूदा ASR एंडपॉइंट ID, पहुंच के तरीके, भाषाओं की सूची, वक्ता-पहचान समर्थन और अवधि-सीमाएं।
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — मौजूदा 3.1 Realtime Plus WebSocket उदाहरण, आवाज़ और भाषा समर्थन तथा बातचीत को सहेजने की सीमाएं।
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — केवल बीजिंग में उपलब्ध आधिकारिक API, कीमतें, भाषाएं, इनपुट लंबाई और आउटपुट अवधि की सीमाएं।
- [Qwen Audio 3.1 ASR परियोजना पृष्ठ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR और ASR-Next क्षमताओं तथा विक्रेता द्वारा बताए बेंचमार्क का अपरिवर्तनीय Qwen परियोजना पृष्ठ; इसमें कहा गया है कि नतीजे स्वतंत्र रूप से दोहराए नहीं गए।
- [Artificial Analysis टेक्स्ट-टू-स्पीच लीडरबोर्ड](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — पिछले मॉडल Qwen Audio 3.0 TTS Plus का अंध-पसंद नतीजा, जिसमें नमूनों की संख्या और विश्वास-अंतराल शामिल हैं।
- [Artificial Analysis वाक्-एजेंट एरिना](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — पिछले Qwen Audio 3.0 Realtime Plus की अलग पसंदगी और पहली ऑडियो तक समय का नतीजा; यह 3.1 का मूल्यांकन नहीं है।
- [आवाज़-क्लोनिंग HTTP API संदर्भ](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — मौजूदा लक्षित-मॉडल उदाहरणों में 3.0 TTS Flash का नाम है। वे 3.1 संश्लेषण को एकीकृत करने का स्वतंत्र प्रमाण नहीं देते।
BIG CHANGE न्यूज़लेटर
बड़ी तस्वीर। आपकी गति से।
AI और रोबोटिक्स पर ताज़ा लेख, ध्यान देने योग्य बदलाव और उपयोगी विचार। दैनिक ब्रीफ़िंग, साप्ताहिक सारांश या मासिक परिप्रेक्ष्य चुनें।
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
आपकी गोपनीयता, आपकी पसंद।
ज़रूरी स्टोरेज साइट की सुरक्षा में मदद करता है और आपकी पसंद याद रखता है। आपकी अनुमति मिलने तक वैकल्पिक Google Analytics बंद रहता है। आप हर लेख केवल आवश्यक स्टोरेज के साथ पढ़ सकते हैं। गोपनीयता का विवरण