Alibaba च्या Qwen टीमने प्रतिलेखन, वाणी-निर्मिती आणि थेट व्हॉइस संवाद यांचा समावेश असलेली Qwen Audio 3.1 ची पाच मॉडेल्स सादर केली आहेत. ASR, TTS-Next आणि Realtime Plus साठी होस्टेड एंडपॉइंट्सचे दस्तऐवजीकरण उपलब्ध आहे. TTS Flash साठी मॉडेल ID आणि किंमत प्रकाशित झाली आहे, मात्र इंटिग्रेशनचे दस्तऐवजीकरण कमी पूर्ण आहे; BIG CHANGE ने तपासलेल्या सार्वजनिक डेव्हलपर दस्तऐवजांत ASR-Next साठी मॉडेल ID, प्रदेश किंवा किंमत दिलेली नाही.
The Decoder ने वृत्त दिले Qwen ने मजकूर-वाणी रूपांतरणासाठी सुमारे ७०%, रिअल-टाइम ऑडिओसाठी ८५% आणि वाणी-ओळखीसाठी ९५% पर्यंत दरकपात जाहीर केली आहे. या आकड्यांची पडताळणी करताना बिलिंगची एकके महत्त्वाची ठरतात.
मोठा बदल
- काय बदलले: Qwen आता एका होस्टेड मॉडेल-कुटुंबात व्हॉइस उत्पादनाचे अधिक पैलू समाविष्ट करते—प्रतिलेखन आणि तयार केलेल्या वाणीपासून ध्वनी-दृश्यनिर्मिती व थेट संभाषणापर्यंत. मात्र या पाच घटकांसाठी डेव्हलपर प्रवेशाचे दस्तऐवजीकरण अद्याप समान प्रमाणात पूर्ण नाही.
- हे का महत्त्वाचे: प्रतिलेखन किंवा व्हॉइस सेवा बजेटमध्ये बसवणाऱ्या डेव्हलपरसाठी, प्रत्येक एंडपॉइंटची किंमत ठरवताना केवळ ऑडिओचा कालावधी पुरेसा राहिलेला नाही. टोकन-आधारित ASR बिलिंगमध्ये येणारा ऑडिओ आणि त्यातून तयार होणारा मजकूर या दोन्हींचे शुल्क असते; थेट संभाषणासाठी चार स्वतंत्र दरांची स्ट्रीम्स आहेत.
- कशाकडे लक्ष द्यावे: ASR-Next चा प्रवेश उपलब्ध होण्याबरोबरच, स्वतंत्र भाषा आणि विलंब-काल चाचण्या उपयुक्त बचत सिद्ध करतात का ते पाहा. तसे झाल्यास, व्हॉइस-एजंट, प्रतिलेखन आणि डबिंग सेवा पुरवठादार ही बचत ग्राहकांना देतात का आणि प्रतिस्पर्धी वाणी API त्यानुसार दर बदलतात का, हा व्यापक प्रश्न असेल.
पाच मॉडेल्सचा आढावा
जाहीर केलेले मॉडेल | अपेक्षित काम | २३ सप्टेंबर रोजी दस्तऐवजीकृत प्रवेश | किंमत आणि व्यावहारिक मर्यादा |
|---|---|---|---|
Qwen Audio 3.1 ASR | स्ट्रीमिंग, फाइल आणि लघु-स्वरूप प्रतिलेखन; फाइल व लघु-स्वरूप एंडपॉइंट्सवर पर्यायी वक्ता-विभाजन | सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket किंवा HTTP API. आंतरराष्ट्रीय मार्गदर्शक ३० भाषा आणि चिनी भाषेच्या १० बोली-प्रकारांची यादी देतो. | सिंगापूरमध्ये दर $0.15/M ऑडिओ-इनपुट टोकन्स + $0.47/M मजकूर-आउटपुट टोकन्स फाइल/लघु-स्वरूपासाठी ते $0.93 + $0.70 स्ट्रीमिंग/मेसेजसाठी आहेत. फाइल प्रतिलेखनाची मर्यादा १२ तास/२GB; लघु-स्वरूपाची ५ मिनिटे/२GB आहे. |
Qwen Audio 3.1 ASR-Next | वक्त्याची ओळख आणि टाइमस्टॅम्प्स, तसेच भावना, सभोवतालच्या घटना आणि यंत्रांचे आवाज ओळखणे | Qwen ने जाहीर केले; सध्याच्या Model Studio आणि QwenCloud दस्तऐवजांत सार्वजनिक API मॉडेल ID, प्रदेश, दर किंवा मर्यादा आढळली नाही | सार्वजनिक दस्तऐवजीकरण उपलब्ध नाही |
Qwen Audio 3.1 TTS | बहुभाषिक वाणी, भाषांमधील व्हॉइस ट्रान्सफर आणि बोलण्याच्या शैलीवर प्रॉम्प्टद्वारे नियंत्रण | | सिंगापूर: $0.23/M मजकूर-इनपुट टोकन्स + $1.87/M ऑडिओ-आउटपुट टोकन्स. तपासलेल्या 3.1 दस्तऐवजांत सध्याच्या सार्वजनिक मर्यादा दिलेल्या नाहीत. |
Qwen Audio 3.1 TTS-Next | वाणी, ध्वनी-प्रभाव आणि पार्श्वध्वनी यांची संयुक्त निर्मिती | बीजिंगमध्ये होस्टेड, नॉन-स्ट्रीमिंग HTTPS API; चिनी आणि इंग्रजी भाषांसाठी दस्तऐवजीकृत | $0.848/M इनपुट टोकन्स + $1.696/M आउटपुट टोकन्स. इनपुटची कमाल मर्यादा ३,००० अक्षरे; पॉडकास्ट आउटपुटसाठी चार मिनिटे, इतरांसाठी दोन मिनिटे. |
Qwen Audio 3.1 Realtime Plus | मध्ये व्यत्यय स्वीकारणे आणि टूल कॉल्ससह फुल-डुप्लेक्स व्हॉइस संभाषण | सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket API. मार्गदर्शक ११ भाषांची यादी देतो. | सिंगापूर: $0.80/M मजकूर इनपुट, $6.40/M ऑडिओ इनपुट, $6.40/M मजकूर आउटपुट आणि $24/M ऑडिओ आउटपुट. यात ऑडिओचे ५० संवाद-टप्पे किंवा ३०० सेकंदांचा ऑडिओ इतिहास साठवता येतो. |
ही होस्टेड API उत्पादने आहेत. BIG CHANGE ला डाउनलोड करता येतील असे 3.1 मॉडेल-वेट्स किंवा त्यांचा परवाना आढळला नाही. QwenAudio च्या GitHub रिपॉझिटरीतील MIT परवाना प्रकल्पाच्या वेबसाइटसाठी आहे; तो मॉडेल्सचा परवाना समजू नये.
भाषांची संख्या कोणता दस्तऐवज पाहता यावरही अवलंबून आहे. Qwen च्या पडताळलेल्या लाँच पोस्टमध्ये ASR साठी ३० भाषा आणि चिनी भाषेच्या १६ बोली असल्याचे म्हटले आहे; आंतरराष्ट्रीय API मार्गदर्शकात ३० भाषा आणि १० बोली-प्रकार दिले आहेत. डेव्हलपरनी प्रत्यक्ष वापरता येणाऱ्या एंडपॉइंटला जोडलेली यादी पाहावी.
९५% चा दावा सार्वजनिक दरतक्त्याशी जुळत नाही
Alibaba ची दरबदलाची सूचना २२ सप्टेंबरपासून लागू झाली. तिची अचूक तुलना qwen-audio-3.0-realtime-flash नवीन 3.1 Realtime Plus ऐवजी 3.0 Realtime Flash ची आहे. सिंगापूरमधील कपात (जुना दर − नवा दर) / जुना दर या सूत्राने मोजली आहे:
Realtime Flash स्ट्रीम | आधी (USD) | नंतर (USD) | कपात |
|---|---|---|---|
दहा लाख टोकन्समागे मजकूर इनपुट | $0.45 | $0.23 | 48.89% |
दहा लाख टोकन्समागे ऑडिओ इनपुट | $4.50 | $0.93 | 79.33% |
दहा लाख टोकन्समागे मजकूर आउटपुट | $4.50 | $0.70 | 84.44% |
दहा लाख टोकन्समागे आउटपुट (मजकूर + ऑडिओ) | $15.00 | $1.87 | 87.53% |
याच सूचनेनुसार 3.1 TTS Flash चे दर १०,००० अक्षरांमागे $0.15 वरून स्वतंत्र इनपुट आणि आउटपुट टोकन-दरांत बदलतात. सध्याच्या किंमत-पृष्ठावर 3.1 ASR चे दरही इनपुट आणि आउटपुट टोकननुसार दिले आहेत, तर 3.0 ASR मध्ये प्रत्येक ऑडिओ-सेकंदासाठी शुल्क असून आउटपुट मोफत आहे. या दोन्ही जोड्यांमधील टक्केवारी मजकूर, ऑडिओचा कालावधी आणि टोकन-विभाजनावर अवलंबून असते. त्यामुळे येथे तपासलेल्या सार्वजनिक दरतक्त्यांतून ASR साठी नेमकी ९५% दरकपात सिद्ध होत नाही.
स्वतंत्र पुरावे अद्याप Qwen 3.0 शी संबंधित आहेत
लाँचच्या दिवशी तपासलेल्या स्रोतांमध्ये पाचही 3.1 मॉडेल्सची स्वतंत्र चाचणी उपलब्ध नव्हती. Qwen चे स्वतःचे ASR प्रकल्प-पृष्ठ बेंचमार्कचे निकाल देते, पण ते स्वतंत्रपणे पुन्हा तपासले गेले नसल्याचेही नमूद करते.
Artificial Analysis च्या क्रमवारीत Qwen Audio 3.0 TTS Plus सर्व उच्चार आणि श्रेणींचा समावेश असलेल्या पुरवठादार-व्हॉइस स्पर्धेत १,२५९ Elo गुणांसह दुसऱ्या क्रमांकावर आहे; ९५% विश्वास-अंतर ±१७ आणि अंध तुलनेचे १,४४७ नमुने होते. स्वतंत्र स्पीच-एजंट स्पर्धेत Qwen Audio 3.0 Realtime Plus ला ६९९ प्राधान्य Elo गुण आणि पहिला ऑडिओ ऐकू येण्यासाठी १.५४ सेकंद लागले. त्यात सहभागी दिलेल्या प्रसंगांनुसार थेट संभाषणांत लपवलेली मॉडेल्स तुलना करतात.



