Alibaba च्या Qwen टीमने प्रतिलेखन, वाणी-निर्मिती आणि थेट व्हॉइस संवाद यांचा समावेश असलेली Qwen Audio 3.1 ची पाच मॉडेल्स सादर केली आहेत. ASR, TTS-Next आणि Realtime Plus साठी होस्टेड एंडपॉइंट्सचे दस्तऐवजीकरण उपलब्ध आहे. TTS Flash साठी मॉडेल ID आणि किंमत प्रकाशित झाली आहे, मात्र इंटिग्रेशनचे दस्तऐवजीकरण कमी पूर्ण आहे; BIG CHANGE ने तपासलेल्या सार्वजनिक डेव्हलपर दस्तऐवजांत ASR-Next साठी मॉडेल ID, प्रदेश किंवा किंमत दिलेली नाही.

The Decoder ने वृत्त दिले Qwen ने मजकूर-वाणी रूपांतरणासाठी सुमारे ७०%, रिअल-टाइम ऑडिओसाठी ८५% आणि वाणी-ओळखीसाठी ९५% पर्यंत दरकपात जाहीर केली आहे. या आकड्यांची पडताळणी करताना बिलिंगची एकके महत्त्वाची ठरतात.

मोठा बदल

  • काय बदलले: Qwen आता एका होस्टेड मॉडेल-कुटुंबात व्हॉइस उत्पादनाचे अधिक पैलू समाविष्ट करते—प्रतिलेखन आणि तयार केलेल्या वाणीपासून ध्वनी-दृश्यनिर्मिती व थेट संभाषणापर्यंत. मात्र या पाच घटकांसाठी डेव्हलपर प्रवेशाचे दस्तऐवजीकरण अद्याप समान प्रमाणात पूर्ण नाही.
  • हे का महत्त्वाचे: प्रतिलेखन किंवा व्हॉइस सेवा बजेटमध्ये बसवणाऱ्या डेव्हलपरसाठी, प्रत्येक एंडपॉइंटची किंमत ठरवताना केवळ ऑडिओचा कालावधी पुरेसा राहिलेला नाही. टोकन-आधारित ASR बिलिंगमध्ये येणारा ऑडिओ आणि त्यातून तयार होणारा मजकूर या दोन्हींचे शुल्क असते; थेट संभाषणासाठी चार स्वतंत्र दरांची स्ट्रीम्स आहेत.
  • कशाकडे लक्ष द्यावे: ASR-Next चा प्रवेश उपलब्ध होण्याबरोबरच, स्वतंत्र भाषा आणि विलंब-काल चाचण्या उपयुक्त बचत सिद्ध करतात का ते पाहा. तसे झाल्यास, व्हॉइस-एजंट, प्रतिलेखन आणि डबिंग सेवा पुरवठादार ही बचत ग्राहकांना देतात का आणि प्रतिस्पर्धी वाणी API त्यानुसार दर बदलतात का, हा व्यापक प्रश्न असेल.

पाच मॉडेल्सचा आढावा

जाहीर केलेले मॉडेल

अपेक्षित काम

२३ सप्टेंबर रोजी दस्तऐवजीकृत प्रवेश

किंमत आणि व्यावहारिक मर्यादा

Qwen Audio 3.1 ASR

स्ट्रीमिंग, फाइल आणि लघु-स्वरूप प्रतिलेखन; फाइल व लघु-स्वरूप एंडपॉइंट्सवर पर्यायी वक्ता-विभाजन

सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket किंवा HTTP API. आंतरराष्ट्रीय मार्गदर्शक ३० भाषा आणि चिनी भाषेच्या १० बोली-प्रकारांची यादी देतो.

सिंगापूरमध्ये दर $0.15/M ऑडिओ-इनपुट टोकन्स + $0.47/M मजकूर-आउटपुट टोकन्स फाइल/लघु-स्वरूपासाठी ते $0.93 + $0.70 स्ट्रीमिंग/मेसेजसाठी आहेत. फाइल प्रतिलेखनाची मर्यादा १२ तास/२GB; लघु-स्वरूपाची ५ मिनिटे/२GB आहे.

Qwen Audio 3.1 ASR-Next

वक्त्याची ओळख आणि टाइमस्टॅम्प्स, तसेच भावना, सभोवतालच्या घटना आणि यंत्रांचे आवाज ओळखणे

Qwen ने जाहीर केले; सध्याच्या Model Studio आणि QwenCloud दस्तऐवजांत सार्वजनिक API मॉडेल ID, प्रदेश, दर किंवा मर्यादा आढळली नाही

सार्वजनिक दस्तऐवजीकरण उपलब्ध नाही

Qwen Audio 3.1 TTS

बहुभाषिक वाणी, भाषांमधील व्हॉइस ट्रान्सफर आणि बोलण्याच्या शैलीवर प्रॉम्प्टद्वारे नियंत्रण

qwen-audio-3.1-tts-flash Alibaba च्या किंमत-सूचनेत नमूद आहे. तपासलेल्या व्हॉइस-क्लोनिंग API मध्ये अद्याप 3.0 TTS Flash चाच उल्लेख आहे.

सिंगापूर: $0.23/M मजकूर-इनपुट टोकन्स + $1.87/M ऑडिओ-आउटपुट टोकन्स. तपासलेल्या 3.1 दस्तऐवजांत सध्याच्या सार्वजनिक मर्यादा दिलेल्या नाहीत.

Qwen Audio 3.1 TTS-Next

वाणी, ध्वनी-प्रभाव आणि पार्श्वध्वनी यांची संयुक्त निर्मिती

बीजिंगमध्ये होस्टेड, नॉन-स्ट्रीमिंग HTTPS API; चिनी आणि इंग्रजी भाषांसाठी दस्तऐवजीकृत

$0.848/M इनपुट टोकन्स + $1.696/M आउटपुट टोकन्स. इनपुटची कमाल मर्यादा ३,००० अक्षरे; पॉडकास्ट आउटपुटसाठी चार मिनिटे, इतरांसाठी दोन मिनिटे.

Qwen Audio 3.1 Realtime Plus

मध्ये व्यत्यय स्वीकारणे आणि टूल कॉल्ससह फुल-डुप्लेक्स व्हॉइस संभाषण

सिंगापूर आणि बीजिंगमध्ये होस्टेड WebSocket API. मार्गदर्शक ११ भाषांची यादी देतो.

सिंगापूर: $0.80/M मजकूर इनपुट, $6.40/M ऑडिओ इनपुट, $6.40/M मजकूर आउटपुट आणि $24/M ऑडिओ आउटपुट. यात ऑडिओचे ५० संवाद-टप्पे किंवा ३०० सेकंदांचा ऑडिओ इतिहास साठवता येतो.

ही होस्टेड API उत्पादने आहेत. BIG CHANGE ला डाउनलोड करता येतील असे 3.1 मॉडेल-वेट्स किंवा त्यांचा परवाना आढळला नाही. QwenAudio च्या GitHub रिपॉझिटरीतील MIT परवाना प्रकल्पाच्या वेबसाइटसाठी आहे; तो मॉडेल्सचा परवाना समजू नये.

भाषांची संख्या कोणता दस्तऐवज पाहता यावरही अवलंबून आहे. Qwen च्या पडताळलेल्या लाँच पोस्टमध्ये ASR साठी ३० भाषा आणि चिनी भाषेच्या १६ बोली असल्याचे म्हटले आहे; आंतरराष्ट्रीय API मार्गदर्शकात ३० भाषा आणि १० बोली-प्रकार दिले आहेत. डेव्हलपरनी प्रत्यक्ष वापरता येणाऱ्या एंडपॉइंटला जोडलेली यादी पाहावी.

९५% चा दावा सार्वजनिक दरतक्त्याशी जुळत नाही

Alibaba ची दरबदलाची सूचना २२ सप्टेंबरपासून लागू झाली. तिची अचूक तुलना qwen-audio-3.0-realtime-flash नवीन 3.1 Realtime Plus ऐवजी 3.0 Realtime Flash ची आहे. सिंगापूरमधील कपात (जुना दर − नवा दर) / जुना दर या सूत्राने मोजली आहे:

Realtime Flash स्ट्रीम

आधी (USD)

नंतर (USD)

कपात

दहा लाख टोकन्समागे मजकूर इनपुट

$0.45

$0.23

48.89%

दहा लाख टोकन्समागे ऑडिओ इनपुट

$4.50

$0.93

79.33%

दहा लाख टोकन्समागे मजकूर आउटपुट

$4.50

$0.70

84.44%

दहा लाख टोकन्समागे आउटपुट (मजकूर + ऑडिओ)

$15.00

$1.87

87.53%

याच सूचनेनुसार 3.1 TTS Flash चे दर १०,००० अक्षरांमागे $0.15 वरून स्वतंत्र इनपुट आणि आउटपुट टोकन-दरांत बदलतात. सध्याच्या किंमत-पृष्ठावर 3.1 ASR चे दरही इनपुट आणि आउटपुट टोकननुसार दिले आहेत, तर 3.0 ASR मध्ये प्रत्येक ऑडिओ-सेकंदासाठी शुल्क असून आउटपुट मोफत आहे. या दोन्ही जोड्यांमधील टक्केवारी मजकूर, ऑडिओचा कालावधी आणि टोकन-विभाजनावर अवलंबून असते. त्यामुळे येथे तपासलेल्या सार्वजनिक दरतक्त्यांतून ASR साठी नेमकी ९५% दरकपात सिद्ध होत नाही.

स्वतंत्र पुरावे अद्याप Qwen 3.0 शी संबंधित आहेत

लाँचच्या दिवशी तपासलेल्या स्रोतांमध्ये पाचही 3.1 मॉडेल्सची स्वतंत्र चाचणी उपलब्ध नव्हती. Qwen चे स्वतःचे ASR प्रकल्प-पृष्ठ बेंचमार्कचे निकाल देते, पण ते स्वतंत्रपणे पुन्हा तपासले गेले नसल्याचेही नमूद करते.

Artificial Analysis च्या क्रमवारीत Qwen Audio 3.0 TTS Plus सर्व उच्चार आणि श्रेणींचा समावेश असलेल्या पुरवठादार-व्हॉइस स्पर्धेत १,२५९ Elo गुणांसह दुसऱ्या क्रमांकावर आहे; ९५% विश्वास-अंतर ±१७ आणि अंध तुलनेचे १,४४७ नमुने होते. स्वतंत्र स्पीच-एजंट स्पर्धेत Qwen Audio 3.0 Realtime Plus ला ६९९ प्राधान्य Elo गुण आणि पहिला ऑडिओ ऐकू येण्यासाठी १.५४ सेकंद लागले. त्यात सहभागी दिलेल्या प्रसंगांनुसार थेट संभाषणांत लपवलेली मॉडेल्स तुलना करतात.