Alibaba की Qwen टीम ने ट्रांसक्रिप्शन, वाक्-निर्माण और लाइव आवाज़ी संवाद वाले पांच Qwen Audio 3.1 मॉडल पेश किए हैं। ASR, TTS-Next और Realtime Plus के होस्टेड एंडपॉइंट का दस्तावेज़ीकरण उपलब्ध है। TTS Flash का मॉडल ID और कीमत प्रकाशित है, लेकिन एकीकरण का दस्तावेज़ अधूरा है; BIG CHANGE द्वारा देखे गए सार्वजनिक डेवलपर दस्तावेज़ों में ASR-Next का मॉडल ID, क्षेत्र या कीमत नहीं है।

The Decoder ने रिपोर्ट किया कि Qwen ने टेक्स्ट-टू-स्पीच में लगभग 70%, रियल-टाइम ऑडियो में 85% और वाक्-पहचान में 95% तक कीमतें घटाने का दावा किया। इन आंकड़ों को परखते समय बिलिंग इकाइयां मायने रखती हैं।

बड़ा बदलाव

  • क्या बदला: Qwen अब एक ही होस्टेड परिवार में आवाज़ वाले उत्पाद की अधिक जरूरतें पूरी करता है: ट्रांसक्रिप्शन और तैयार भाषण से लेकर ध्वनि-दृश्य निर्माण तथा लाइव बातचीत तक। उसके पांचों घटकों के लिए डेवलपर पहुंच का दस्तावेज़ समान रूप से पूरा नहीं है।
  • यह क्यों मायने रखता है: ट्रांसक्रिप्शन या वॉइस सेवा का बजट बनाने वाले डेवलपर हर एंडपॉइंट की कीमत केवल ऑडियो के मिनट से नहीं तय कर सकते। टोकन के आधार पर ASR बिल में आने वाला ऑडियो और उससे निकला पाठ, दोनों शामिल होते हैं; लाइव संवाद में चार अलग-अलग स्ट्रीम की कीमतें हैं।
  • क्या देखना है: ASR-Next की उपलब्धता के साथ देखें कि स्वतंत्र भाषा और विलंबता परीक्षण उपयोगी बचत की पुष्टि करते हैं या नहीं। यदि ऐसा होता है, तो अगला सवाल होगा कि वॉइस-एजेंट, ट्रांसक्रिप्शन और डबिंग प्रदाता यह बचत ग्राहकों तक पहुंचाते हैं या नहीं और प्रतिस्पर्धी वाक्-API भी कीमत घटाते हैं या नहीं।

पांच मॉडलों का खाका

घोषित मॉडल

इच्छित काम

23 सितंबर को दस्तावेज़ में दर्ज पहुंच

कीमत और व्यावहारिक सीमा

Qwen Audio 3.1 ASR

स्ट्रीमिंग, फ़ाइल और छोटे ऑडियो का ट्रांसक्रिप्शन; फ़ाइल और छोटे ऑडियो एंडपॉइंट पर वैकल्पिक वक्ता-पहचान

सिंगापुर और बीजिंग में होस्टेड WebSocket या HTTP API। अंतरराष्ट्रीय मार्गदर्शिका में 30 भाषाएं और चीनी की 10 बोली-प्रकार सूचीबद्ध हैं।

सिंगापुर में फ़ाइल/छोटे ऑडियो ट्रांसक्रिप्शन की दरें $0.15/M ऑडियो-इनपुट टोकन + $0.47/M टेक्स्ट-आउटपुट टोकन से लेकर स्ट्रीमिंग/संदेशों के लिए $0.93 + $0.70 तक हैं। फ़ाइल ट्रांसक्रिप्शन की सीमा 12 घंटे/2GB और छोटे ऑडियो की 5 मिनट/2GB है।

Qwen Audio 3.1 ASR-Next

वक्ता की पहचान और टाइमस्टैम्प; भावनाओं, आसपास की घटनाओं और मशीन की आवाज़ों की पहचान

Qwen ने इसकी घोषणा की है; मौजूदा Model Studio और QwenCloud दस्तावेज़ों में सार्वजनिक API मॉडल ID, क्षेत्र, दर या सीमा नहीं मिली।

सार्वजनिक दस्तावेज़ उपलब्ध नहीं

Qwen Audio 3.1 TTS

बहुभाषी वाक्, भाषाओं के पार आवाज़ का रूपांतरण और बोलने के ढंग पर प्रॉम्प्ट का नियंत्रण

qwen-audio-3.1-tts-flash का नाम Alibaba की कीमत-सूचना में है। समीक्षा किया गया आवाज़-क्लोनिंग API अब भी 3.0 TTS Flash का नाम बताता है।

सिंगापुर: $0.23/M टेक्स्ट-इनपुट टोकन + $1.87/M ऑडियो-आउटपुट टोकन. समीक्षा की गई 3.1 सामग्री में मौजूदा सार्वजनिक सीमाएं नहीं बताई गईं।

Qwen Audio 3.1 TTS-Next

भाषण, ध्वनि-प्रभाव और पृष्ठभूमि ऑडियो एक साथ बनाना

बीजिंग में होस्टेड, नॉन-स्ट्रीमिंग HTTPS API; चीनी और अंग्रेज़ी के लिए दस्तावेज़ उपलब्ध

$0.848/M इनपुट टोकन + $1.696/M आउटपुट टोकन। इनपुट की सीमा 3,000 अक्षर तक; पॉडकास्ट आउटपुट चार मिनट और अन्य आउटपुट दो मिनट तक।

Qwen Audio 3.1 Realtime Plus

बीच में रोकने और टूल कॉल करने की सुविधा वाली फुल-डुप्लेक्स आवाज़ी बातचीत

सिंगापुर और बीजिंग में होस्टेड WebSocket API। इसकी मार्गदर्शिका में 11 भाषाएं सूचीबद्ध हैं।

सिंगापुर: $0.80/M टेक्स्ट इनपुट, $6.40/M ऑडियो इनपुट, $6.40/M टेक्स्ट आउटपुट और $24/M ऑडियो आउटपुट। इसमें 50 ऑडियो टर्न या ऑडियो इतिहास के 300 सेकंड तक रखे जाते हैं।

ये होस्टेड API उत्पाद हैं। BIG CHANGE को 3.1 मॉडल के डाउनलोड योग्य वेट या मॉडल-वेट लाइसेंस नहीं मिले। QwenAudio की GitHub रिपॉज़िटरी में MIT लाइसेंस परियोजना की वेबसाइट को कवर करता है; इसे मॉडल का लाइसेंस नहीं समझना चाहिए।

भाषाओं की गिनती भी दस्तावेज़ पर निर्भर करती है। Qwen की सत्यापित लॉन्च पोस्ट में ASR के लिए 30 भाषाएं और चीनी की 16 बोलियां बताई गई हैं; अंतरराष्ट्रीय API मार्गदर्शिका में 30 भाषाएं और 10 बोली-प्रकार हैं। डेवलपर को उसी एंडपॉइंट की सूची देखनी चाहिए जिसे वह सचमुच कॉल कर सकता है।

95% का दावा सार्वजनिक दर-तालिका से मेल नहीं खाता

Alibaba की कीमत-बदलाव सूचना 22 सितंबर से लागू हुई। उसकी सटीक तुलना नए 3.1 Realtime Plus के बजाय qwen-audio-3.0-realtime-flash के बारे में है। सिंगापुर की कटौती इस सूत्र से निकाली गई है: (पुरानी दर − नई दर) / पुरानी दर:

Realtime Flash स्ट्रीम

पहले (USD)

बाद में (USD)

कमी

प्रति दस लाख टोकन टेक्स्ट इनपुट

$0.45

$0.23

48.89%

प्रति दस लाख टोकन ऑडियो इनपुट

$4.50

$0.93

79.33%

प्रति दस लाख टोकन टेक्स्ट आउटपुट

$4.50

$0.70

84.44%

प्रति दस लाख टोकन आउटपुट (टेक्स्ट + ऑडियो)

$15.00

$1.87

87.53%

इसी सूचना में 3.1 TTS Flash की कीमत हर 10,000 अक्षरों पर $0.15 से बदलकर अलग इनपुट और आउटपुट टोकन दरों में रखी गई है। मौजूदा कीमत पृष्ठ भी 3.1 ASR को इनपुट और आउटपुट टोकन के आधार पर सूचीबद्ध करता है, जबकि 3.0 ASR में हर ऑडियो सेकंड का शुल्क है और आउटपुट मुफ़्त है। इन दोनों में कटौती का प्रतिशत पाठ, ऑडियो अवधि और टोकनाइज़ेशन पर निर्भर करता है। इसलिए यहां देखी गई सार्वजनिक तालिकाओं से ASR में ठीक 95% कटौती दोहराकर नहीं निकाली जा सकती।

स्वतंत्र प्रमाण अब भी Qwen 3.0 के लिए हैं

लॉन्च के दिन देखे गए स्रोतों में पांचों 3.1 मॉडलों का कोई स्वतंत्र परीक्षण उपलब्ध नहीं था। Qwen का अपना ASR परियोजना पृष्ठ बेंचमार्क नतीजे देता है, लेकिन कहता है कि उनका स्वतंत्र रूप से दोबारा परीक्षण नहीं हुआ है।

Artificial Analysis की रैंकिंग में Qwen Audio 3.0 TTS Plus सभी उच्चारणों और श्रेणियों वाले प्रदाता-वॉइस एरिना में दूसरे स्थान पर है: 1,259 Elo, 95% विश्वास-अंतराल प्लस या माइनस 17 और 1,447 अंध-तुलना नमूनों के साथ। अलग वाक्-एजेंट एरिना में Qwen Audio 3.0 Realtime Plus का पसंदगी Elo 699 और पहली ऑडियो तक का समय 1.54 सेकंड था। इसमें प्रतिभागी तय परिदृश्यों वाली लाइव बातचीत में छिपे हुए मॉडलों की तुलना करते हैं।