Alibaba-র Qwen দল transcription, speech generation ও সরাসরি voice interaction-জুড়ে পাঁচটি Qwen Audio 3.1 model এনেছে। ASR, TTS-Next ও Realtime Plus-এর hosted endpoint নথিবদ্ধ আছে। TTS Flash-এর model ID ও দাম প্রকাশিত, তবে integration-এর নথি তুলনায় অসম্পূর্ণ; BIG CHANGE যে public developer document পর্যালোচনা করেছে, তাতে ASR-Next-এর model ID, region বা দাম নেই।
The Decoder-এর প্রতিবেদন অনুযায়ী, Qwen text-to-speech-এ আনুমানিক ৭০%, realtime audio-তে ৮৫% এবং speech recognition-এ সর্বোচ্চ ৯৫% দাম কমার কথা প্রচার করেছে। এই অঙ্ক যাচাইয়ে billing unit গুরুত্বপূর্ণ।
বড় পরিবর্তন
- কী বদলেছে: Qwen এখন এক hosted model family-র মধ্যে voice পণ্যের আরও অংশ এনেছে: transcription ও তৈরি করা speech থেকে শব্দের পরিবেশ তৈরি এবং সরাসরি কথোপকথন পর্যন্ত। তবে পাঁচটি উপাদানের developer access এখনও সমানভাবে সম্পূর্ণ নয়।
- কেন গুরুত্বপূর্ণ: transcription বা voice service-এর বাজেট করা developer-দের জন্য সব endpoint-এর দাম নির্ধারণে অডিওর মিনিট একা যথেষ্ট নয়। token-ভিত্তিক ASR billing-এ আসা audio ও তৈরি হওয়া text—দুটিই ধরা হয়; live conversation-এ চারটি stream-এর দাম আলাদাভাবে নির্ধারিত।
- কী লক্ষ করবেন: ASR-Next access-এর পাশাপাশি স্বাধীন ভাষা ও latency পরীক্ষা বাস্তব সাশ্রয় দেখায় কি না, দেখুন। দেখালে পরের প্রশ্ন: voice-agent, transcription ও dubbing provider-রা এই সাশ্রয় গ্রাহকের দামে পৌঁছে দেবে কি না এবং প্রতিদ্বন্দ্বী speech API-রাও একই পথে যাবে কি না।
পাঁচটি model এক নজরে
ঘোষিত model | উদ্দেশ্য | ২৩ সেপ্টেম্বর পর্যন্ত নথিভুক্ত access | দাম ও ব্যবহারিক সীমা |
|---|---|---|---|
Qwen Audio 3.1 ASR | streaming, file ও short-form transcription; file ও short-form endpoint-এ ঐচ্ছিক speaker diarization | Singapore ও Beijing-এ hosted WebSocket বা HTTP API। আন্তর্জাতিক guide-এ ৩০টি language এবং চীনা ভাষার ১০টি উপভাষার ধরন তালিকাভুক্ত। | Singapore-এ file/short-form-এর জন্য প্রতি মিলিয়ন audio-input token-এ $0.15 + প্রতি মিলিয়ন text-output token-এ $0.47; streaming/message-এর ক্ষেত্রে $0.93 + $0.70; file transcription-এ সর্বোচ্চ ১২ ঘণ্টা/২ GB; short-form-এ ৫ মিনিট/২ GB। |
Qwen Audio 3.1 ASR-Next | speaker attribution ও timestamp-এর পাশাপাশি emotion, চারপাশের ঘটনা এবং যন্ত্রের শব্দ শনাক্ত করা | Qwen ঘোষণা করেছে; বর্তমান Model Studio ও QwenCloud নথিতে public API model ID, region, rate বা সীমা পাওয়া যায়নি | public নথিতে দাম বা সীমা নেই |
Qwen Audio 3.1 TTS | বহু ভাষায় speech, ভাষা পেরিয়ে voice transfer এবং delivery-তে prompt দিয়ে নিয়ন্ত্রণ | | Singapore: প্রতি মিলিয়ন text-input token-এ $0.23 + প্রতি মিলিয়ন audio-output token-এ $1.87। পর্যালোচিত 3.1 নথিতে বর্তমান public সীমা উল্লেখ করা হয়নি। |
Qwen Audio 3.1 TTS-Next | speech, effect ও background audio একসঙ্গে তৈরি করা | Beijing-এ hosted, non-streaming HTTPS API; Chinese ও English-এর নথি আছে | প্রতি মিলিয়ন input token-এ $0.848 + প্রতি মিলিয়ন output token-এ $1.696। input সর্বোচ্চ ৩,০০০ character; podcast-এর output চার মিনিট, অন্য ক্ষেত্রে দুই মিনিট পর্যন্ত। |
Qwen Audio 3.1 Realtime Plus | বাধা দেওয়া ও tool call-সহ full-duplex voice conversation | Singapore ও Beijing-এ hosted WebSocket API। guide-এ ১১টি language তালিকাভুক্ত। | Singapore: প্রতি মিলিয়ন text input-এ $0.80, audio input-এ $6.40, text output-এ $6.40 এবং audio output-এ $24। সর্বোচ্চ ৫০টি audio turn অথবা ৩০০ সেকেন্ডের audio history রাখা হয়। |
এগুলো hosted API পণ্য। BIG CHANGE 3.1 model-এর download করা যায় এমন weight বা model-weight license পায়নি। QwenAudio GitHub repository-র MIT license প্রকল্পের website-এর জন্য; এটিকে model-এর license ধরে নেওয়া উচিত নয়।
language-এর সংখ্যাও নথি অনুযায়ী বদলে যায়। Qwen-এর যাচাইকৃত launch post-এ ASR-এর জন্য ৩০টি language ও ১৬টি চীনা উপভাষার কথা বলা হয়েছে; international API guide-এ ৩০টি language ও ১০ ধরনের উপভাষা আছে। developer-দের যে endpoint বাস্তবে ব্যবহার করতে পারবেন, তার সঙ্গে দেওয়া তালিকাটিই দেখা উচিত।
৯৫% সাশ্রয়ের দাবি public rate table-এর সঙ্গে সরাসরি মেলে না
Alibaba-র দাম পরিবর্তনের বিজ্ঞপ্তি ২২ সেপ্টেম্বর থেকে কার্যকর হয়। এতে সুনির্দিষ্ট তুলনা করা হয়েছে qwen-audio-3.0-realtime-flash-কে নিয়ে, নতুন 3.1 Realtime Plus-কে নয়। Singapore-এ হ্রাসের হিসাব: (আগের rate − নতুন rate) / আগের rate:
Realtime Flash stream | আগে (USD) | পরে (USD) | হ্রাস |
|---|---|---|---|
প্রতি মিলিয়ন token-এ text input | $0.45 | $0.23 | ৪৮.৮৯% |
প্রতি মিলিয়ন token-এ audio input | $4.50 | $0.93 | ৭৯.৩৩% |
প্রতি মিলিয়ন token-এ text output | $4.50 | $0.70 | ৮৪.৪৪% |
প্রতি মিলিয়ন token-এ output (text + audio) | $15.00 | $1.87 | ৮৭.৫৩% |
একই বিজ্ঞপ্তিতে 3.1 TTS Flash-এর দাম প্রতি ১০,০০০ character-এ $0.15 থেকে আলাদা input- ও output-token rate-এ বদলানো হয়। বর্তমান মূল্যতালিকায় একইভাবে 3.1 ASR-এর দাম input ও output token ধরে দেওয়া হয়েছে, যেখানে 3.0 ASR-এ প্রতি audio second ধরে দাম এবং output বিনা মূল্যে। দুই দামের জোড়ার শতকরা পার্থক্য নির্ভর করে text, audio-র দৈর্ঘ্য ও tokenization-এর ওপর। তাই পর্যালোচিত public table-গুলোতে ASR-এর সুনির্দিষ্ট ৯৫% হ্রাস পুনরুৎপাদন করা যায় না।
স্বাধীন প্রমাণ এখনও Qwen 3.0-এর
launch-এর দিন পর্যালোচিত সূত্রে পাঁচটি 3.1 model-এর কোনো স্বাধীন পরীক্ষা ছিল না। Qwen-এর নিজস্ব ASR project page benchmark-এর ফল জানায়, তবে বলে যে সেগুলো স্বাধীনভাবে আবার চালিয়ে দেখা হয়নি।
Artificial Analysis-এর provider-voice arena-তে (সব accent ও category মিলিয়ে) Qwen Audio 3.0 TTS Plus দ্বিতীয় স্থান পেয়েছে—এর score ১,২৫৯ Elo; ৯৫% confidence interval ±১৭ এবং অন্ধ তুলনার নমুনা ছিল ১,৪৪৭টি। আলাদা speech-agent arena-তে, Qwen Audio 3.0 Realtime Plus-এর preference Elo ছিল ৬৯৯ এবং প্রথম audio আসতে সময় ১.৫৪ সেকেন্ড। অংশগ্রহণকারীরা নির্ধারিত scenario-তে সরাসরি কথোপকথনের সময় আড়াল করা model-গুলোর তুলনা করেন।



