AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1-এ voice-এর পরিসর বাড়ল; ৯৫% দাম কমার দাবিতে প্রেক্ষাপট জরুরি
> Qwen Audio 3.1-এ শব্দ তৈরি ও বোঝার সুবিধা আছে। API নথি অসম্পূর্ণ, আর billing unit বদলানোয় ASR-এ বিজ্ঞাপিত সাশ্রয়ের হিসাব জটিল।
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Alibaba-র Qwen দল transcription, speech generation ও সরাসরি voice interaction-জুড়ে পাঁচটি Qwen Audio 3.1 model এনেছে। ASR, TTS-Next ও Realtime Plus-এর hosted endpoint নথিবদ্ধ আছে। TTS Flash-এর model ID ও দাম প্রকাশিত, তবে integration-এর নথি তুলনায় অসম্পূর্ণ; BIG CHANGE যে public developer document পর্যালোচনা করেছে, তাতে ASR-Next-এর model ID, region বা দাম নেই।
[The Decoder-এর প্রতিবেদন](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) অনুযায়ী, Qwen text-to-speech-এ আনুমানিক ৭০%, realtime audio-তে ৮৫% এবং speech recognition-এ সর্বোচ্চ ৯৫% দাম কমার কথা প্রচার করেছে। এই অঙ্ক যাচাইয়ে billing unit গুরুত্বপূর্ণ।
## বড় পরিবর্তন
- **কী বদলেছে:** Qwen এখন এক hosted model family-র মধ্যে voice পণ্যের আরও অংশ এনেছে: transcription ও তৈরি করা speech থেকে শব্দের পরিবেশ তৈরি এবং সরাসরি কথোপকথন পর্যন্ত। তবে পাঁচটি উপাদানের developer access এখনও সমানভাবে সম্পূর্ণ নয়।
- **কেন গুরুত্বপূর্ণ:** transcription বা voice service-এর বাজেট করা developer-দের জন্য সব endpoint-এর দাম নির্ধারণে অডিওর মিনিট একা যথেষ্ট নয়। token-ভিত্তিক ASR billing-এ আসা audio ও তৈরি হওয়া text—দুটিই ধরা হয়; live conversation-এ চারটি stream-এর দাম আলাদাভাবে নির্ধারিত।
- **কী লক্ষ করবেন:** ASR-Next access-এর পাশাপাশি স্বাধীন ভাষা ও latency পরীক্ষা বাস্তব সাশ্রয় দেখায় কি না, দেখুন। দেখালে পরের প্রশ্ন: voice-agent, transcription ও dubbing provider-রা এই সাশ্রয় গ্রাহকের দামে পৌঁছে দেবে কি না এবং প্রতিদ্বন্দ্বী speech API-রাও একই পথে যাবে কি না।
## পাঁচটি model এক নজরে
| ঘোষিত model | উদ্দেশ্য | ২৩ সেপ্টেম্বর পর্যন্ত নথিভুক্ত access | দাম ও ব্যবহারিক সীমা |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | streaming, file ও short-form transcription; file ও short-form endpoint-এ ঐচ্ছিক speaker diarization | Singapore ও Beijing-এ hosted WebSocket বা HTTP API। [আন্তর্জাতিক guide](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)-এ ৩০টি language এবং চীনা ভাষার ১০টি উপভাষার ধরন তালিকাভুক্ত। | Singapore-এ file/short-form-এর জন্য **প্রতি মিলিয়ন audio-input token-এ $0.15 + প্রতি মিলিয়ন text-output token-এ $0.47**; streaming/message-এর ক্ষেত্রে **$0.93 + $0.70;** file transcription-এ সর্বোচ্চ ১২ ঘণ্টা/২ GB; short-form-এ ৫ মিনিট/২ GB। |
| **Qwen Audio 3.1 ASR-Next** | speaker attribution ও timestamp-এর পাশাপাশি emotion, চারপাশের ঘটনা এবং যন্ত্রের শব্দ শনাক্ত করা | Qwen ঘোষণা করেছে; বর্তমান Model Studio ও QwenCloud নথিতে public API model ID, region, rate বা সীমা পাওয়া যায়নি | **public নথিতে দাম বা সীমা নেই** |
| **Qwen Audio 3.1 TTS** | বহু ভাষায় speech, ভাষা পেরিয়ে voice transfer এবং delivery-তে prompt দিয়ে নিয়ন্ত্রণ | `qwen-audio-3.1-tts-flash` model ID-টি Alibaba-র মূল্য পরিবর্তনের বিজ্ঞপ্তিতে আছে। পর্যালোচিত [voice-cloning API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)-তে এখনও 3.0 TTS Flash-এর নাম রয়েছে। | Singapore: **প্রতি মিলিয়ন text-input token-এ $0.23 + প্রতি মিলিয়ন audio-output token-এ $1.87**। পর্যালোচিত 3.1 নথিতে বর্তমান public সীমা উল্লেখ করা হয়নি। |
| **Qwen Audio 3.1 TTS-Next** | speech, effect ও background audio একসঙ্গে তৈরি করা | Beijing-এ hosted, non-streaming HTTPS API; Chinese ও English-এর নথি আছে | **প্রতি মিলিয়ন input token-এ $0.848 + প্রতি মিলিয়ন output token-এ $1.696**। input সর্বোচ্চ ৩,০০০ character; podcast-এর output চার মিনিট, অন্য ক্ষেত্রে দুই মিনিট পর্যন্ত। |
| **Qwen Audio 3.1 Realtime Plus** | বাধা দেওয়া ও tool call-সহ full-duplex voice conversation | Singapore ও Beijing-এ hosted WebSocket API। [guide](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)-এ ১১টি language তালিকাভুক্ত। | Singapore: **প্রতি মিলিয়ন text input-এ $0.80, audio input-এ $6.40, text output-এ $6.40 এবং audio output-এ $24**। সর্বোচ্চ ৫০টি audio turn অথবা ৩০০ সেকেন্ডের audio history রাখা হয়। |
এগুলো hosted API পণ্য। BIG CHANGE 3.1 model-এর download করা যায় এমন weight বা model-weight license পায়নি। QwenAudio GitHub repository-র MIT license প্রকল্পের website-এর জন্য; এটিকে model-এর license ধরে নেওয়া উচিত নয়।
language-এর সংখ্যাও নথি অনুযায়ী বদলে যায়। Qwen-এর [যাচাইকৃত launch post](https://www.sina.cn/news/detail/5346330620985983.html)-এ ASR-এর জন্য ৩০টি language ও ১৬টি চীনা উপভাষার কথা বলা হয়েছে; international API guide-এ ৩০টি language ও ১০ ধরনের উপভাষা আছে। developer-দের যে endpoint বাস্তবে ব্যবহার করতে পারবেন, তার সঙ্গে দেওয়া তালিকাটিই দেখা উচিত।
## ৯৫% সাশ্রয়ের দাবি public rate table-এর সঙ্গে সরাসরি মেলে না
Alibaba-র [দাম পরিবর্তনের বিজ্ঞপ্তি](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) ২২ সেপ্টেম্বর থেকে কার্যকর হয়। এতে সুনির্দিষ্ট তুলনা করা হয়েছে `qwen-audio-3.0-realtime-flash`-কে নিয়ে, নতুন 3.1 Realtime Plus-কে নয়। Singapore-এ হ্রাসের হিসাব: (আগের rate − নতুন rate) / আগের rate:
| Realtime Flash stream | আগে (USD) | পরে (USD) | হ্রাস |
| --- | --- | --- | --- |
| প্রতি মিলিয়ন token-এ text input | $0.45 | $0.23 | ৪৮.৮৯% |
| প্রতি মিলিয়ন token-এ audio input | $4.50 | $0.93 | ৭৯.৩৩% |
| প্রতি মিলিয়ন token-এ text output | $4.50 | $0.70 | ৮৪.৪৪% |
| প্রতি মিলিয়ন token-এ output (text + audio) | $15.00 | $1.87 | **৮৭.৫৩%** |
একই বিজ্ঞপ্তিতে 3.1 TTS Flash-এর দাম প্রতি ১০,০০০ character-এ $0.15 থেকে আলাদা input- ও output-token rate-এ বদলানো হয়। [বর্তমান মূল্যতালিকায়](https://www.alibabacloud.com/help/en/model-studio/model-pricing) একইভাবে 3.1 ASR-এর দাম input ও output token ধরে দেওয়া হয়েছে, যেখানে 3.0 ASR-এ প্রতি audio second ধরে দাম এবং output বিনা মূল্যে। দুই দামের জোড়ার শতকরা পার্থক্য নির্ভর করে text, audio-র দৈর্ঘ্য ও tokenization-এর ওপর। তাই পর্যালোচিত public table-গুলোতে ASR-এর সুনির্দিষ্ট ৯৫% হ্রাস পুনরুৎপাদন করা যায় না।
## স্বাধীন প্রমাণ এখনও Qwen 3.0-এর
launch-এর দিন পর্যালোচিত সূত্রে পাঁচটি 3.1 model-এর কোনো স্বাধীন পরীক্ষা ছিল না। Qwen-এর নিজস্ব [ASR project page](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) benchmark-এর ফল জানায়, তবে বলে যে সেগুলো স্বাধীনভাবে আবার চালিয়ে দেখা হয়নি।
Artificial Analysis-এর provider-voice arena-তে (সব accent ও category মিলিয়ে) [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) দ্বিতীয় স্থান পেয়েছে—এর score ১,২৫৯ Elo; ৯৫% confidence interval ±১৭ এবং অন্ধ তুলনার নমুনা ছিল ১,৪৪৭টি। আলাদা [speech-agent arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)-তে, Qwen Audio 3.0 Realtime Plus-এর preference Elo ছিল ৬৯৯ এবং প্রথম audio আসতে সময় ১.৫৪ সেকেন্ড। অংশগ্রহণকারীরা নির্ধারিত scenario-তে সরাসরি কথোপকথনের সময় আড়াল করা model-গুলোর তুলনা করেন।
## Sources
- [Alibaba পাঁচটি নতুন model-সহ Qwen Audio 3.1 এনেছে](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — পাঁচ model-এ প্রকাশিত feature ও Qwen-এর বলা আনুমানিক TTS, realtime ও ASR মূল্যহ্রাসের সারাংশ। BIG CHANGE Alibaba-র নিজস্ব rate table দিয়ে দাম যাচাই করেছে।
- [Qwen Audio 3.1 launch post](https://www.sina.cn/news/detail/5346330620985983.html) — যাচাইকৃত Qwen account-এর পোস্ট; এতে পাঁচটি model ও তাদের উদ্দেশ্যপ্রণোদিত সক্ষমতার নাম আছে। সক্ষমতা ও গতিসংক্রান্ত বক্তব্য vendor-এর দাবি হিসেবে রাখা হয়েছে।
- [নির্বাচিত audio model-এর Model Studio মূল্যহ্রাসের বিজ্ঞপ্তি](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — ২২ সেপ্টেম্বরের আনুষ্ঠানিক মূল্য পরিবর্তন; এতে 3.0 Realtime Flash-এর Singapore-এ আগে ও পরের সুনির্দিষ্ট rate এবং 3.1 TTS Flash-এর billing unit বদলের কথা আছে।
- [Model Studio model-এর মূল্য](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — model, modality ও region অনুযায়ী বর্তমান অফিসিয়াল মূল্য; এতে 3.1 ASR ও Realtime Plus-ও আছে।
- [QwenCloud speech-to-text model](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — বর্তমান ASR endpoint ID, access পদ্ধতি, language list, diarization সুবিধা ও সময়সীমা।
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — বর্তমান 3.1 Realtime Plus WebSocket উদাহরণ, voice ও language সমর্থন এবং কথোপকথনের ইতিহাস সংরক্ষণের সীমা।
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Beijing-এ সীমিত অফিসিয়াল API access, দাম, language, input-এর দৈর্ঘ্য ও output-এর সময়সীমা।
- [Qwen Audio 3.1 ASR project page](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR ও ASR-Next-এর সক্ষমতা এবং vendor-প্রকাশিত benchmark-সংক্রান্ত অপরিবর্তিত Qwen project page; এতে বলা আছে, ফলগুলো স্বাধীনভাবে পুনরুৎপাদন করা হয়নি।
- [Artificial Analysis Text to Speech leaderboard](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — আগের Qwen Audio 3.0 TTS Plus-এর অন্ধ পছন্দভিত্তিক ফল; এতে নমুনার সংখ্যা ও confidence interval আছে।
- [Artificial Analysis Speech Agent Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plus-এর আলাদা preference ও প্রথম audio আসার সময়ের ফল; এটি 3.1-এর মূল্যায়ন নয়।
- [voice cloning HTTP API-এর reference](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — বর্তমান target-model উদাহরণে 3.0 TTS Flash-এর নাম আছে। এগুলো স্বাধীনভাবে 3.1 synthesis integration-এর পথ নিশ্চিত করে না।
BIG CHANGE নিউজলেটার
বড় ছবিটা। আপনার গতিতে।
এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
আপনার গোপনীয়তা, আপনার পছন্দ।
প্রয়োজনীয় স্টোরেজ সাইটের নিরাপত্তায় সাহায্য করে এবং আপনার পছন্দ মনে রাখে। আপনি অনুমতি না দেওয়া পর্যন্ত ঐচ্ছিক Google Analytics বন্ধ থাকবে। প্রয়োজনীয় স্টোরেজ ব্যবহার করেই প্রতিটি গল্প পড়তে পারেন। গোপনীয়তার বিবরণ