AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1-এ voice-এর পরিসর বাড়ল; ৯৫% দাম কমার দাবিতে প্রেক্ষাপট জরুরি

> Qwen Audio 3.1-এ শব্দ তৈরি ও বোঝার সুবিধা আছে। API নথি অসম্পূর্ণ, আর billing unit বদলানোয় ASR-এ বিজ্ঞাপিত সাশ্রয়ের হিসাব জটিল।

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Alibaba-র Qwen দল transcription, speech generation ও সরাসরি voice interaction-জুড়ে পাঁচটি Qwen Audio 3.1 model এনেছে। ASR, TTS-Next ও Realtime Plus-এর hosted endpoint নথিবদ্ধ আছে। TTS Flash-এর model ID ও দাম প্রকাশিত, তবে integration-এর নথি তুলনায় অসম্পূর্ণ; BIG CHANGE যে public developer document পর্যালোচনা করেছে, তাতে ASR-Next-এর model ID, region বা দাম নেই।

[The Decoder-এর প্রতিবেদন](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) অনুযায়ী, Qwen text-to-speech-এ আনুমানিক ৭০%, realtime audio-তে ৮৫% এবং speech recognition-এ সর্বোচ্চ ৯৫% দাম কমার কথা প্রচার করেছে। এই অঙ্ক যাচাইয়ে billing unit গুরুত্বপূর্ণ।

## বড় পরিবর্তন

- **কী বদলেছে:** Qwen এখন এক hosted model family-র মধ্যে voice পণ্যের আরও অংশ এনেছে: transcription ও তৈরি করা speech থেকে শব্দের পরিবেশ তৈরি এবং সরাসরি কথোপকথন পর্যন্ত। তবে পাঁচটি উপাদানের developer access এখনও সমানভাবে সম্পূর্ণ নয়।
- **কেন গুরুত্বপূর্ণ:** transcription বা voice service-এর বাজেট করা developer-দের জন্য সব endpoint-এর দাম নির্ধারণে অডিওর মিনিট একা যথেষ্ট নয়। token-ভিত্তিক ASR billing-এ আসা audio ও তৈরি হওয়া text—দুটিই ধরা হয়; live conversation-এ চারটি stream-এর দাম আলাদাভাবে নির্ধারিত।
- **কী লক্ষ করবেন:** ASR-Next access-এর পাশাপাশি স্বাধীন ভাষা ও latency পরীক্ষা বাস্তব সাশ্রয় দেখায় কি না, দেখুন। দেখালে পরের প্রশ্ন: voice-agent, transcription ও dubbing provider-রা এই সাশ্রয় গ্রাহকের দামে পৌঁছে দেবে কি না এবং প্রতিদ্বন্দ্বী speech API-রাও একই পথে যাবে কি না।

## পাঁচটি model এক নজরে

| ঘোষিত model | উদ্দেশ্য | ২৩ সেপ্টেম্বর পর্যন্ত নথিভুক্ত access | দাম ও ব্যবহারিক সীমা |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | streaming, file ও short-form transcription; file ও short-form endpoint-এ ঐচ্ছিক speaker diarization | Singapore ও Beijing-এ hosted WebSocket বা HTTP API। [আন্তর্জাতিক guide](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)-এ ৩০টি language এবং চীনা ভাষার ১০টি উপভাষার ধরন তালিকাভুক্ত। | Singapore-এ file/short-form-এর জন্য **প্রতি মিলিয়ন audio-input token-এ $0.15 + প্রতি মিলিয়ন text-output token-এ $0.47**; streaming/message-এর ক্ষেত্রে **$0.93 + $0.70;** file transcription-এ সর্বোচ্চ ১২ ঘণ্টা/২ GB; short-form-এ ৫ মিনিট/২ GB। |
| **Qwen Audio 3.1 ASR-Next** | speaker attribution ও timestamp-এর পাশাপাশি emotion, চারপাশের ঘটনা এবং যন্ত্রের শব্দ শনাক্ত করা | Qwen ঘোষণা করেছে; বর্তমান Model Studio ও QwenCloud নথিতে public API model ID, region, rate বা সীমা পাওয়া যায়নি | **public নথিতে দাম বা সীমা নেই** |
| **Qwen Audio 3.1 TTS** | বহু ভাষায় speech, ভাষা পেরিয়ে voice transfer এবং delivery-তে prompt দিয়ে নিয়ন্ত্রণ | `qwen-audio-3.1-tts-flash` model ID-টি Alibaba-র মূল্য পরিবর্তনের বিজ্ঞপ্তিতে আছে। পর্যালোচিত [voice-cloning API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)-তে এখনও 3.0 TTS Flash-এর নাম রয়েছে। | Singapore: **প্রতি মিলিয়ন text-input token-এ $0.23 + প্রতি মিলিয়ন audio-output token-এ $1.87**। পর্যালোচিত 3.1 নথিতে বর্তমান public সীমা উল্লেখ করা হয়নি। |
| **Qwen Audio 3.1 TTS-Next** | speech, effect ও background audio একসঙ্গে তৈরি করা | Beijing-এ hosted, non-streaming HTTPS API; Chinese ও English-এর নথি আছে | **প্রতি মিলিয়ন input token-এ $0.848 + প্রতি মিলিয়ন output token-এ $1.696**। input সর্বোচ্চ ৩,০০০ character; podcast-এর output চার মিনিট, অন্য ক্ষেত্রে দুই মিনিট পর্যন্ত। |
| **Qwen Audio 3.1 Realtime Plus** | বাধা দেওয়া ও tool call-সহ full-duplex voice conversation | Singapore ও Beijing-এ hosted WebSocket API। [guide](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)-এ ১১টি language তালিকাভুক্ত। | Singapore: **প্রতি মিলিয়ন text input-এ $0.80, audio input-এ $6.40, text output-এ $6.40 এবং audio output-এ $24**। সর্বোচ্চ ৫০টি audio turn অথবা ৩০০ সেকেন্ডের audio history রাখা হয়। |

এগুলো hosted API পণ্য। BIG CHANGE 3.1 model-এর download করা যায় এমন weight বা model-weight license পায়নি। QwenAudio GitHub repository-র MIT license প্রকল্পের website-এর জন্য; এটিকে model-এর license ধরে নেওয়া উচিত নয়।

language-এর সংখ্যাও নথি অনুযায়ী বদলে যায়। Qwen-এর [যাচাইকৃত launch post](https://www.sina.cn/news/detail/5346330620985983.html)-এ ASR-এর জন্য ৩০টি language ও ১৬টি চীনা উপভাষার কথা বলা হয়েছে; international API guide-এ ৩০টি language ও ১০ ধরনের উপভাষা আছে। developer-দের যে endpoint বাস্তবে ব্যবহার করতে পারবেন, তার সঙ্গে দেওয়া তালিকাটিই দেখা উচিত।

## ৯৫% সাশ্রয়ের দাবি public rate table-এর সঙ্গে সরাসরি মেলে না

Alibaba-র [দাম পরিবর্তনের বিজ্ঞপ্তি](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) ২২ সেপ্টেম্বর থেকে কার্যকর হয়। এতে সুনির্দিষ্ট তুলনা করা হয়েছে `qwen-audio-3.0-realtime-flash`-কে নিয়ে, নতুন 3.1 Realtime Plus-কে নয়। Singapore-এ হ্রাসের হিসাব: (আগের rate − নতুন rate) / আগের rate:

| Realtime Flash stream | আগে (USD) | পরে (USD) | হ্রাস |
| --- | --- | --- | --- |
| প্রতি মিলিয়ন token-এ text input | $0.45 | $0.23 | ৪৮.৮৯% |
| প্রতি মিলিয়ন token-এ audio input | $4.50 | $0.93 | ৭৯.৩৩% |
| প্রতি মিলিয়ন token-এ text output | $4.50 | $0.70 | ৮৪.৪৪% |
| প্রতি মিলিয়ন token-এ output (text + audio) | $15.00 | $1.87 | **৮৭.৫৩%** |

একই বিজ্ঞপ্তিতে 3.1 TTS Flash-এর দাম প্রতি ১০,০০০ character-এ $0.15 থেকে আলাদা input- ও output-token rate-এ বদলানো হয়। [বর্তমান মূল্যতালিকায়](https://www.alibabacloud.com/help/en/model-studio/model-pricing) একইভাবে 3.1 ASR-এর দাম input ও output token ধরে দেওয়া হয়েছে, যেখানে 3.0 ASR-এ প্রতি audio second ধরে দাম এবং output বিনা মূল্যে। দুই দামের জোড়ার শতকরা পার্থক্য নির্ভর করে text, audio-র দৈর্ঘ্য ও tokenization-এর ওপর। তাই পর্যালোচিত public table-গুলোতে ASR-এর সুনির্দিষ্ট ৯৫% হ্রাস পুনরুৎপাদন করা যায় না।

## স্বাধীন প্রমাণ এখনও Qwen 3.0-এর

launch-এর দিন পর্যালোচিত সূত্রে পাঁচটি 3.1 model-এর কোনো স্বাধীন পরীক্ষা ছিল না। Qwen-এর নিজস্ব [ASR project page](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) benchmark-এর ফল জানায়, তবে বলে যে সেগুলো স্বাধীনভাবে আবার চালিয়ে দেখা হয়নি।

Artificial Analysis-এর provider-voice arena-তে (সব accent ও category মিলিয়ে) [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) দ্বিতীয় স্থান পেয়েছে—এর score ১,২৫৯ Elo; ৯৫% confidence interval ±১৭ এবং অন্ধ তুলনার নমুনা ছিল ১,৪৪৭টি। আলাদা [speech-agent arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)-তে, Qwen Audio 3.0 Realtime Plus-এর preference Elo ছিল ৬৯৯ এবং প্রথম audio আসতে সময় ১.৫৪ সেকেন্ড। অংশগ্রহণকারীরা নির্ধারিত scenario-তে সরাসরি কথোপকথনের সময় আড়াল করা model-গুলোর তুলনা করেন।

## Sources

- [Alibaba পাঁচটি নতুন model-সহ Qwen Audio 3.1 এনেছে](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — পাঁচ model-এ প্রকাশিত feature ও Qwen-এর বলা আনুমানিক TTS, realtime ও ASR মূল্যহ্রাসের সারাংশ। BIG CHANGE Alibaba-র নিজস্ব rate table দিয়ে দাম যাচাই করেছে।
- [Qwen Audio 3.1 launch post](https://www.sina.cn/news/detail/5346330620985983.html) — যাচাইকৃত Qwen account-এর পোস্ট; এতে পাঁচটি model ও তাদের উদ্দেশ্যপ্রণোদিত সক্ষমতার নাম আছে। সক্ষমতা ও গতিসংক্রান্ত বক্তব্য vendor-এর দাবি হিসেবে রাখা হয়েছে।
- [নির্বাচিত audio model-এর Model Studio মূল্যহ্রাসের বিজ্ঞপ্তি](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — ২২ সেপ্টেম্বরের আনুষ্ঠানিক মূল্য পরিবর্তন; এতে 3.0 Realtime Flash-এর Singapore-এ আগে ও পরের সুনির্দিষ্ট rate এবং 3.1 TTS Flash-এর billing unit বদলের কথা আছে।
- [Model Studio model-এর মূল্য](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — model, modality ও region অনুযায়ী বর্তমান অফিসিয়াল মূল্য; এতে 3.1 ASR ও Realtime Plus-ও আছে।
- [QwenCloud speech-to-text model](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — বর্তমান ASR endpoint ID, access পদ্ধতি, language list, diarization সুবিধা ও সময়সীমা।
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — বর্তমান 3.1 Realtime Plus WebSocket উদাহরণ, voice ও language সমর্থন এবং কথোপকথনের ইতিহাস সংরক্ষণের সীমা।
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Beijing-এ সীমিত অফিসিয়াল API access, দাম, language, input-এর দৈর্ঘ্য ও output-এর সময়সীমা।
- [Qwen Audio 3.1 ASR project page](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR ও ASR-Next-এর সক্ষমতা এবং vendor-প্রকাশিত benchmark-সংক্রান্ত অপরিবর্তিত Qwen project page; এতে বলা আছে, ফলগুলো স্বাধীনভাবে পুনরুৎপাদন করা হয়নি।
- [Artificial Analysis Text to Speech leaderboard](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — আগের Qwen Audio 3.0 TTS Plus-এর অন্ধ পছন্দভিত্তিক ফল; এতে নমুনার সংখ্যা ও confidence interval আছে।
- [Artificial Analysis Speech Agent Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plus-এর আলাদা preference ও প্রথম audio আসার সময়ের ফল; এটি 3.1-এর মূল্যায়ন নয়।
- [voice cloning HTTP API-এর reference](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — বর্তমান target-model উদাহরণে 3.0 TTS Flash-এর নাম আছে। এগুলো স্বাধীনভাবে 3.1 synthesis integration-এর পথ নিশ্চিত করে না।
