Alibaba-র Qwen দল transcription, speech generation ও সরাসরি voice interaction-জুড়ে পাঁচটি Qwen Audio 3.1 model এনেছে। ASR, TTS-Next ও Realtime Plus-এর hosted endpoint নথিবদ্ধ আছে। TTS Flash-এর model ID ও দাম প্রকাশিত, তবে integration-এর নথি তুলনায় অসম্পূর্ণ; BIG CHANGE যে public developer document পর্যালোচনা করেছে, তাতে ASR-Next-এর model ID, region বা দাম নেই।

The Decoder-এর প্রতিবেদন অনুযায়ী, Qwen text-to-speech-এ আনুমানিক ৭০%, realtime audio-তে ৮৫% এবং speech recognition-এ সর্বোচ্চ ৯৫% দাম কমার কথা প্রচার করেছে। এই অঙ্ক যাচাইয়ে billing unit গুরুত্বপূর্ণ।

বড় পরিবর্তন

  • কী বদলেছে: Qwen এখন এক hosted model family-র মধ্যে voice পণ্যের আরও অংশ এনেছে: transcription ও তৈরি করা speech থেকে শব্দের পরিবেশ তৈরি এবং সরাসরি কথোপকথন পর্যন্ত। তবে পাঁচটি উপাদানের developer access এখনও সমানভাবে সম্পূর্ণ নয়।
  • কেন গুরুত্বপূর্ণ: transcription বা voice service-এর বাজেট করা developer-দের জন্য সব endpoint-এর দাম নির্ধারণে অডিওর মিনিট একা যথেষ্ট নয়। token-ভিত্তিক ASR billing-এ আসা audio ও তৈরি হওয়া text—দুটিই ধরা হয়; live conversation-এ চারটি stream-এর দাম আলাদাভাবে নির্ধারিত।
  • কী লক্ষ করবেন: ASR-Next access-এর পাশাপাশি স্বাধীন ভাষা ও latency পরীক্ষা বাস্তব সাশ্রয় দেখায় কি না, দেখুন। দেখালে পরের প্রশ্ন: voice-agent, transcription ও dubbing provider-রা এই সাশ্রয় গ্রাহকের দামে পৌঁছে দেবে কি না এবং প্রতিদ্বন্দ্বী speech API-রাও একই পথে যাবে কি না।

পাঁচটি model এক নজরে

ঘোষিত model

উদ্দেশ্য

২৩ সেপ্টেম্বর পর্যন্ত নথিভুক্ত access

দাম ও ব্যবহারিক সীমা

Qwen Audio 3.1 ASR

streaming, file ও short-form transcription; file ও short-form endpoint-এ ঐচ্ছিক speaker diarization

Singapore ও Beijing-এ hosted WebSocket বা HTTP API। আন্তর্জাতিক guide-এ ৩০টি language এবং চীনা ভাষার ১০টি উপভাষার ধরন তালিকাভুক্ত।

Singapore-এ file/short-form-এর জন্য প্রতি মিলিয়ন audio-input token-এ $0.15 + প্রতি মিলিয়ন text-output token-এ $0.47; streaming/message-এর ক্ষেত্রে $0.93 + $0.70; file transcription-এ সর্বোচ্চ ১২ ঘণ্টা/২ GB; short-form-এ ৫ মিনিট/২ GB।

Qwen Audio 3.1 ASR-Next

speaker attribution ও timestamp-এর পাশাপাশি emotion, চারপাশের ঘটনা এবং যন্ত্রের শব্দ শনাক্ত করা

Qwen ঘোষণা করেছে; বর্তমান Model Studio ও QwenCloud নথিতে public API model ID, region, rate বা সীমা পাওয়া যায়নি

public নথিতে দাম বা সীমা নেই

Qwen Audio 3.1 TTS

বহু ভাষায় speech, ভাষা পেরিয়ে voice transfer এবং delivery-তে prompt দিয়ে নিয়ন্ত্রণ

qwen-audio-3.1-tts-flash model ID-টি Alibaba-র মূল্য পরিবর্তনের বিজ্ঞপ্তিতে আছে। পর্যালোচিত voice-cloning API-তে এখনও 3.0 TTS Flash-এর নাম রয়েছে।

Singapore: প্রতি মিলিয়ন text-input token-এ $0.23 + প্রতি মিলিয়ন audio-output token-এ $1.87। পর্যালোচিত 3.1 নথিতে বর্তমান public সীমা উল্লেখ করা হয়নি।

Qwen Audio 3.1 TTS-Next

speech, effect ও background audio একসঙ্গে তৈরি করা

Beijing-এ hosted, non-streaming HTTPS API; Chinese ও English-এর নথি আছে

প্রতি মিলিয়ন input token-এ $0.848 + প্রতি মিলিয়ন output token-এ $1.696। input সর্বোচ্চ ৩,০০০ character; podcast-এর output চার মিনিট, অন্য ক্ষেত্রে দুই মিনিট পর্যন্ত।

Qwen Audio 3.1 Realtime Plus

বাধা দেওয়া ও tool call-সহ full-duplex voice conversation

Singapore ও Beijing-এ hosted WebSocket API। guide-এ ১১টি language তালিকাভুক্ত।

Singapore: প্রতি মিলিয়ন text input-এ $0.80, audio input-এ $6.40, text output-এ $6.40 এবং audio output-এ $24। সর্বোচ্চ ৫০টি audio turn অথবা ৩০০ সেকেন্ডের audio history রাখা হয়।

এগুলো hosted API পণ্য। BIG CHANGE 3.1 model-এর download করা যায় এমন weight বা model-weight license পায়নি। QwenAudio GitHub repository-র MIT license প্রকল্পের website-এর জন্য; এটিকে model-এর license ধরে নেওয়া উচিত নয়।

language-এর সংখ্যাও নথি অনুযায়ী বদলে যায়। Qwen-এর যাচাইকৃত launch post-এ ASR-এর জন্য ৩০টি language ও ১৬টি চীনা উপভাষার কথা বলা হয়েছে; international API guide-এ ৩০টি language ও ১০ ধরনের উপভাষা আছে। developer-দের যে endpoint বাস্তবে ব্যবহার করতে পারবেন, তার সঙ্গে দেওয়া তালিকাটিই দেখা উচিত।

৯৫% সাশ্রয়ের দাবি public rate table-এর সঙ্গে সরাসরি মেলে না

Alibaba-র দাম পরিবর্তনের বিজ্ঞপ্তি ২২ সেপ্টেম্বর থেকে কার্যকর হয়। এতে সুনির্দিষ্ট তুলনা করা হয়েছে qwen-audio-3.0-realtime-flash-কে নিয়ে, নতুন 3.1 Realtime Plus-কে নয়। Singapore-এ হ্রাসের হিসাব: (আগের rate − নতুন rate) / আগের rate:

Realtime Flash stream

আগে (USD)

পরে (USD)

হ্রাস

প্রতি মিলিয়ন token-এ text input

$0.45

$0.23

৪৮.৮৯%

প্রতি মিলিয়ন token-এ audio input

$4.50

$0.93

৭৯.৩৩%

প্রতি মিলিয়ন token-এ text output

$4.50

$0.70

৮৪.৪৪%

প্রতি মিলিয়ন token-এ output (text + audio)

$15.00

$1.87

৮৭.৫৩%

একই বিজ্ঞপ্তিতে 3.1 TTS Flash-এর দাম প্রতি ১০,০০০ character-এ $0.15 থেকে আলাদা input- ও output-token rate-এ বদলানো হয়। বর্তমান মূল্যতালিকায় একইভাবে 3.1 ASR-এর দাম input ও output token ধরে দেওয়া হয়েছে, যেখানে 3.0 ASR-এ প্রতি audio second ধরে দাম এবং output বিনা মূল্যে। দুই দামের জোড়ার শতকরা পার্থক্য নির্ভর করে text, audio-র দৈর্ঘ্য ও tokenization-এর ওপর। তাই পর্যালোচিত public table-গুলোতে ASR-এর সুনির্দিষ্ট ৯৫% হ্রাস পুনরুৎপাদন করা যায় না।

স্বাধীন প্রমাণ এখনও Qwen 3.0-এর

launch-এর দিন পর্যালোচিত সূত্রে পাঁচটি 3.1 model-এর কোনো স্বাধীন পরীক্ষা ছিল না। Qwen-এর নিজস্ব ASR project page benchmark-এর ফল জানায়, তবে বলে যে সেগুলো স্বাধীনভাবে আবার চালিয়ে দেখা হয়নি।

Artificial Analysis-এর provider-voice arena-তে (সব accent ও category মিলিয়ে) Qwen Audio 3.0 TTS Plus দ্বিতীয় স্থান পেয়েছে—এর score ১,২৫৯ Elo; ৯৫% confidence interval ±১৭ এবং অন্ধ তুলনার নমুনা ছিল ১,৪৪৭টি। আলাদা speech-agent arena-তে, Qwen Audio 3.0 Realtime Plus-এর preference Elo ছিল ৬৯৯ এবং প্রথম audio আসতে সময় ১.৫৪ সেকেন্ড। অংশগ্রহণকারীরা নির্ধারিত scenario-তে সরাসরি কথোপকথনের সময় আড়াল করা model-গুলোর তুলনা করেন।