Microsoft 1 অক্টোবর MAI-Transcribe-2-Streaming ঘোষণা করেছে। কথা বলার সময় এটি audio নেয় এবং চূড়ান্ত transcript দেওয়ার আগে বদলাতে থাকা text ফেরত দেয়। Voice app-এ live caption বা speech input যোগ করা developer-এর জন্য মূল প্রশ্ন হলো, এই update-গুলো app-এ কীভাবে পৌঁছায় এবং কখন সেগুলোকে স্থির বলে ধরা যায়।
এটি public preview মূল্যায়নকারী developer-দের জন্য নথিভিত্তিক integration নির্দেশিকা। লক্ষ্য হলো, model-টি prototype করা উচিত কি না এবং live text দেখানো ও চূড়ান্ত text ধরে রাখার জন্য client-এ কী কাজ দরকার তা নির্ধারণ করা। Microsoft সংযোগপথ ও sample code নথিবদ্ধ করেছে; BIG CHANGE model-টি deploy করেনি, sample চালায়নি এবং এর নির্ভুলতা বা latency মাপেনি।
মূল পরিবর্তন
- Microsoft এমন streaming model এনেছে, যা audio আসার সঙ্গে সঙ্গে অস্থায়ী text ফেরত দেয়, পরে transcript-এর অংশগুলো নিশ্চিত করে। আলাদা MAI-Transcribe-2 file transcription পথটি আগে রেকর্ড করা audio নিয়ে কাজ করে এবং ভিন্ন ধরনের option নথিবদ্ধ করে।
- Realtime API ব্যবহারকারী app-কে সঠিক format-এ audio পাঠাতে হয়, অস্থায়ী text-এর শেষ অংশে সংশোধন সামলাতে হয় এবং কখন সম্পূর্ণ transcript চাইবে তা ঠিক করতে হয়। এসব সিদ্ধান্তে ব্যবহারকারী কী দেখবেন এবং app-এর পরবর্তী logic কখন চূড়ান্ত text-এর ওপর নির্ভর করতে পারবে, তা নির্ধারিত হয়।
- Streaming model-টি service-level agreement ছাড়া public preview-তে আছে। Microsoft production workload-এর জন্য এটি সুপারিশ করে না। গতি ও নির্ভুলতা নিয়ে প্রকাশিত সংখ্যা উদ্বোধনী ঘোষণা ও benchmark-এর দাবি, এই নির্দেশিকার নিজস্ব মাপ নয়।
সংযোগের পথ বেছে নিন
Microsoft Foundry-র মডেল ক্যাটালগে তালিকাভুক্ত আছে: MAI-Transcribe-2-Streaming, সংস্করণ 2026-08-06, audio input ও text output-সহ preview model হিসেবে নথিভুক্ত। Microsoft-এর 1 অক্টোবরের overview integration-এর দুটি উপায় দেখায়: OpenAI Realtime-এর মতো WebSocket protocol-সহ Realtime API, অথবা Azure Speech SDK। দুটোতেই অন্তর্বর্তী ও চূড়ান্ত recognition result পাওয়া যায়। SDK connection ও audio streaming সামলায়; Realtime পথ event-গুলো সরাসরি দেখায়।
এই Realtime API-এর জন্য Azure subscription, Microsoft Entra bearer token বা API key, supported region-এ Microsoft Foundry resource এবং streaming model deployment দরকার। সংযোগ করুন wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription ব্যবহার করে Microsoft Entra bearer token বা API key দিয়ে। Microsoft Entra authentication-ই নথিতে সুপারিশ করা হয়েছে। এরপর session.created এলে, session.update পাঠিয়ে deployment-এর নাম ও input format নির্দিষ্ট করুন। প্রথম audio append-এর পর, commit হলেও, এই setting আর বদলানো যায় না।
নথিভুক্ত input হলো raw, signed, little-endian, mono PCM16 audio, 16 বা 24 kHz-এ; base64 chunk হিসেবে পাঠাতে হয় input_audio_buffer.append message-এ। এটি WAV header ছাড়া PCM data। Latency কমাতে Microsoft 10 থেকে 20 millisecond-এর মতো ছোট chunk সুপারিশ করে, তবে বড় chunk-এ network overhead কমে বলেও উল্লেখ করে। Python sample-এ microphone audio 100 ms block-এ পড়া হয়; ছোট chunk-এর পরামর্শ ও sample-এর block size আলাদা পছন্দ, BIG CHANGE-এর মাপা ফল নয়।
Azure Speech SDK-র পথ ব্যবহার করতে SDK v1.52.0, Azure subscription এবং Foundry বা Speech resource দরকার। Microsoft-এর Python sample-এ speech_config.model = MAI-Transcribe-2-Streaming দিয়ে 16 kHz, 16-bit mono audio push stream-এ দেওয়া হয় এবং recognizing ও recognized event শোনা হয়। Sample-টি আগে থেকে থাকা audio.pcm file দিয়ে push stream দেখায়; app নিজস্ব audio source দেবে। এগুলো নথিভুক্ত interface ও প্রত্যাশিত event type, BIG CHANGE-এর account-স্তরের compatibility test নয়।
অস্থায়ী text ও নিশ্চিত text আলাদা রাখুন
Live interface-এ Realtime event-এর অর্থ গুরুত্বপূর্ণ। conversation.item.input_audio_transcription.delta event-এ সদ্য চূড়ান্ত হওয়া text থাকে; client app spacing না বদলে তা confirmed buffer-এ যোগ করে। intermediate event-এ বর্তমান অস্থায়ী suffix-এর পুরোটা থাকে। প্রতিটি নতুন suffix আগেরটিকে প্রতিস্থাপন করে। Screen-এ confirmed buffer-এর সঙ্গে বর্তমান suffix দেখানো যায়; model সংশোধন করার সময় প্রতিটি interim event আলাদা line হিসেবে জমালে শব্দ বারবার দেখা যাবে।
Client শনাক্ত করা বিরতিতে বা recording শেষে input_audio_buffer.commit পাঠায়। Microsoft বলেছে, এতে যত দ্রুত সম্ভব final transcript চাওয়া হয়; input_audio_buffer.committed commit গ্রহণের কথা জানায়, আর conversation.item.input_audio_transcription.completed আগের commit-এর পর থেকে audio-র সম্পূর্ণ final text দেয়। Realtime guide বলেছে, এই model-এর session configuration-এ server-side turn detection ও automatic commit নেই। তাই স্বয়ংক্রিয়ভাবে segment শেষ করতে চাইলে voice app-কে নিজের pause বা turn boundary নির্ধারণ করতে হবে। নথিতে event-এর নিয়ম বলা আছে; সবার জন্য উপযুক্ত একক boundary detector দেওয়া নেই।
Microsoft-এর guide অনুযায়ী প্রতিটি Realtime session সর্বোচ্চ এক ঘণ্টা চলে। প্রতিটি audio append-এর আলাদা acknowledgment নেই; এর ফলে শূন্য বা একাধিক transcript event আসতে পারে। Prototype মূল্যায়নকারী developer-দের audio message পৌঁছানো আর final text পাওয়া আলাদা করে দেখতে হবে এবং session বিচ্ছিন্ন হলে app কী করবে তা স্থির করতে হবে। Public guide-এর Python sample-এ microphone queue ও error handling আছে, কিন্তু BIG CHANGE সেটি চালিয়ে ব্যর্থতার বাস্তব আচরণ যাচাই করেনি।
প্রবেশাধিকার, region ও মূল্য
Microsoft বলেছে model-টি বিশ্বজুড়ে ব্যবহার করা যায়, আর Azure অনুরোধকে serving region-এ পাঠায়। 1 অক্টোবরের দুই integration page-এ উপলভ্য region-এর তালিকা আলাদা: Realtime guide-এ Sweden Central, Central US ও South India; Speech SDK guide-এ Sweden Central, Central US ও Southeast Asia। দুটিতেই East US 2 শিগগির আসবে বলে উল্লেখ আছে। যে পথ ব্যবহার করবেন, তার বর্তমান deployment ও region option যাচাই করুন; এই page-গুলোতে একটিমাত্র সামঞ্জস্যপূর্ণ তালিকা নেই। Global access মানেই নির্দিষ্ট processing location-এর প্রতিশ্রুতি নয়।
ঘোষণায় প্রারম্ভিক মূল্য বলা হয়েছে $0.54 প্রতি ঘণ্টা audio, 2026 সালের শেষ পর্যন্ত। আলাদা service বা app-এর infrastructure খরচের আগে, গাণিতিক হিসাবে এটি প্রতি 1,000 audio minute-এ $9। সংশ্লিষ্ট পথের জন্য Microsoft তার guide থেকে Foundry Models ও Speech service-এর মূল্যতালিকায় পাঠায়। পর্যালোচিত সূত্রে প্রারম্ভিক মূল্য শেষ হলে কী rate হবে বা বাস্তবে কত bill এসেছে তা নেই; deployment budget করার আগে বর্তমান মূল্য যাচাই দরকার।
Microsoft বলেছে streaming model-টি ধারাবাহিক automatic detection-সহ 60টি ভাষা সমর্থন করে। তাদের দাবি, audio পাওয়ার পর প্রথম partial আসতে 100 ms-এর সামান্য বেশি লাগে; accuracy-র শীর্ষ অবস্থানের দাবিতে Artificial Analysis-এর উল্লেখও করেছে। Artificial Analysis-এর streaming benchmark প্রায় আট ঘণ্টার weighted dataset-এ word error rate মাপে এবং শনাক্ত করা speech শেষ হওয়ার তুলনায় partial ও final result-এর সময় হিসাব করে। এটি নির্দিষ্ট audio ও timing rule-এর benchmark; কোনো নির্দিষ্ট app 100 ms-এ সঠিক শব্দ দেখাবে তার নিশ্চয়তা নয়। এই প্রতিবেদনের জন্য সংগ্রহ করা public benchmark text-এ model-নির্দিষ্ট result row দেখা যায়নি, তাই Microsoft-এর সুনির্দিষ্ট rank আমরা স্বাধীনভাবে যাচাই করিনি।
আলাদা MAI-Transcribe-2 Azure Speech guide file input এবং speaker diarization, word-level timestamp, keyword biasing, clean বা verbatim style-সহ option নথিবদ্ধ করে। MAI-Transcribe-2-Streaming-এ এসব control কাজ করে ধরে নেবেন না: streaming integration guide-এ এগুলোর উল্লেখ নেই। পণ্যে এসব output দরকার হলে file model যাচাই করুন, অথবা streaming feature-কে ঘিরে নির্মাণের আগে হালনাগাদ নথি ও পরীক্ষায় সমর্থন নিশ্চিত করুন।
সূত্র ও আরও পড়ুন
- Microsoft AI ঘোষণা, 1 অক্টোবর 2026: প্রকাশনা, ভাষার সংখ্যা, গতি ও প্রারম্ভিক মূল্যের দাবি। Microsoft-এর নিজস্ব accuracy ও অভ্যন্তরীণ speed-এর দাবিগুলো উপরে তার নামে উল্লেখ করা হয়েছে।
- Microsoft Foundry model catalog, 2 অক্টোবর যাচাই: model version, preview পর্যায় এবং input/output type। Version ও ঘোষণার তারিখ আলাদা।
- Streaming overview, Realtime API guide এবং Speech SDK guide, 1 অক্টোবর হালনাগাদ: নথিভুক্ত দুই integration path, preview শর্ত, event-এর আচরণ, sample ও region table। BIG CHANGE sample চালায়নি।
- MAI-Transcribe-2 in Azure Speech, 2 অক্টোবর যাচাই: আলাদা file transcription পথ ও তার নথিভুক্ত control। এটি streaming-এ একই feature আছে তা প্রমাণ করে না।
- Artificial Analysis streaming benchmark এবং methodology, 2 অক্টোবর যাচাই: স্বাধীন benchmark-এর নকশা ও timing-এর সংজ্ঞা। Retrieved public text-এ model-এর নির্দিষ্ট result row ছিল না; তাই সুনির্দিষ্ট rank-কে Microsoft-এর দাবি হিসেবে উল্লেখ করা হয়েছে, স্বাধীনভাবে নিশ্চিত করা হয়নি।



