AI-translated from English; not yet reviewed by a fluent editor.
# Microsoft-এর MAI-Transcribe-2-Streaming: সরাসরি প্রতিলিপির ধাপ ও সীমা
> Microsoft-এর নতুন streaming transcription model-এ audio আসার সঙ্গে সঙ্গে অস্থায়ী এবং চূড়ান্ত text পাওয়া যায়। Preview API-তে turn শনাক্ত করা ও প্রতিলিপি চূড়ান্ত করার কাজ client-এর ওপর থাকে।
By BIG CHANGE Editorial
Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

AI-generated conceptual illustration by BIG CHANGE.
Microsoft [1 অক্টোবর MAI-Transcribe-2-Streaming ঘোষণা করেছে](https://microsoft.ai/news/our-first-streaming-transcription-model/)। কথা বলার সময় এটি audio নেয় এবং চূড়ান্ত transcript দেওয়ার আগে বদলাতে থাকা text ফেরত দেয়। Voice app-এ live caption বা speech input যোগ করা developer-এর জন্য মূল প্রশ্ন হলো, এই update-গুলো app-এ কীভাবে পৌঁছায় এবং কখন সেগুলোকে স্থির বলে ধরা যায়।
এটি public preview মূল্যায়নকারী developer-দের জন্য নথিভিত্তিক integration নির্দেশিকা। লক্ষ্য হলো, model-টি prototype করা উচিত কি না এবং live text দেখানো ও চূড়ান্ত text ধরে রাখার জন্য client-এ কী কাজ দরকার তা নির্ধারণ করা। Microsoft সংযোগপথ ও sample code নথিবদ্ধ করেছে; BIG CHANGE model-টি deploy করেনি, sample চালায়নি এবং এর নির্ভুলতা বা latency মাপেনি।
## মূল পরিবর্তন
- Microsoft এমন streaming model এনেছে, যা audio আসার সঙ্গে সঙ্গে অস্থায়ী text ফেরত দেয়, পরে transcript-এর অংশগুলো নিশ্চিত করে। আলাদা MAI-Transcribe-2 file transcription পথটি আগে রেকর্ড করা audio নিয়ে কাজ করে এবং ভিন্ন ধরনের option নথিবদ্ধ করে।
- Realtime API ব্যবহারকারী app-কে সঠিক format-এ audio পাঠাতে হয়, অস্থায়ী text-এর শেষ অংশে সংশোধন সামলাতে হয় এবং কখন সম্পূর্ণ transcript চাইবে তা ঠিক করতে হয়। এসব সিদ্ধান্তে ব্যবহারকারী কী দেখবেন এবং app-এর পরবর্তী logic কখন চূড়ান্ত text-এর ওপর নির্ভর করতে পারবে, তা নির্ধারিত হয়।
- Streaming model-টি service-level agreement ছাড়া public preview-তে আছে। Microsoft production workload-এর জন্য এটি সুপারিশ করে না। গতি ও নির্ভুলতা নিয়ে প্রকাশিত সংখ্যা উদ্বোধনী ঘোষণা ও benchmark-এর দাবি, এই নির্দেশিকার নিজস্ব মাপ নয়।
## সংযোগের পথ বেছে নিন
Microsoft Foundry-র [মডেল ক্যাটালগে ](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft)তালিকাভুক্ত আছে: `MAI-Transcribe-2-Streaming`, সংস্করণ `2026-08-06`, audio input ও text output-সহ preview model হিসেবে নথিভুক্ত। Microsoft-এর [1 অক্টোবরের overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) integration-এর দুটি উপায় দেখায়: OpenAI Realtime-এর মতো WebSocket protocol-সহ Realtime API, অথবা Azure Speech SDK। দুটোতেই অন্তর্বর্তী ও চূড়ান্ত recognition result পাওয়া যায়। SDK connection ও audio streaming সামলায়; Realtime পথ event-গুলো সরাসরি দেখায়।
এই [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime)-এর জন্য Azure subscription, Microsoft Entra bearer token বা API key, supported region-এ Microsoft Foundry resource এবং streaming model deployment দরকার। সংযোগ করুন `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` ব্যবহার করে Microsoft Entra bearer token বা API key দিয়ে। Microsoft Entra authentication-ই নথিতে সুপারিশ করা হয়েছে। এরপর `session.created` এলে, `session.update` পাঠিয়ে deployment-এর নাম ও input format নির্দিষ্ট করুন। প্রথম audio append-এর পর, commit হলেও, এই setting আর বদলানো যায় না।
নথিভুক্ত input হলো raw, signed, little-endian, mono PCM16 audio, 16 বা 24 kHz-এ; base64 chunk হিসেবে পাঠাতে হয় `input_audio_buffer.append` message-এ। এটি WAV header ছাড়া PCM data। Latency কমাতে Microsoft 10 থেকে 20 millisecond-এর মতো ছোট chunk সুপারিশ করে, তবে বড় chunk-এ network overhead কমে বলেও উল্লেখ করে। Python sample-এ microphone audio 100 ms block-এ পড়া হয়; ছোট chunk-এর পরামর্শ ও sample-এর block size আলাদা পছন্দ, BIG CHANGE-এর মাপা ফল নয়।
Azure [Speech SDK-র পথ ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk)ব্যবহার করতে SDK v1.52.0, Azure subscription এবং Foundry বা Speech resource দরকার। Microsoft-এর Python sample-এ `speech_config.model` = `MAI-Transcribe-2-Streaming` দিয়ে 16 kHz, 16-bit mono audio push stream-এ দেওয়া হয় এবং `recognizing` ও `recognized` event শোনা হয়। Sample-টি আগে থেকে থাকা `audio.pcm` file দিয়ে push stream দেখায়; app নিজস্ব audio source দেবে। এগুলো নথিভুক্ত interface ও প্রত্যাশিত event type, BIG CHANGE-এর account-স্তরের compatibility test নয়।
## অস্থায়ী text ও নিশ্চিত text আলাদা রাখুন
Live interface-এ Realtime event-এর অর্থ গুরুত্বপূর্ণ। `conversation.item.input_audio_transcription.delta` event-এ সদ্য চূড়ান্ত হওয়া text থাকে; client app spacing না বদলে তা confirmed buffer-এ যোগ করে। `intermediate` event-এ বর্তমান অস্থায়ী suffix-এর পুরোটা থাকে। প্রতিটি নতুন suffix আগেরটিকে প্রতিস্থাপন করে। Screen-এ confirmed buffer-এর সঙ্গে বর্তমান suffix দেখানো যায়; model সংশোধন করার সময় প্রতিটি interim event আলাদা line হিসেবে জমালে শব্দ বারবার দেখা যাবে।
Client শনাক্ত করা বিরতিতে বা recording শেষে `input_audio_buffer.commit` পাঠায়। Microsoft বলেছে, এতে যত দ্রুত সম্ভব final transcript চাওয়া হয়; `input_audio_buffer.committed` commit গ্রহণের কথা জানায়, আর `conversation.item.input_audio_transcription.completed` আগের commit-এর পর থেকে audio-র সম্পূর্ণ final text দেয়। [Realtime guide](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) বলেছে, এই model-এর session configuration-এ server-side turn detection ও automatic commit নেই। তাই স্বয়ংক্রিয়ভাবে segment শেষ করতে চাইলে voice app-কে নিজের pause বা turn boundary নির্ধারণ করতে হবে। নথিতে event-এর নিয়ম বলা আছে; সবার জন্য উপযুক্ত একক boundary detector দেওয়া নেই।
Microsoft-এর guide অনুযায়ী প্রতিটি Realtime session সর্বোচ্চ এক ঘণ্টা চলে। প্রতিটি audio append-এর আলাদা acknowledgment নেই; এর ফলে শূন্য বা একাধিক transcript event আসতে পারে। Prototype মূল্যায়নকারী developer-দের audio message পৌঁছানো আর final text পাওয়া আলাদা করে দেখতে হবে এবং session বিচ্ছিন্ন হলে app কী করবে তা স্থির করতে হবে। Public guide-এর Python sample-এ microphone queue ও error handling আছে, কিন্তু BIG CHANGE সেটি চালিয়ে ব্যর্থতার বাস্তব আচরণ যাচাই করেনি।
## প্রবেশাধিকার, region ও মূল্য
Microsoft বলেছে model-টি বিশ্বজুড়ে ব্যবহার করা যায়, আর Azure অনুরোধকে serving region-এ পাঠায়। 1 অক্টোবরের দুই integration page-এ উপলভ্য region-এর তালিকা আলাদা: Realtime guide-এ Sweden Central, Central US ও South India; Speech SDK guide-এ Sweden Central, Central US ও Southeast Asia। দুটিতেই East US 2 শিগগির আসবে বলে উল্লেখ আছে। যে পথ ব্যবহার করবেন, তার বর্তমান deployment ও region option যাচাই করুন; এই page-গুলোতে একটিমাত্র সামঞ্জস্যপূর্ণ তালিকা নেই। Global access মানেই নির্দিষ্ট processing location-এর প্রতিশ্রুতি নয়।
ঘোষণায় প্রারম্ভিক মূল্য বলা হয়েছে **$0.54 প্রতি ঘণ্টা audio, 2026 সালের শেষ পর্যন্ত**। আলাদা service বা app-এর infrastructure খরচের আগে, গাণিতিক হিসাবে এটি প্রতি 1,000 audio minute-এ $9। সংশ্লিষ্ট পথের জন্য Microsoft তার guide থেকে Foundry Models ও Speech service-এর মূল্যতালিকায় পাঠায়। পর্যালোচিত সূত্রে প্রারম্ভিক মূল্য শেষ হলে কী rate হবে বা বাস্তবে কত bill এসেছে তা নেই; deployment budget করার আগে বর্তমান মূল্য যাচাই দরকার।
Microsoft বলেছে streaming model-টি ধারাবাহিক automatic detection-সহ 60টি ভাষা সমর্থন করে। তাদের দাবি, audio পাওয়ার পর প্রথম partial আসতে 100 ms-এর সামান্য বেশি লাগে; accuracy-র শীর্ষ অবস্থানের দাবিতে Artificial Analysis-এর উল্লেখও করেছে। [Artificial Analysis-এর streaming benchmark](https://artificialanalysis.ai/speech-to-text/streaming) প্রায় আট ঘণ্টার weighted dataset-এ word error rate মাপে এবং শনাক্ত করা speech শেষ হওয়ার তুলনায় partial ও final result-এর সময় হিসাব করে। এটি নির্দিষ্ট audio ও timing rule-এর benchmark; কোনো নির্দিষ্ট app 100 ms-এ সঠিক শব্দ দেখাবে তার নিশ্চয়তা নয়। এই প্রতিবেদনের জন্য সংগ্রহ করা public benchmark text-এ model-নির্দিষ্ট result row দেখা যায়নি, তাই Microsoft-এর সুনির্দিষ্ট rank আমরা স্বাধীনভাবে যাচাই করিনি।
আলাদা [MAI-Transcribe-2 Azure Speech guide](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) file input এবং speaker diarization, word-level timestamp, keyword biasing, clean বা verbatim style-সহ option নথিবদ্ধ করে। MAI-Transcribe-2-Streaming-এ এসব control কাজ করে ধরে নেবেন না: streaming integration guide-এ এগুলোর উল্লেখ নেই। পণ্যে এসব output দরকার হলে file model যাচাই করুন, অথবা streaming feature-কে ঘিরে নির্মাণের আগে হালনাগাদ নথি ও পরীক্ষায় সমর্থন নিশ্চিত করুন।
## সূত্র ও আরও পড়ুন
- [Microsoft AI ঘোষণা](https://microsoft.ai/news/our-first-streaming-transcription-model/), 1 অক্টোবর 2026: প্রকাশনা, ভাষার সংখ্যা, গতি ও প্রারম্ভিক মূল্যের দাবি। Microsoft-এর নিজস্ব accuracy ও অভ্যন্তরীণ speed-এর দাবিগুলো উপরে তার নামে উল্লেখ করা হয়েছে।
- [Microsoft Foundry model catalog](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), 2 অক্টোবর যাচাই: model version, preview পর্যায় এবং input/output type। Version ও ঘোষণার তারিখ আলাদা।
- [Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Realtime API guide](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) এবং [Speech SDK guide](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), 1 অক্টোবর হালনাগাদ: নথিভুক্ত দুই integration path, preview শর্ত, event-এর আচরণ, sample ও region table। BIG CHANGE sample চালায়নি।
- [MAI-Transcribe-2 in Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), 2 অক্টোবর যাচাই: আলাদা file transcription পথ ও তার নথিভুক্ত control। এটি streaming-এ একই feature আছে তা প্রমাণ করে না।
- [Artificial Analysis streaming benchmark](https://artificialanalysis.ai/speech-to-text/streaming) এবং [methodology](https://artificialanalysis.ai/methodology/speech-to-text), 2 অক্টোবর যাচাই: স্বাধীন benchmark-এর নকশা ও timing-এর সংজ্ঞা। Retrieved public text-এ model-এর নির্দিষ্ট result row ছিল না; তাই সুনির্দিষ্ট rank-কে Microsoft-এর দাবি হিসেবে উল্লেখ করা হয়েছে, স্বাধীনভাবে নিশ্চিত করা হয়নি।
## Sources
- [Artificial Analysis-এ আমাদের প্রথম streaming transcription model-এর অভিষেক এক নম্বরে](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Microsoft AI-র উদ্বোধনী ঘোষণা, 60 ভাষা ও গতির দাবি, ranking-এর বক্তব্য এবং 2026 পর্যন্ত প্রতি audio ঘণ্টায় প্রারম্ভিক $0.54 মূল্য। এগুলো বিক্রেতার দাবি, BIG CHANGE-এর মাপ নয়।
- [MAI-Transcribe-2-Streaming | Model Catalog | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — অফিসিয়াল catalog: model version 2026-08-06, preview পর্যায়, audio input ও text output। Version ঘোষণার তারিখ থেকে আলাদা।
- [MAI-Transcribe-2-Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — 1 অক্টোবর সর্বশেষ হালনাগাদ করা অফিসিয়াল overview: SLA ছাড়া public preview, production-এর জন্য সুপারিশ নয় এবং সংযোগের দুই পথ।
- [Use MAI-Transcribe-2-Streaming with the Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — 1 অক্টোবর হালনাগাদ অফিসিয়াল Realtime guide: Foundry deployment, WebSocket, PCM16, event semantics, manual commit, এক ঘণ্টার session এবং region তালিকা। BIG CHANGE sample চালায়নি।
- [Use MAI-Transcribe-2-Streaming with Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — 1 অক্টোবর হালনাগাদ অফিসিয়াল SDK guide: v1.52.0, push audio ও recognition event। Region table Realtime guide থেকে আলাদা। BIG CHANGE sample পরীক্ষা করেনি।
- [MAI-Transcribe in Azure Speech (preview)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — আলাদা MAI-Transcribe-2 file path ও option। Streaming-এর সঙ্গে একই feature আছে তা প্রতিষ্ঠা করে না।
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — স্বাধীন benchmark পরিচালনাকারী প্রতিষ্ঠান streaming WER ও latency মেট্রিক ব্যাখ্যা করে। Retrieved public text-এ model-নির্দিষ্ট row দেখা যায়নি; তাই Microsoft-এর নির্দিষ্ট rank স্বাধীনভাবে নিশ্চিত করা হয়নি।
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — Streamed audio, dataset, weighting ও latency-র benchmark পদ্ধতি। Benchmark কোনো app-এর latency বা নির্ভুলতা প্রতিষ্ঠা করে না।
BIG CHANGE নিউজলেটার
বড় ছবিটা। আপনার গতিতে।
এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।
Belgrade সময় 09:00-এ পাঠানো হয়: প্রতিদিন, সোমবারে বা মাসের প্রথম দিনে। নিশ্চিত করার পরের নির্ধারিত পাঠানোতেই আপনার প্রথম সংস্করণ আসবে।
আপনার গোপনীয়তা, আপনার পছন্দ।
প্রয়োজনীয় স্টোরেজ সাইটের নিরাপত্তায় সাহায্য করে এবং আপনার পছন্দ মনে রাখে। আপনি অনুমতি না দেওয়া পর্যন্ত ঐচ্ছিক Google Analytics বন্ধ থাকবে। প্রয়োজনীয় স্টোরেজ ব্যবহার করেই প্রতিটি গল্প পড়তে পারেন। গোপনীয়তার বিবরণ