AI-translated from English; not yet reviewed by a fluent editor.

# مائیکروسافٹ کا MAI-Transcribe-2-Streaming: لائیو نقل کا طریقۂ کار اور حدود

> مائیکروسافٹ کا نیا اسٹریمنگ ٹرانسکرپشن ماڈل آڈیو پہنچنے کے ساتھ عبوری اور حتمی متن واپس کرتا ہے۔ اس کا پیش نظارہ API ٹرن کی شناخت اور حتمی متن طلب کرنے کا کام بھی کلائنٹ پر چھوڑتا ہے۔

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

مائیکروسافٹ [نے یکم اکتوبر کو MAI-Transcribe-2-Streaming متعارف کرایا](https://microsoft.ai/news/our-first-streaming-transcription-model/)۔ یہ کسی شخص کے بولتے وقت آڈیو لیتا ہے اور حتمی نقل سے پہلے بدلتا ہوا متن واپس کرتا ہے۔ live captions یا speech input کو voice app میں شامل کرنے والے ڈویلپر کے لیے اہم سوال یہ ہے کہ یہ اپ ڈیٹس ایپ تک کیسے پہنچتی ہیں اور متن کو کب حتمی سمجھا جا سکتا ہے۔

یہ دستاویزات پر مبنی انضمامی رہنما ہے، جو عوامی پیش نظارہ کا جائزہ لینے والے ڈویلپرز کے لیے ہے۔ مقصد یہ طے کرنا ہے کہ ماڈل کا پروٹوٹائپ بنایا جائے یا نہیں، اور لائیو متن دکھانے اور حتمی متن محفوظ رکھنے کے لیے کلائنٹ پر کیا کام درکار ہوگا۔ مائیکروسافٹ کنکشن کا طریقہ اور نمونہ کوڈ فراہم کرتا ہے؛ BIG CHANGE نے ماڈل deploy نہیں کیا، نمونے نہیں چلائے، اور اس کی درستگی یا تاخیر نہیں ناپی۔

## بڑی تبدیلی

- مائیکروسافٹ نے ایک اسٹریمنگ ماڈل متعارف کرایا ہے جو آڈیو پہنچتے ہی عبوری متن واپس کرتا اور بعد میں نقل کے حصوں کی تصدیق کرتا ہے۔ اس کا الگ MAI-Transcribe-2 فائل ٹرانسکرپشن طریقہ ریکارڈ شدہ آڈیو کے لیے ہے اور اس میں اختیارات کا ایک مختلف مجموعہ دستاویزی شکل میں موجود ہے۔
- Realtime API استعمال کرنے والی ایپ کو درست فارمیٹ میں آڈیو بھیجنا، عبوری متن کے آخری حصے میں ہونے والی تبدیلیاں سنبھالنا، اور مکمل نقل کب مانگنی ہے یہ طے کرنا ہوگا۔ انہی فیصلوں سے متعین ہوتا ہے کہ صارفین کو کیا دکھے گا اور ایپ کا اگلا عمل حتمی متن پر کب بھروسا کر سکے گا۔
- اسٹریمنگ ماڈل عوامی پیش نظارہ ہے اور اس کے لیے سروس لیول ایگریمنٹ موجود نہیں۔ مائیکروسافٹ اسے production workloads کے لیے تجویز نہیں کرتا۔ رفتار اور درستگی کے جو اعداد دیے گئے ہیں وہ اجرا اور بینچ مارک کے دعوے ہیں، اس رہنما میں کی گئی پیمائش نہیں۔

## کنکشن کا طریقہ منتخب کریں

یہ [Microsoft Foundry catalog](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) میں ماڈل `MAI-Transcribe-2-Streaming`، ورژن `2026-08-06`، کو آڈیو اِن پٹ اور ٹیکسٹ آؤٹ پٹ والے پیش نظارہ ماڈل کے طور پر درج کیا گیا ہے۔ مائیکروسافٹ کا [یکم اکتوبر کا جائزہ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) انضمام کے دو طریقے بتاتا ہے: OpenAI Realtime جیسے WebSocket پروٹوکول والا Realtime API، یا Azure Speech SDK۔ دونوں درمیانی اور حتمی شناختی نتائج واپس کرتے ہیں۔ SDK کنکشن اور آڈیو اسٹریمنگ سنبھالتا ہے؛ Realtime طریقے میں ایونٹس براہِ راست ایپ کو ملتے ہیں۔

اس [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) کے لیے مائیکروسافٹ کے مطابق Azure subscription، معاون region میں Microsoft Foundry resource، اور اسٹریمنگ ماڈل کی deployment ضروری ہیں۔ کنکشن کے لیے یہ URL استعمال کریں: `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` پر Microsoft Entra bearer token یا API key استعمال کرکے کنکشن قائم کریں۔ دستاویزات Entra authentication تجویز کرتی ہیں۔ اس کے بعد `session.created` کو `session.update` بھیجیں اور اس میں deployment کا نام اور اِن پٹ فارمیٹ مقرر کریں۔ پہلی آڈیو شامل کرنے کے بعد یہ سیٹنگ تبدیل نہیں ہو سکتی، commit کے بعد بھی نہیں۔

دستاویزی اِن پٹ خام، signed، little-endian، mono PCM16 ہے، 16 یا 24 kHz پر، اور اسے base64 حصوں کی صورت میں `input_audio_buffer.append` پیغامات کے ذریعے بھیجا جاتا ہے۔ اس میں WAV header شامل نہیں ہوتا۔ تاخیر کم کرنے کے لیے مائیکروسافٹ 10 سے 20 ملی سیکنڈ جیسے چھوٹے حصے تجویز کرتا ہے، جبکہ یہ بھی کہتا ہے کہ بڑے حصے نیٹ ورک کا اضافی بوجھ کم کرتے ہیں۔ اس کی Python مثال مائیکروفون کی آڈیو 100 ms کے حصوں میں پڑھتی ہے؛ صفحے کی چھوٹے حصوں کی تجویز اور مثال میں استعمال شدہ block size دو الگ انتخاب ہیں، BIG CHANGE کی پیمائش کا نتیجہ نہیں۔

یہ [Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) والا طریقہ استعمال کرنے کے لیے v1.52.0 درکار ہے، ساتھ ہی Azure subscription اور Foundry یا Speech resource۔ مائیکروسافٹ کی Python مثال `speech_config.model` کو `MAI-Transcribe-2-Streaming` پر سیٹ کرتی ہے، push stream کے ذریعے 16 kHz، 16-bit mono آڈیو فراہم کرتی اور `recognizing` اور `recognized` ایونٹس سنتی ہے۔ مثال push stream دکھانے کے لیے پہلے سے موجود `audio.pcm` فائل استعمال کرتی ہے؛ ایپ کو اپنا آڈیو ماخذ فراہم کرنا ہوگا۔ یہ دستاویزی interfaces اور متوقع event types ہیں، اس اشاعت کی طرف سے کسی اکاؤنٹ پر compatibility test نہیں۔

## عبوری متن کو تصدیق شدہ متن سے الگ رکھیں

لائیو انٹرفیس میں Realtime ایونٹس کے معنی اہم ہیں۔ `conversation.item.input_audio_transcription.delta` ایونٹ میں ابھی حتمی کیا گیا متن ہوتا ہے؛ کلائنٹ اسے spaces بدلے بغیر تصدیق شدہ متن کے buffer میں جوڑتا ہے۔ `intermediate` ایونٹ میں موجودہ عبوری لاحقے کا پورا متن آتا ہے۔ ہر نیا لاحقہ پچھلے لاحقے کی جگہ لیتا ہے۔ اسکرین تصدیق شدہ متن اور موجودہ لاحقے کو ساتھ دکھا سکتی ہے، لیکن ہر عبوری ایونٹ کو نئی سطر کے طور پر محفوظ کرنے سے ماڈل کی ترمیم کے ساتھ الفاظ دہرائے جائیں گے۔

کلائنٹ `input_audio_buffer.commit` کو اپنی شناخت کردہ خاموشی کے وقفے پر یا ریکارڈنگ ختم ہونے پر بھیجتا ہے۔ مائیکروسافٹ کے مطابق اس سے جلد از جلد حتمی نقل طلب ہوتی ہے؛ `input_audio_buffer.committed` commit موصول ہونے کی تصدیق کرتا ہے، اور `conversation.item.input_audio_transcription.completed` پچھلے commit کے بعد کی آڈیو کا پورا حتمی متن فراہم کرتا ہے۔ [Realtime کی گائیڈ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) کہتی ہے کہ اس ماڈل کی session configuration میں server turn detection اور خودکار commit دستیاب نہیں۔ اس لیے اگر voice app خودکار طور پر حصے مکمل کرنا چاہے تو اسے خاموشی یا turn ختم ہونے کی اپنی حد متعین کرنی ہوگی۔ دستاویزات ایونٹس کا معاہدہ بیان کرتی ہیں؛ وہ سب کے لیے یکساں موزوں boundary detector تجویز نہیں کرتیں۔

مائیکروسافٹ کی گائیڈ ہر Realtime session کو ایک گھنٹے تک محدود کرتی ہے۔ یہ بھی بتاتی ہے کہ آڈیو append کی الگ تصدیق نہیں ملتی اور اس سے transcript کے صفر یا کئی ایونٹس آ سکتے ہیں۔ پروٹوٹائپ کا جائزہ لینے والے ڈویلپرز کو آڈیو پیغامات کی وصولی اور حتمی متن کی وصولی میں فرق رکھنا چاہیے، اور طے کرنا چاہیے کہ session منقطع ہونے پر ایپ کیا کرے گی۔ عوامی گائیڈ کی Python مثال میں مائیکروفون queue اور error handling ہے، مگر BIG CHANGE نے اسے چلا کر ناکامی کے عملی رویے کی تصدیق نہیں کی۔

## رسائی، regions اور قیمت

مائیکروسافٹ کہتا ہے کہ ماڈل عالمی طور پر دستیاب ہے اور Azure درخواستوں کو serving regions تک route کرتا ہے۔ یکم اکتوبر کے دونوں انضمامی صفحات پر دستیاب regions کی فہرست مختلف ہے: Realtime گائیڈ میں Sweden Central، Central US اور South India ہیں؛ Speech SDK گائیڈ میں Sweden Central، Central US اور Southeast Asia۔ دونوں میں East US 2 کو جلد دستیاب ہونے والا region کہا گیا ہے۔ جس طریقے کے لیے deployment کرنا ہو اس کے موجودہ region options دیکھیں؛ یہ صفحات ایک ہی یکساں فہرست نہیں دیتے۔ عالمی رسائی کا مطلب یہ نہ لیں کہ درخواست لازماً کسی خاص مقام پر process ہوگی۔

اعلان کے مطابق، **2026 کے اختتام تک آڈیو کے فی گھنٹہ $0.54 کا ابتدائی نرخ** درج ہے۔ سادہ حساب سے یہ فی 1,000 منٹ آڈیو $9 بنتا ہے، اس کے علاوہ ایپ میں استعمال ہونے والی کسی الگ service یا infrastructure کی قیمت شامل نہیں۔ مائیکروسافٹ اپنی گائیڈز سے متعلقہ طریقوں کے لیے Foundry Models اور Speech service کے قیمتوں کے صفحات کے لنکس دیتا ہے۔ دیکھی گئی دستاویزات میں ابتدائی مدت کے بعد کی قیمت یا حقیقی آزمائشی بل موجود نہیں، اس لیے deployment کا بجٹ موجودہ قیمتیں جانچ کر بنانا ہوگا۔

مائیکروسافٹ کے مطابق اسٹریمنگ ماڈل مسلسل خودکار شناخت کے ساتھ 60 زبانیں سنبھالتا ہے۔ اس کا کہنا ہے کہ آڈیو موصول ہونے کے 100 ms سے ذرا زیادہ وقت میں پہلا عبوری نتیجہ آ جاتا ہے، اور درستگی میں سرفہرست ہونے کے دعوے کے لیے Artificial Analysis کا حوالہ دیتا ہے۔ [Artificial Analysis کا اسٹریمنگ بینچ مارک](https://artificialanalysis.ai/speech-to-text/streaming) تقریباً آٹھ گھنٹے کے وزن دیے گئے ڈیٹاسیٹس پر لفظی غلطی کی شرح ناپتا اور عبوری و حتمی نتائج کے وقت کا حساب شناخت شدہ تقریر کے اختتام کے نسبت سے کرتا ہے۔ یہ مخصوص آڈیو اور وقت کے قواعد والا بینچ مارک ہے، اس بات کی ضمانت نہیں کہ کسی خاص ایپ میں 100 ms کے اندر درست الفاظ دکھیں گے۔ اس مضمون کے لیے حاصل کردہ عوامی بینچ مارک متن میں ماڈل کے مخصوص نتیجے کی قطار دستیاب نہیں تھی، اس لیے ہم نے مائیکروسافٹ کی عین درجہ بندی آزادانہ طور پر verify نہیں کی۔

الگ [MAI-Transcribe-2 Azure Speech گائیڈ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) فائل اِن پٹ اور speaker diarization، ہر لفظ کے timestamps، keyword biasing، اور صاف یا لفظ بہ لفظ طرز جیسے اختیارات کی دستاویز دیتی ہے۔ یہ نہ سمجھیں کہ یہ controls MAI-Transcribe-2-Streaming میں بھی کام کرتے ہیں: اسٹریمنگ کے انضمامی guides میں ان کا ذکر نہیں۔ اگر کسی پروڈکٹ کو یہ outputs درکار ہوں تو فائل ماڈل کا جائزہ لیں یا اسٹریمنگ سپورٹ کو موجودہ دستاویزات اور ایک test سے تصدیق کرنے کے بعد ہی اس پر انحصار کریں۔

## ذرائع اور مزید مطالعہ

- [Microsoft AI کا اعلان](https://microsoft.ai/news/our-first-streaming-transcription-model/)، یکم اکتوبر 2026: اجرا، زبانوں، رفتار اور ابتدائی قیمت کے دعوے۔ مائیکروسافٹ کے اپنے درستگی اور اندرونی رفتار کے دعووں کو اوپر اسی کے نام سے بیان کیا گیا ہے۔
- [Microsoft Foundry model catalog](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft)، 2 اکتوبر کو دیکھا گیا: ماڈل ورژن، پیش نظارہ مرحلہ، اور اِن پٹ/آؤٹ پٹ کی اقسام؛ یہ کیٹلاگ کارکردگی کا ٹیسٹ نہیں۔
- [اسٹریمنگ کا جائزہ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming)، [Realtime API گائیڈ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) اور [Speech SDK گائیڈ](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk)، یکم اکتوبر کو اپ ڈیٹ: انضمام کے دونوں دستاویزی طریقے، پیش نظارہ کی شرائط، ایونٹس کا رویہ، مثالیں اور regions کی جدولیں۔ BIG CHANGE نے یہ مثالیں نہیں چلائیں۔
- [Azure Speech میں MAI-Transcribe-2](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe)، 2 اکتوبر کو دیکھا گیا: فائل ٹرانسکرپشن کا الگ طریقہ اور اس کے دستاویزی controls۔ اس کے فیچر اسٹریمنگ کے فیچر ثابت نہیں کرتے۔
- [Artificial Analysis اسٹریمنگ بینچ مارک](https://artificialanalysis.ai/speech-to-text/streaming) اور [طریقۂ کار](https://artificialanalysis.ai/methodology/speech-to-text)، 2 اکتوبر کو دیکھا گیا: آزاد بینچ مارک کی ساخت اور وقت کی تعریفیں۔ حاصل کردہ عوامی متن میں ماڈل کے مخصوص نتیجے کی قطار موجود نہیں تھی، اس لیے عین درجہ بندی کی آزادانہ تصدیق ممکن نہیں ہوئی۔

## Sources

- [Our first streaming transcription model debuts at no. 1 on Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — مائیکروسافٹ AI کا اجرا اعلان، 60 زبانوں اور رفتار، درجہ بندی، اور 2026 کے اختتام تک ابتدائی $0.54 فی گھنٹہ آڈیو قیمت کے دعوے۔ فراہم کنندہ کے دعوے؛ BIG CHANGE کی پیمائش نہیں۔
- [MAI-Transcribe-2-Streaming | Model Catalog | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — سرکاری کیٹلاگ: ماڈل ورژن 2026-08-06، پیش نظارہ lifecycle، آڈیو اِن پٹ اور ٹیکسٹ آؤٹ پٹ۔ ورژن کی تاریخ اعلان کی تاریخ سے الگ ہے۔
- [MAI-Transcribe-2-Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — یکم اکتوبر کو آخری بار اپ ڈیٹ کیا گیا سرکاری جائزہ: عوامی پیش نظارہ، SLA نہیں، production کے لیے تجویز نہیں، اور انضمام کے دو طریقے۔
- [Use MAI-Transcribe-2-Streaming with the Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — یکم اکتوبر کو آخری بار اپ ڈیٹ کی گئی سرکاری Realtime گائیڈ: Foundry deployment، WebSocket، PCM16، ایونٹس کے معنی، manual commit، ایک گھنٹے کے sessions اور regions کی فہرست۔ BIG CHANGE نے نمونہ نہیں چلایا۔
- [Use MAI-Transcribe-2-Streaming with Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — یکم اکتوبر کو آخری بار اپ ڈیٹ کی گئی سرکاری SDK گائیڈ: v1.52.0، push audio اور recognition events۔ regions کی جدول Realtime گائیڈ سے مختلف ہے۔ BIG CHANGE نے نمونہ نہیں آزمایا۔
- [MAI-Transcribe in Azure Speech (preview)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — MAI-Transcribe-2 کا الگ فائل ٹرانسکرپشن طریقہ اور اس کے اختیارات۔ اس سے اسٹریمنگ کے ساتھ فیچرز کی برابری ثابت نہیں ہوتی۔
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — آزاد بینچ مارک آپریٹر اسٹریمنگ WER اور latency کے پیمانوں کی وضاحت کرتا ہے۔ حاصل کردہ عوامی متن میں ماڈل کے مخصوص نتیجے کی قطار نہیں تھی، اس لیے مائیکروسافٹ کی عین درجہ بندی اسی سے منسوب ہے، آزادانہ طور پر تصدیق شدہ نہیں۔
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — اسٹریمنگ آڈیو، ڈیٹاسیٹس، وزن دینے اور latency کے بینچ مارک طریقۂ کار۔ بینچ مارکس ہر ایپ کی latency یا درستگی ثابت نہیں کرتے۔
