مائیکروسافٹ نے یکم اکتوبر کو MAI-Transcribe-2-Streaming متعارف کرایا۔ یہ کسی شخص کے بولتے وقت آڈیو لیتا ہے اور حتمی نقل سے پہلے بدلتا ہوا متن واپس کرتا ہے۔ live captions یا speech input کو voice app میں شامل کرنے والے ڈویلپر کے لیے اہم سوال یہ ہے کہ یہ اپ ڈیٹس ایپ تک کیسے پہنچتی ہیں اور متن کو کب حتمی سمجھا جا سکتا ہے۔

یہ دستاویزات پر مبنی انضمامی رہنما ہے، جو عوامی پیش نظارہ کا جائزہ لینے والے ڈویلپرز کے لیے ہے۔ مقصد یہ طے کرنا ہے کہ ماڈل کا پروٹوٹائپ بنایا جائے یا نہیں، اور لائیو متن دکھانے اور حتمی متن محفوظ رکھنے کے لیے کلائنٹ پر کیا کام درکار ہوگا۔ مائیکروسافٹ کنکشن کا طریقہ اور نمونہ کوڈ فراہم کرتا ہے؛ BIG CHANGE نے ماڈل deploy نہیں کیا، نمونے نہیں چلائے، اور اس کی درستگی یا تاخیر نہیں ناپی۔

بڑی تبدیلی

  • مائیکروسافٹ نے ایک اسٹریمنگ ماڈل متعارف کرایا ہے جو آڈیو پہنچتے ہی عبوری متن واپس کرتا اور بعد میں نقل کے حصوں کی تصدیق کرتا ہے۔ اس کا الگ MAI-Transcribe-2 فائل ٹرانسکرپشن طریقہ ریکارڈ شدہ آڈیو کے لیے ہے اور اس میں اختیارات کا ایک مختلف مجموعہ دستاویزی شکل میں موجود ہے۔
  • Realtime API استعمال کرنے والی ایپ کو درست فارمیٹ میں آڈیو بھیجنا، عبوری متن کے آخری حصے میں ہونے والی تبدیلیاں سنبھالنا، اور مکمل نقل کب مانگنی ہے یہ طے کرنا ہوگا۔ انہی فیصلوں سے متعین ہوتا ہے کہ صارفین کو کیا دکھے گا اور ایپ کا اگلا عمل حتمی متن پر کب بھروسا کر سکے گا۔
  • اسٹریمنگ ماڈل عوامی پیش نظارہ ہے اور اس کے لیے سروس لیول ایگریمنٹ موجود نہیں۔ مائیکروسافٹ اسے production workloads کے لیے تجویز نہیں کرتا۔ رفتار اور درستگی کے جو اعداد دیے گئے ہیں وہ اجرا اور بینچ مارک کے دعوے ہیں، اس رہنما میں کی گئی پیمائش نہیں۔

کنکشن کا طریقہ منتخب کریں

یہ Microsoft Foundry catalog میں ماڈل MAI-Transcribe-2-Streaming، ورژن 2026-08-06، کو آڈیو اِن پٹ اور ٹیکسٹ آؤٹ پٹ والے پیش نظارہ ماڈل کے طور پر درج کیا گیا ہے۔ مائیکروسافٹ کا یکم اکتوبر کا جائزہ انضمام کے دو طریقے بتاتا ہے: OpenAI Realtime جیسے WebSocket پروٹوکول والا Realtime API، یا Azure Speech SDK۔ دونوں درمیانی اور حتمی شناختی نتائج واپس کرتے ہیں۔ SDK کنکشن اور آڈیو اسٹریمنگ سنبھالتا ہے؛ Realtime طریقے میں ایونٹس براہِ راست ایپ کو ملتے ہیں۔

اس Realtime API کے لیے مائیکروسافٹ کے مطابق Azure subscription، معاون region میں Microsoft Foundry resource، اور اسٹریمنگ ماڈل کی deployment ضروری ہیں۔ کنکشن کے لیے یہ URL استعمال کریں: wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription پر Microsoft Entra bearer token یا API key استعمال کرکے کنکشن قائم کریں۔ دستاویزات Entra authentication تجویز کرتی ہیں۔ اس کے بعد session.created کو session.update بھیجیں اور اس میں deployment کا نام اور اِن پٹ فارمیٹ مقرر کریں۔ پہلی آڈیو شامل کرنے کے بعد یہ سیٹنگ تبدیل نہیں ہو سکتی، commit کے بعد بھی نہیں۔

دستاویزی اِن پٹ خام، signed، little-endian، mono PCM16 ہے، 16 یا 24 kHz پر، اور اسے base64 حصوں کی صورت میں input_audio_buffer.append پیغامات کے ذریعے بھیجا جاتا ہے۔ اس میں WAV header شامل نہیں ہوتا۔ تاخیر کم کرنے کے لیے مائیکروسافٹ 10 سے 20 ملی سیکنڈ جیسے چھوٹے حصے تجویز کرتا ہے، جبکہ یہ بھی کہتا ہے کہ بڑے حصے نیٹ ورک کا اضافی بوجھ کم کرتے ہیں۔ اس کی Python مثال مائیکروفون کی آڈیو 100 ms کے حصوں میں پڑھتی ہے؛ صفحے کی چھوٹے حصوں کی تجویز اور مثال میں استعمال شدہ block size دو الگ انتخاب ہیں، BIG CHANGE کی پیمائش کا نتیجہ نہیں۔

یہ Speech SDK والا طریقہ استعمال کرنے کے لیے v1.52.0 درکار ہے، ساتھ ہی Azure subscription اور Foundry یا Speech resource۔ مائیکروسافٹ کی Python مثال speech_config.model کو MAI-Transcribe-2-Streaming پر سیٹ کرتی ہے، push stream کے ذریعے 16 kHz، 16-bit mono آڈیو فراہم کرتی اور recognizing اور recognized ایونٹس سنتی ہے۔ مثال push stream دکھانے کے لیے پہلے سے موجود audio.pcm فائل استعمال کرتی ہے؛ ایپ کو اپنا آڈیو ماخذ فراہم کرنا ہوگا۔ یہ دستاویزی interfaces اور متوقع event types ہیں، اس اشاعت کی طرف سے کسی اکاؤنٹ پر compatibility test نہیں۔

عبوری متن کو تصدیق شدہ متن سے الگ رکھیں

لائیو انٹرفیس میں Realtime ایونٹس کے معنی اہم ہیں۔ conversation.item.input_audio_transcription.delta ایونٹ میں ابھی حتمی کیا گیا متن ہوتا ہے؛ کلائنٹ اسے spaces بدلے بغیر تصدیق شدہ متن کے buffer میں جوڑتا ہے۔ intermediate ایونٹ میں موجودہ عبوری لاحقے کا پورا متن آتا ہے۔ ہر نیا لاحقہ پچھلے لاحقے کی جگہ لیتا ہے۔ اسکرین تصدیق شدہ متن اور موجودہ لاحقے کو ساتھ دکھا سکتی ہے، لیکن ہر عبوری ایونٹ کو نئی سطر کے طور پر محفوظ کرنے سے ماڈل کی ترمیم کے ساتھ الفاظ دہرائے جائیں گے۔

کلائنٹ input_audio_buffer.commit کو اپنی شناخت کردہ خاموشی کے وقفے پر یا ریکارڈنگ ختم ہونے پر بھیجتا ہے۔ مائیکروسافٹ کے مطابق اس سے جلد از جلد حتمی نقل طلب ہوتی ہے؛ input_audio_buffer.committed commit موصول ہونے کی تصدیق کرتا ہے، اور conversation.item.input_audio_transcription.completed پچھلے commit کے بعد کی آڈیو کا پورا حتمی متن فراہم کرتا ہے۔ Realtime کی گائیڈ کہتی ہے کہ اس ماڈل کی session configuration میں server turn detection اور خودکار commit دستیاب نہیں۔ اس لیے اگر voice app خودکار طور پر حصے مکمل کرنا چاہے تو اسے خاموشی یا turn ختم ہونے کی اپنی حد متعین کرنی ہوگی۔ دستاویزات ایونٹس کا معاہدہ بیان کرتی ہیں؛ وہ سب کے لیے یکساں موزوں boundary detector تجویز نہیں کرتیں۔

مائیکروسافٹ کی گائیڈ ہر Realtime session کو ایک گھنٹے تک محدود کرتی ہے۔ یہ بھی بتاتی ہے کہ آڈیو append کی الگ تصدیق نہیں ملتی اور اس سے transcript کے صفر یا کئی ایونٹس آ سکتے ہیں۔ پروٹوٹائپ کا جائزہ لینے والے ڈویلپرز کو آڈیو پیغامات کی وصولی اور حتمی متن کی وصولی میں فرق رکھنا چاہیے، اور طے کرنا چاہیے کہ session منقطع ہونے پر ایپ کیا کرے گی۔ عوامی گائیڈ کی Python مثال میں مائیکروفون queue اور error handling ہے، مگر BIG CHANGE نے اسے چلا کر ناکامی کے عملی رویے کی تصدیق نہیں کی۔

رسائی، regions اور قیمت

مائیکروسافٹ کہتا ہے کہ ماڈل عالمی طور پر دستیاب ہے اور Azure درخواستوں کو serving regions تک route کرتا ہے۔ یکم اکتوبر کے دونوں انضمامی صفحات پر دستیاب regions کی فہرست مختلف ہے: Realtime گائیڈ میں Sweden Central، Central US اور South India ہیں؛ Speech SDK گائیڈ میں Sweden Central، Central US اور Southeast Asia۔ دونوں میں East US 2 کو جلد دستیاب ہونے والا region کہا گیا ہے۔ جس طریقے کے لیے deployment کرنا ہو اس کے موجودہ region options دیکھیں؛ یہ صفحات ایک ہی یکساں فہرست نہیں دیتے۔ عالمی رسائی کا مطلب یہ نہ لیں کہ درخواست لازماً کسی خاص مقام پر process ہوگی۔

اعلان کے مطابق، 2026 کے اختتام تک آڈیو کے فی گھنٹہ $0.54 کا ابتدائی نرخ درج ہے۔ سادہ حساب سے یہ فی 1,000 منٹ آڈیو $9 بنتا ہے، اس کے علاوہ ایپ میں استعمال ہونے والی کسی الگ service یا infrastructure کی قیمت شامل نہیں۔ مائیکروسافٹ اپنی گائیڈز سے متعلقہ طریقوں کے لیے Foundry Models اور Speech service کے قیمتوں کے صفحات کے لنکس دیتا ہے۔ دیکھی گئی دستاویزات میں ابتدائی مدت کے بعد کی قیمت یا حقیقی آزمائشی بل موجود نہیں، اس لیے deployment کا بجٹ موجودہ قیمتیں جانچ کر بنانا ہوگا۔

مائیکروسافٹ کے مطابق اسٹریمنگ ماڈل مسلسل خودکار شناخت کے ساتھ 60 زبانیں سنبھالتا ہے۔ اس کا کہنا ہے کہ آڈیو موصول ہونے کے 100 ms سے ذرا زیادہ وقت میں پہلا عبوری نتیجہ آ جاتا ہے، اور درستگی میں سرفہرست ہونے کے دعوے کے لیے Artificial Analysis کا حوالہ دیتا ہے۔ Artificial Analysis کا اسٹریمنگ بینچ مارک تقریباً آٹھ گھنٹے کے وزن دیے گئے ڈیٹاسیٹس پر لفظی غلطی کی شرح ناپتا اور عبوری و حتمی نتائج کے وقت کا حساب شناخت شدہ تقریر کے اختتام کے نسبت سے کرتا ہے۔ یہ مخصوص آڈیو اور وقت کے قواعد والا بینچ مارک ہے، اس بات کی ضمانت نہیں کہ کسی خاص ایپ میں 100 ms کے اندر درست الفاظ دکھیں گے۔ اس مضمون کے لیے حاصل کردہ عوامی بینچ مارک متن میں ماڈل کے مخصوص نتیجے کی قطار دستیاب نہیں تھی، اس لیے ہم نے مائیکروسافٹ کی عین درجہ بندی آزادانہ طور پر verify نہیں کی۔

الگ MAI-Transcribe-2 Azure Speech گائیڈ فائل اِن پٹ اور speaker diarization، ہر لفظ کے timestamps، keyword biasing، اور صاف یا لفظ بہ لفظ طرز جیسے اختیارات کی دستاویز دیتی ہے۔ یہ نہ سمجھیں کہ یہ controls MAI-Transcribe-2-Streaming میں بھی کام کرتے ہیں: اسٹریمنگ کے انضمامی guides میں ان کا ذکر نہیں۔ اگر کسی پروڈکٹ کو یہ outputs درکار ہوں تو فائل ماڈل کا جائزہ لیں یا اسٹریمنگ سپورٹ کو موجودہ دستاویزات اور ایک test سے تصدیق کرنے کے بعد ہی اس پر انحصار کریں۔

ذرائع اور مزید مطالعہ

  • Microsoft AI کا اعلان، یکم اکتوبر 2026: اجرا، زبانوں، رفتار اور ابتدائی قیمت کے دعوے۔ مائیکروسافٹ کے اپنے درستگی اور اندرونی رفتار کے دعووں کو اوپر اسی کے نام سے بیان کیا گیا ہے۔
  • Microsoft Foundry model catalog، 2 اکتوبر کو دیکھا گیا: ماڈل ورژن، پیش نظارہ مرحلہ، اور اِن پٹ/آؤٹ پٹ کی اقسام؛ یہ کیٹلاگ کارکردگی کا ٹیسٹ نہیں۔
  • اسٹریمنگ کا جائزہ، Realtime API گائیڈ اور Speech SDK گائیڈ، یکم اکتوبر کو اپ ڈیٹ: انضمام کے دونوں دستاویزی طریقے، پیش نظارہ کی شرائط، ایونٹس کا رویہ، مثالیں اور regions کی جدولیں۔ BIG CHANGE نے یہ مثالیں نہیں چلائیں۔
  • Azure Speech میں MAI-Transcribe-2، 2 اکتوبر کو دیکھا گیا: فائل ٹرانسکرپشن کا الگ طریقہ اور اس کے دستاویزی controls۔ اس کے فیچر اسٹریمنگ کے فیچر ثابت نہیں کرتے۔
  • Artificial Analysis اسٹریمنگ بینچ مارک اور طریقۂ کار، 2 اکتوبر کو دیکھا گیا: آزاد بینچ مارک کی ساخت اور وقت کی تعریفیں۔ حاصل کردہ عوامی متن میں ماڈل کے مخصوص نتیجے کی قطار موجود نہیں تھی، اس لیے عین درجہ بندی کی آزادانہ تصدیق ممکن نہیں ہوئی۔