AI-translated from English; not yet reviewed by a fluent editor.
# MAI-Transcribe-2-Streaming من Microsoft: مسار النسخ الصوتي المباشر وحدوده
> يعيد نموذج Microsoft الجديد للبث النصوص المؤقتة والنهائية مع وصول الصوت. وتترك واجهة المعاينة البرمجية أيضاً اكتشاف نهاية الدور واعتماد النص النهائي للعميل.
By BIG CHANGE Editorial
Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

AI-generated conceptual illustration by BIG CHANGE.
أعلنت Microsoft [عن MAI-Transcribe-2-Streaming في 1 أكتوبر 2026](https://microsoft.ai/news/our-first-streaming-transcription-model/). يستقبل النموذج الصوت أثناء التحدث ويعيد نصاً متغيراً قبل إصدار النص النهائي. وللمطور الذي يضيف تسميات توضيحية مباشرة أو إدخالاً صوتياً إلى تطبيق، يتمثل السؤال المفيد في كيفية وصول هذه التحديثات إلى التطبيق ومتى يمكنه اعتبار النص مستقراً.
هذا شرح تكاملي يستند إلى الوثائق للمطورين الذين يقيّمون المعاينة العامة. والمطلوب تحديد ما إذا كان ينبغي إنشاء نموذج أولي، ومعرفة العمل الذي يلزم على العميل لعرض النص المباشر والاحتفاظ بالنص النهائي. توثق Microsoft المسار والعينة البرمجية؛ ولم تنشر BIG CHANGE النموذج أو تشغّل العينات أو تقِس الدقة أو زمن الاستجابة.
## التغيير الأبرز
- قدمت Microsoft نموذج بث يعيد نصاً مؤقتاً مع وصول الصوت، ثم يؤكد مقاطع التفريغ النصي. أما مسار نسخ الملفات المنفصل MAI-Transcribe-2 فيعالج الصوت المسجل ويوثق مجموعة مختلفة من الخيارات.
- على التطبيق الذي يستخدم Realtime API إرسال صوت منسق على النحو الصحيح، والتعامل مع مراجعات الذيل المؤقت، وتحديد وقت طلب تفريغ مكتمل. وتحدد هذه الخيارات ما يراه المستخدمون ومتى يمكن لمنطق التطبيق اللاحق الاعتماد على النص النهائي.
- نموذج البث في معاينة عامة من دون اتفاقية مستوى خدمة. ولا توصي Microsoft باستخدامه في أحمال الإنتاج. أما ادعاءات السرعة والدقة المنشورة فهي ادعاءات الإطلاق والمعايير المرجعية، وليست قياسات أجراها هذا الدليل.
## اختر مسار الاتصال
يعرض [كتالوج Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) النموذج `MAI-Transcribe-2-Streaming`، إصدار `2026-08-06`، بوصفه نموذجاً في مرحلة المعاينة بإدخال صوتي وإخراج نصي. وتعرض نظرة Microsoft العامة بتاريخ [1 أكتوبر](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) مسارين لدمجه: Realtime API باستخدام بروتوكول WebSocket شبيه بـOpenAI Realtime، أو Azure Speech SDK. ويعيد كلاهما نتائج تعرف وسيطة ونهائية. ويتولى SDK إدارة الاتصال وتدفق الصوت، بينما يكشف مسار Realtime الأحداث مباشرة.
أما مسار [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime)، فتشترط Microsoft اشتراكاً في Azure ومورداً على Microsoft Foundry في منطقة مدعومة ونشراً لنموذج البث. اتصل بالعنوان `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` باستخدام رمز bearer من Microsoft Entra أو مفتاح API. وتوصي الوثائق بالمصادقة عبر Entra. وبعد `session.created`، أرسل `session.update` مع تسمية النشر وتحديد تنسيق الإدخال. ولا يمكن تغيير الإعداد بعد أول إضافة للصوت، حتى بعد تنفيذ commit.
تنسيق الإدخال الموثق هو PCM16 خام بإشارة موقعة وترتيب little-endian وقناة أحادية، بتردد 16 أو 24 كيلوهرتز، ويُرسل في مقاطع base64 ضمن رسائل `input_audio_buffer.append`. وهي بيانات PCM من دون ترويسة WAV. وتوصي Microsoft بمقاطع صغيرة، مثل 10 إلى 20 مللي ثانية، لتقليل زمن الاستجابة، مع الإشارة إلى أن المقاطع الأكبر تقلل عبء الشبكة. وتقرأ عينة Python الصوت من الميكروفون على دفعات مدتها 100 مللي ثانية؛ فنصيحة المقاطع الصغيرة وحجم الدفعة في العينة خياران مختلفان، وليسا نتيجة قاستها BIG CHANGE.
أما [مسار Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) فيتطلب SDK بالإصدار v1.52.0 واشتراكاً في Azure ومورداً على Foundry أو Speech. وتضبط عينة Microsoft بلغة Python الخاصية `speech_config.model` على `MAI-Transcribe-2-Streaming`، وتوفر صوتاً أحادي القناة بتردد 16 كيلوهرتز وعمق 16 بت عبر تدفق دفع، وتستمع إلى الحدثين `recognizing` و `recognized`، وتستخدم العينة ملف `audio.pcm` لتوضيح تدفق الدفع؛ أما التطبيق فيوفر مصدر الصوت الخاص به. هذه واجهات موثقة وأنواع أحداث متوقعة، وليست اختبار توافق على مستوى حساب أجرته هذه الجهة.
## افصل النص المؤقت عن النص المؤكد
تؤثر دلالات أحداث Realtime في تصميم الواجهة المباشرة. يحتوي الحدث `conversation.item.input_audio_transcription.delta` على نص جرى تثبيته حديثاً، ويضيفه التطبيق العميل إلى مخزنه المؤكد من دون تغيير المسافات. أما الحدث `intermediate` فيحتوي على كامل الذيل المؤقت الحالي. ويستبدل كل ذيل جديد الذيل السابق. ويمكن للشاشة عرض النص المؤكد مع الذيل الحالي؛ لكن تخزين كل حدث وسيط كسطر جديد يكرر الكلمات مع مراجعة النموذج لها.
يرسل العميل الحدث `input_audio_buffer.commit` عند توقف رصده أو عند نهاية التسجيل. وتقول Microsoft إن هذا يطلب إصدار التفريغ النهائي بأسرع ما يمكن؛ ويؤكد الحدث `input_audio_buffer.committed` اعتماد هذا الإرسال، بينما يوفر الحدث `conversation.item.input_audio_transcription.completed` النص النهائي الكامل للصوت منذ الإرسال السابق. ويذكر [دليل Realtime](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) أن كشف الأدوار على الخادم والإرسال التلقائي غير متاحين في إعداد جلسة هذا النموذج. لذلك يحتاج التطبيق الصوتي إلى تحديد فاصل خاص به للتوقف أو نهاية الدور إذا أراد إكمال المقاطع تلقائياً. وتصف الوثائق عقد الأحداث؛ لكنها لا تحدد كاشفاً واحداً مناسباً لجميع الحالات.
تضع إرشادات Microsoft حداً أقصى لجلسة Realtime يبلغ ساعة واحدة. وتذكر أيضاً أن إضافة الصوت لا تتلقى إقراراً منفرداً، وقد تنتج عنها صفر أو عدة أحداث تفريغ. وينبغي للمطورين الذين يقيّمون نموذجاً أولياً التمييز بين استلام رسائل الصوت واستلام النص النهائي، وتحديد كيفية تعامل التطبيق مع انقطاع الجلسة. وتتضمن عينة Python العامة في الدليل معالجة لطابور الميكروفون والأخطاء، لكن BIG CHANGE لم تشغلها لإثبات سلوك الأعطال الفعلي.
## الإتاحة والمناطق والسعر
تقول Microsoft إن النموذج متاح عالمياً، مع توجيه Azure للطلبات إلى مناطق تقديم الخدمة. وتذكر صفحتا التكامل الصادرتان في 1 أكتوبر منطقتين متاحتين مختلفتين: يسرد دليل Realtime منطقة Sweden Central وCentral US وSouth India؛ بينما يسرد دليل Speech SDK منطقة Sweden Central وCentral US وSoutheast Asia. وتذكر الصفحتان East US 2 بوصفها متاحة قريباً. تحقق من خيارات النشر والمنطقة الحالية للمسار الذي تنوي استخدامه؛ فالصفحتان لا تقدمان قائمة موحدة متسقة. ولا ينبغي فهم الإتاحة العالمية على أنها ضمان لمعالجة البيانات في موقع محدد.
يورد الإعلان سعراً تمهيدياً قدره **$0.54 لكل ساعة صوت حتى نهاية 2026**. ويعادل ذلك حسابياً 9 دولارات لكل 1000 دقيقة صوتية، قبل احتساب أي خدمات أو بنية تحتية منفصلة يستخدمها التطبيق. وتحيل Microsoft من أدلتها إلى صفحتي أسعار Foundry Models وSpeech service للمسارين على التوالي. ولا تقدم المصادر التي راجعناها سعراً بعد الفترة التمهيدية أو فاتورة مختبرة؛ لذا يتطلب وضع ميزانية للنشر التحقق من الأسعار الحالية.
تقول Microsoft إن نموذج البث يدعم 60 لغة مع الكشف التلقائي المستمر. وتذكر أن أول جزء جزئي يظهر بعد ما يزيد قليلاً على 100 مللي ثانية من استقبال الصوت، وتشير إلى ترتيب متقدم في الدقة بحسب Artificial Analysis. ويقيس [معيار البث من Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) معدل خطأ الكلمات على نحو ثماني ساعات من مجموعات البيانات الموزونة، ويقيس توقيت النتائج الجزئية والنهائية نسبةً إلى نهاية الكلام التي جرى اكتشافها. وهذا معيار لصوت وتوقيت محددين، لا ضمان بأن يعرض تطبيق بعينه الكلمات الصحيحة خلال 100 مللي ثانية. ولم نتحقق بصورة مستقلة من ترتيب Microsoft الدقيق من صف نتيجة خاص بالنموذج في نص المعيار العام الذي استرجعناه لهذه القصة.
أما [دليل MAI-Transcribe-2 في Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) المنفصل فيوثق إدخال الملفات وخيارات منها تحديد المتحدثين والطوابع الزمنية على مستوى الكلمات وترجيح الكلمات الرئيسية وأنماط النص المنقح أو الحرفي. ولا تفترض أن هذه الضوابط تعمل مع MAI-Transcribe-2-Streaming؛ فأدلة تكامل البث لا توثقها. وإذا كان المنتج يحتاج إلى هذه المخرجات، فقيّم نموذج الملفات أو تحقق من دعم البث عبر الوثائق الحالية واختبار قبل بناء المنتج عليها.
## المصادر ومزيد من القراءة
- [إعلان Microsoft AI](https://microsoft.ai/news/our-first-streaming-transcription-model/)، 1 أكتوبر 2026: ادعاءات الإطلاق واللغات والسرعة والسعر التمهيدي. وقد نُسبت أعلاه ادعاءات Microsoft بشأن الدقة والسرعة الداخلية إلى الشركة.
- [كتالوج نماذج Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft)، روجع في 2 أكتوبر: إصدار النموذج ومرحلة المعاينة وأنواع الإدخال والإخراج؛ والكتالوج ليس اختبار أداء.
- [نظرة عامة على البث](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming)، [دليل Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) و[دليل Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk)، حُدثت في 1 أكتوبر: مسارا التكامل الموثقان وشروط المعاينة وسلوك الأحداث والأمثلة وجداول المناطق. ولم تشغّل BIG CHANGE الأمثلة.
- [MAI-Transcribe-2 في Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe)، روجع في 2 أكتوبر: مسار نسخ الملفات المنفصل وعناصر التحكم الموثقة فيه. ولا تثبت قائمة ميزاته تكافؤها مع مسار البث.
- [معيار البث من Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) و[المنهجية](https://artificialanalysis.ai/methodology/speech-to-text)، روجعت في 2 أكتوبر: تصميم المعيار المستقل وتعريفات التوقيت. ولم يكشف النص العام المسترجع عن صف نتيجة محدد للنموذج يتيح تأكيد ترتيبه بصورة مستقلة.
## Sources
- [Our first streaming transcription model debuts at no. 1 on Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — إعلان إطلاق Microsoft AI، وادعاءات دعم 60 لغة والسرعة والترتيب والسعر التمهيدي البالغ 0.54 دولار لكل ساعة صوت حتى نهاية 2026. وهي ادعاءات من المورّد، وليست قياسات أجرتها BIG CHANGE.
- [MAI-Transcribe-2-Streaming | Model Catalog | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — الكتالوج الرسمي: إصدار النموذج 2026-08-06، وحالة المعاينة، وإدخال الصوت وإخراج النص. ويختلف تاريخ الإصدار عن تاريخ الإعلان.
- [MAI-Transcribe-2-Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — نظرة عامة رسمية حُدثت في 1 أكتوبر: معاينة عامة بلا اتفاقية مستوى خدمة، وغير موصى بها للإنتاج، مع مساري تكامل.
- [Use MAI-Transcribe-2-Streaming with the Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — دليل Realtime الرسمي المحدّث في 1 أكتوبر: نشر Foundry وWebSocket وPCM16 ودلالات الأحداث والإرسال اليدوي وجلسات الساعة الواحدة وقائمة المناطق. ولم تشغّل BIG CHANGE العينة.
- [Use MAI-Transcribe-2-Streaming with Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — دليل SDK الرسمي المحدّث في 1 أكتوبر: الإصدار v1.52.0 والصوت عبر تدفق الدفع وأحداث التعرف. ويختلف جدول مناطقه عن دليل Realtime. ولم تُختبر العينة.
- [MAI-Transcribe in Azure Speech (preview)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — مسار منفصل لنسخ الملفات MAI-Transcribe-2 وخياراته. ولا يثبت تكافؤ الميزات مع مسار البث.
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — يشرح مشغّل المعيار المستقل مقاييس معدل خطأ الكلمات وزمن الاستجابة للبث. ولم يكشف النص العام المسترجع عن نتيجة خاصة بالنموذج؛ لذا نُسب ترتيب Microsoft الدقيق إلى الشركة ولم يؤكد بصورة مستقلة.
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — منهجية المعيار للصوت المتدفق ومجموعات البيانات والترجيح وزمن الاستجابة. ولا تثبت المعايير زمن الاستجابة أو الدقة في كل تطبيق.
نشرة BIG CHANGE البريدية
الصورة الأوسع. على وتيرتك.
قصص حديثة عن الذكاء الاصطناعي والروبوتات، وتحولات تستحق المتابعة، وأفكار عملية للتطبيق. اختر موجزًا يوميًا أو خلاصة أسبوعية أو رؤية شهرية.
تُرسل الساعة 09:00 بتوقيت بلغراد: يوميًا أو أيام الاثنين أو في أول الشهر. تصلك نسختك الأولى في موعد الإرسال المجدول التالي بعد التأكيد.
خصوصيتك، خيارك.
يساعد التخزين الضروري على حماية الموقع وتذكّر خياراتك. تظل Google Analytics الاختيارية متوقفة حتى تسمح بها. يمكنك قراءة كل قصة باستخدام التخزين الضروري فقط. تفاصيل الخصوصية