AI-translated from English; not yet reviewed by a fluent editor.
# Microsoft MAI-Transcribe-2-Streaming: लाइव ट्रांसक्रिप्शन की प्रक्रिया और उसकी सीमाएँ
> Microsoft का नया स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल ऑडियो आते ही अस्थायी और अंतिम पाठ देता है। इसके प्रीव्यू API में क्लाइंट को ही टर्न पहचानना और ट्रांसक्रिप्शन को अंतिम रूप देना पड़ता है।
By BIG CHANGE Editorial
Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

AI-generated conceptual illustration by BIG CHANGE.
Microsoft ने [1 अक्टूबर को MAI-Transcribe-2-Streaming की घोषणा की](https://microsoft.ai/news/our-first-streaming-transcription-model/)। यह किसी के बोलते समय ऑडियो लेता है और अंतिम ट्रांसक्रिप्ट से पहले बदलता हुआ पाठ देता है। लाइव कैप्शन या वॉइस इनपुट जोड़ने वाले डेवलपर के लिए अहम सवाल यह है कि ये अपडेट ऐप तक कैसे पहुँचते हैं और उन्हें कब अंतिम माना जा सकता है।
यह सार्वजनिक प्रीव्यू का मूल्यांकन कर रहे डेवलपरों के लिए दस्तावेज़ों पर आधारित एकीकरण की व्याख्या है। काम यह तय करना है कि मॉडल का प्रोटोटाइप बनाया जाए या नहीं और लाइव पाठ दिखाने तथा अंतिम पाठ सहेजने के लिए क्लाइंट में कौन-सा काम करना होगा। Microsoft प्रक्रिया और नमूना कोड बताता है; BIG CHANGE ने मॉडल को तैनात नहीं किया, नमूने नहीं चलाए और इसकी सटीकता या विलंबता नहीं मापी।
## बड़ा बदलाव
- Microsoft ने एक स्ट्रीमिंग मॉडल पेश किया है जो ऑडियो आते ही अस्थायी पाठ लौटाता है और फिर ट्रांसक्रिप्ट के खंडों की पुष्टि करता है। MAI-Transcribe-2 का अलग फ़ाइल-ट्रांसक्रिप्शन मार्ग रिकॉर्ड किया गया ऑडियो लेता है और उसके विकल्प अलग हैं।
- Realtime API इस्तेमाल करने वाले ऐप को सही प्रारूप में ऑडियो भेजना, अस्थायी पाठ के आखिरी हिस्से में होने वाले संशोधनों को संभालना और तय करना होगा कि अंतिम ट्रांसक्रिप्शन कब माँगा जाए। इन्हीं विकल्पों से तय होता है कि उपयोगकर्ताओं को क्या दिखेगा और ऐप का आगे का लॉजिक अंतिम पाठ पर कब भरोसा कर सकता है।
- स्ट्रीमिंग मॉडल सार्वजनिक प्रीव्यू में है और इसके लिए सेवा-स्तर समझौता नहीं है। Microsoft इसे उत्पादन-कार्यभार के लिए इस्तेमाल करने की सलाह नहीं देता। गति और सटीकता के जो आँकड़े उद्धृत किए गए हैं वे लॉन्च तथा बेंचमार्क के दावे हैं, इस गाइड के माप नहीं।
## कनेक्शन का तरीका चुनें
Microsoft का [Foundry कैटलॉग](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) इसे `MAI-Transcribe-2-Streaming`, संस्करण `2026-08-06`, ऑडियो इनपुट और टेक्स्ट आउटपुट वाले प्रीव्यू मॉडल के रूप में सूचीबद्ध करता है। Microsoft का [1 अक्टूबर का अवलोकन](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) एकीकरण के दो तरीके बताता है: OpenAI Realtime-जैसे WebSocket प्रोटोकॉल वाला Realtime API या Azure Speech SDK। दोनों बीच के और अंतिम पहचान-नतीजे लौटाते हैं। SDK कनेक्शन और ऑडियो स्ट्रीमिंग संभालता है; Realtime तरीका इवेंट सीधे उपलब्ध कराता है।
इस [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) के लिए Microsoft Azure सब्सक्रिप्शन, समर्थित क्षेत्र में Microsoft Foundry संसाधन और स्ट्रीमिंग मॉडल की तैनाती ज़रूरी है। इससे कनेक्ट करें: `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` का उपयोग करके Microsoft Entra bearer token या API key से प्रमाणित करें। दस्तावेज़ Entra प्रमाणीकरण की सिफारिश करता है। `session.created` के बाद, `session.update` भेजें, जिसमें अपनी तैनाती का नाम दें और इनपुट प्रारूप तय करें। पहला ऑडियो append करने के बाद यह सेटिंग बदली नहीं जा सकती, commit के बाद भी नहीं।
दर्ज इनपुट 16 या 24 kHz पर raw, signed, little-endian, mono PCM16 ऑडियो है, जिसे base64 chunks के रूप में `input_audio_buffer.append` संदेशों में भेजा जाता है। यह WAV header के बिना PCM डेटा है। विलंबता घटाने के लिए Microsoft 10 से 20 मिलीसेकंड जैसे छोटे chunks की सिफारिश करता है, साथ ही कहता है कि बड़े chunks से नेटवर्क ओवरहेड कम होता है। उसका Python उदाहरण माइक्रोफ़ोन ऑडियो को 100 ms के ब्लॉक में पढ़ता है; पृष्ठ की छोटी chunk वाली सलाह और नमूने का ब्लॉक आकार अलग विकल्प हैं, BIG CHANGE का मापा हुआ नतीजा नहीं।
इस [Speech SDK मार्ग](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) के लिए SDK v1.52.0, Azure सब्सक्रिप्शन और Foundry या Speech संसाधन ज़रूरी हैं। Microsoft का Python नमूना `speech_config.model` को `MAI-Transcribe-2-Streaming` पर सेट करता है, push stream के ज़रिए 16 kHz, 16-bit mono ऑडियो देता है और `recognizing` तथा `recognized` इवेंट सुनता है। push stream दिखाने के लिए नमूने में पहले से मौजूद `audio.pcm` फ़ाइल इस्तेमाल हुई है; ऐप को अपना ऑडियो स्रोत देना होगा। ये दस्तावेज़ में बताए गए इंटरफ़ेस और अपेक्षित इवेंट प्रकार हैं, इस प्रकाशन द्वारा खाते के स्तर पर किया गया संगतता परीक्षण नहीं।
## अस्थायी पाठ को पक्के पाठ से अलग रखें
लाइव इंटरफ़ेस के लिए Realtime इवेंट का अर्थ मायने रखता है। `conversation.item.input_audio_transcription.delta` इवेंट में नया अंतिम किया गया पाठ होता है; क्लाइंट ऐप रिक्त स्थान में बदलाव किए बिना इसे अपने पक्के पाठ के बफ़र में जोड़ता है। `intermediate` इवेंट में इस समय का पूरा अस्थायी अंतिम-हिस्सा होता है। हर नया हिस्सा पिछले हिस्से की जगह लेता है। स्क्रीन पक्के पाठ के बफ़र और मौजूदा अस्थायी हिस्से को साथ दिखा सकती है, लेकिन हर अंतरिम इवेंट को नई पंक्ति की तरह सहेजने से मॉडल के संशोधन के दौरान शब्द दोहरेंगे।
क्लाइंट पहचाने गए विराम पर या रिकॉर्डिंग के अंत में `input_audio_buffer.commit` भेजता है। Microsoft कहता है कि इससे जल्द-से-जल्द अंतिम ट्रांसक्रिप्ट माँगा जाता है; `input_audio_buffer.committed` commit की पुष्टि करता है और `conversation.item.input_audio_transcription.completed` पिछले commit के बाद के ऑडियो का पूरा अंतिम पाठ देता है। [Realtime गाइड](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) कहती है कि इस मॉडल के सत्र कॉन्फ़िगरेशन में सर्वर की turn detection और automatic commit उपलब्ध नहीं हैं। इसलिए स्वचालित खंड-समापन चाहिए तो वॉइस ऐप को विराम या turn की सीमा खुद तय करनी होगी। दस्तावेज़ इवेंट का अनुबंध बताता है; वह ऐसा एक सीमा-पहचान तरीका निर्धारित नहीं करता जो हर स्थिति के लिए सही हो।
Microsoft की गाइड हर Realtime सत्र को एक घंटे तक सीमित करती है। यह भी कहती है कि ऑडियो append को अलग से पावती नहीं मिलती और उससे शून्य या कई ट्रांसक्रिप्शन इवेंट आ सकते हैं। प्रोटोटाइप का मूल्यांकन करने वाले डेवलपरों को ऑडियो संदेश मिलने और अंतिम पाठ मिलने के बीच फर्क रखना चाहिए और तय करना चाहिए कि ऐप कनेक्शन टूटने पर क्या करेगा। सार्वजनिक गाइड के Python उदाहरण में माइक्रोफ़ोन कतार और त्रुटि-संभाल है, लेकिन BIG CHANGE ने इसे चलाकर वास्तविक विफलता-व्यवहार स्थापित नहीं किया।
## पहुँच, क्षेत्र और कीमत
Microsoft कहता है कि Azure अनुरोधों को सेवा देने वाले क्षेत्रों तक route करके मॉडल को विश्वभर से इस्तेमाल किया जा सकता है। 1 अक्टूबर के एकीकरण पृष्ठों में उपलब्ध क्षेत्रों की अलग-अलग सूची है: Realtime गाइड में Sweden Central, Central US और South India हैं; Speech SDK गाइड में Sweden Central, Central US और Southeast Asia हैं। दोनों में East US 2 को जल्द उपलब्ध होने वाला बताया गया है। जिस तरीके का उपयोग करना है, उसके लिए तैनाती और क्षेत्र के मौजूदा विकल्प जाँचें; इन पृष्ठों में एक समान सूची नहीं है। वैश्विक पहुँच का अर्थ किसी खास प्रोसेसिंग स्थान की गारंटी नहीं है।
घोषणा में 2026 के अंत तक ऑडियो के हर घंटे के लिए शुरुआती कीमत **$0.54 प्रति ऑडियो घंटा** बताई गई है। हिसाब से यह हर 1,000 ऑडियो मिनट के लिए $9 है; ऐप द्वारा इस्तेमाल की जाने वाली अलग सेवाओं या इंफ़्रास्ट्रक्चर का खर्च इसमें शामिल नहीं। Microsoft संबंधित तरीकों के लिए अपनी गाइड से Foundry Models और Speech सेवा की कीमत वाले पृष्ठों के लिंक देता है। देखे गए स्रोतों में शुरुआती अवधि के बाद की दर या जाँचा हुआ बिल नहीं दिया गया है, इसलिए तैनाती का बजट बनाते समय मौजूदा कीमत जाँचनी होगी।
Microsoft का कहना है कि स्ट्रीमिंग मॉडल लगातार स्वचालित पहचान के साथ 60 भाषाओं को समर्थन देता है। उसके अनुसार ऑडियो मिलने के 100 ms से थोड़ा अधिक समय बाद पहला आंशिक नतीजा आता है और सटीकता में अग्रणी स्थान के लिए Artificial Analysis का हवाला देता है। [Artificial Analysis का स्ट्रीमिंग बेंचमार्क](https://artificialanalysis.ai/speech-to-text/streaming) लगभग आठ घंटे के भारित डेटासेट पर word error rate मापता है और पहचाने गए भाषण के अंत के सापेक्ष आंशिक तथा अंतिम नतीजों का समय दर्ज करता है। यह निर्धारित ऑडियो और समय-नियमों का बेंचमार्क है, इस बात की गारंटी नहीं कि कोई खास ऐप 100 ms में सही शब्द दिखाएगा। इस लेख के लिए जुटाए गए सार्वजनिक बेंचमार्क पाठ में मॉडल-विशिष्ट नतीजे की पंक्ति न मिलने के कारण हमने Microsoft की सटीक रैंकिंग की स्वतंत्र पुष्टि नहीं की।
अलग [MAI-Transcribe-2 Azure Speech गाइड](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) फ़ाइल इनपुट और speaker diarization, शब्द-स्तरीय timestamps, keyword biasing तथा clean या verbatim शैली जैसे विकल्पों का दस्तावेज़ीकरण करती है। यह न मानें कि MAI-Transcribe-2-Streaming में ये नियंत्रण काम करते हैं: स्ट्रीमिंग एकीकरण की गाइड में उनका ज़िक्र नहीं है। उत्पाद को ऐसे आउटपुट चाहिए तो फ़ाइल मॉडल का मूल्यांकन करें या उस पर निर्माण करने से पहले मौजूदा दस्तावेज़ों और परीक्षण से स्ट्रीमिंग समर्थन की पुष्टि करें।
## स्रोत और आगे पढ़ें
- [Microsoft AI की घोषणा](https://microsoft.ai/news/our-first-streaming-transcription-model/), 1 अक्टूबर 2026: लॉन्च, भाषाओं, गति और शुरुआती कीमत के दावे। Microsoft के अपने सटीकता और आंतरिक गति के दावों का उल्लेख ऊपर स्रोत के साथ किया गया है।
- [Microsoft Foundry मॉडल कैटलॉग](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), 2 अक्टूबर को जाँचा गया: मॉडल संस्करण, प्रीव्यू चरण और इनपुट/आउटपुट के प्रकार; कैटलॉग प्रदर्शन-परीक्षण नहीं है।
- [स्ट्रीमिंग अवलोकन](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Realtime API गाइड](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) और [Speech SDK गाइड](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), 1 अक्टूबर को अपडेट किए गए: एकीकरण के दोनों दर्ज तरीके, प्रीव्यू की शर्तें, इवेंट व्यवहार, उदाहरण और क्षेत्र की तालिकाएँ। BIG CHANGE ने उदाहरण नहीं चलाए।
- [Azure Speech में MAI-Transcribe-2](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), 2 अक्टूबर को जाँचा गया: अलग फ़ाइल-ट्रांसक्रिप्शन तरीका और उसके दर्ज नियंत्रण। इसकी सुविधा-सूची को स्ट्रीमिंग की सुविधा-सूची न मानें।
- [Artificial Analysis का स्ट्रीमिंग बेंचमार्क](https://artificialanalysis.ai/speech-to-text/streaming) और [कार्य-पद्धति](https://artificialanalysis.ai/methodology/speech-to-text), 2 अक्टूबर को जाँचा गया: स्वतंत्र बेंचमार्क की रूपरेखा और समय माप की परिभाषाएँ। उपलब्ध सार्वजनिक पाठ में मॉडल-विशिष्ट नतीजे की पंक्ति नहीं थी, इसलिए Microsoft की सटीक रैंकिंग की स्वतंत्र पुष्टि नहीं हुई।
## Sources
- [Artificial Analysis पर हमारा पहला स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल नंबर 1 पर](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Microsoft AI की लॉन्च घोषणा, 60 भाषाओं और गति के दावे, रैंकिंग का दावा तथा 2026 के अंत तक $0.54 प्रति ऑडियो घंटे की शुरुआती कीमत। ये विक्रेता के दावे हैं, BIG CHANGE के माप नहीं।
- [MAI-Transcribe-2-Streaming | Model Catalog | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — आधिकारिक कैटलॉग: मॉडल संस्करण 2026-08-06, प्रीव्यू चरण और ऑडियो इनपुट/टेक्स्ट आउटपुट। मॉडल का संस्करण घोषणा की तारीख से अलग है।
- [MAI-Transcribe-2-Streaming का अवलोकन](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — 1 अक्टूबर को अंतिम बार अपडेट किया गया आधिकारिक अवलोकन: सार्वजनिक प्रीव्यू, SLA नहीं, उत्पादन के लिए अनुशंसित नहीं, और एकीकरण के दो तरीके।
- [Realtime API के साथ MAI-Transcribe-2-Streaming का उपयोग](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — 1 अक्टूबर को अंतिम बार अपडेट की गई आधिकारिक Realtime गाइड: Foundry तैनाती, WebSocket, PCM16, इवेंट अर्थ, मैनुअल commit, एक घंटे के सत्र और क्षेत्र-सूची। BIG CHANGE ने नमूना नहीं चलाया।
- [Azure Speech SDK के साथ MAI-Transcribe-2-Streaming का उपयोग](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — 1 अक्टूबर को अंतिम बार अपडेट की गई आधिकारिक SDK गाइड: v1.52.0, push audio और पहचान-इवेंट। क्षेत्र की तालिका Realtime गाइड से अलग है। नमूना BIG CHANGE ने नहीं जाँचा।
- [Azure Speech में MAI-Transcribe (प्रीव्यू)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — अलग MAI-Transcribe-2 फ़ाइल-ट्रांसक्रिप्शन तरीका और उसके विकल्प। इससे स्ट्रीमिंग मॉडल के साथ सुविधा-समानता स्थापित नहीं होती।
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — स्वतंत्र बेंचमार्क संचालक streaming WER और विलंबता के माप समझाता है। उपलब्ध सार्वजनिक पाठ में मॉडल-विशिष्ट नतीजे की पंक्ति नहीं थी, इसलिए Microsoft की सटीक रैंकिंग को उसका दावा बताया गया है, स्वतंत्र रूप से पुष्ट नहीं।
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — स्ट्रीम किए गए ऑडियो, डेटासेट, भार और विलंबता की बेंचमार्क पद्धति। बेंचमार्क किसी ऐप की अपनी विलंबता या सटीकता स्थापित नहीं करते।
BIG CHANGE न्यूज़लेटर
बड़ी तस्वीर। आपकी गति से।
AI और रोबोटिक्स पर ताज़ा लेख, ध्यान देने योग्य बदलाव और उपयोगी विचार। दैनिक ब्रीफ़िंग, साप्ताहिक सारांश या मासिक परिप्रेक्ष्य चुनें।
बेलग्रेड समयानुसार 09:00 बजे भेजा जाता है: रोज़ाना, सोमवार को या महीने की पहली तारीख़ को। पुष्टि के बाद अगला अंक तय समय पर भेजा जाएगा।
आपकी गोपनीयता, आपकी पसंद।
ज़रूरी स्टोरेज साइट की सुरक्षा में मदद करता है और आपकी पसंद याद रखता है। आपकी अनुमति मिलने तक वैकल्पिक Google Analytics बंद रहता है। आप हर लेख केवल आवश्यक स्टोरेज के साथ पढ़ सकते हैं। गोपनीयता का विवरण