जग स्थिर नाही.RSS
BIG CHANGE.

Markdown आवृत्ती

AI-translated from English; not yet reviewed by a fluent editor.

# Microsoft MAI-Transcribe-2-Streaming: थेट लिप्यंतरण आणि मर्यादा

> Microsoft चे नवे streaming लिप्यंतरण मॉडेल audio येताच तात्पुरता व अंतिम मजकूर देते. Preview API मध्ये turn ओळखणे व मजकूर अंतिम करणे client वर सोपवले आहे.

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Microsoft ने [1 ऑक्टोबरला MAI-Transcribe-2-Streaming जाहीर केले](https://microsoft.ai/news/our-first-streaming-transcription-model/). बोलताना audio दिल्यास अंतिम प्रत तयार होण्यापूर्वी बदलता मजकूर मिळतो. Voice app मध्ये live captions वा speech input जोडणाऱ्या विकासकांसाठी हे अपडेट app पर्यंत कसे येतात आणि कधी अंतिम मानायचे हे उपयुक्त प्रश्न आहेत.

हा public preview तपासणाऱ्या विकासकांसाठी दस्तऐवजांवर आधारित integration मार्गदर्शक आहे. मॉडेलचा prototype करायचा का आणि live मजकूर दाखवण्यासाठी व अंतिम मजकूर ठेवण्यासाठी client मध्ये काय करावे लागेल हे ठरवणे उद्दिष्ट. Microsoft मार्ग व नमुना कोड देते; BIG CHANGE ने मॉडेल तैनात केलेले, नमुने चालवलेले किंवा अचूकता वा latency मोजलेली नाही.

## मोठा बदल

- Microsoft ने streaming मॉडेल आणले: audio आल्यावर तात्पुरता मजकूर आणि मग पुष्टी केलेले लिप्यंतरित भाग. स्वतंत्र MAI-Transcribe-2 file transcription मार्ग रेकॉर्ड केलेल्या audio साठी आहे; त्यात वेगळे पर्याय आहेत.
- Realtime API वापरणाऱ्या app ने योग्य audio स्वरूप पाठवावे, तात्पुरत्या मजकुराच्या शेवटच्या भागातील बदल हाताळावेत आणि पूर्ण मजकूर कधी मागवायचा ठरवावे. वापरकर्त्याला काय दिसेल व पुढील app logic अंतिम मजकुरावर केव्हा अवलंबू शकेल हे यावर ठरते.
- Streaming मॉडेल SLA नसलेला public preview आहे; Microsoft उत्पादनात वापरण्याची शिफारस करत नाही. वेग व अचूकतेचे प्रकाशित आकडे हे प्रारंभिक किंवा benchmark दावे आहेत; या लेखातील मोजमापे नाहीत.

## जोडणीचा मार्ग निवडा

या [Microsoft Foundry catalog](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) मध्ये सूची आहे: `MAI-Transcribe-2-Streaming`version `2026-08-06`preview मॉडेल म्हणून audio input व text output. Microsoft चे [1 ऑक्टोबरचे विहंगावलोकन](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) दोन मार्ग सांगते: OpenAI Realtime-सदृश WebSocket protocol असलेला Realtime API किंवा Azure Speech SDK. दोन्ही मधले व अंतिम ओळख-परिणाम देतात. SDK जोडणी व audio streaming सांभाळते; Realtime मार्गात इव्हेंट थेट हाताळावे लागतात.

या मार्गासाठी [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), Microsoft Azure subscription, समर्थित प्रदेशातील Foundry resource आणि streaming मॉडेल deployment मागते. `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` Microsoft Entra bearer token किंवा API key वापरून जोडावे. दस्तऐवज Entra authentication सुचवते. त्यानंतर `session.created`deployment चे नाव व input format देणारा `session.update` संदेश पाठवा. पहिला audio append झाल्यावर, commit नंतरही, setting बदलत नाही.

दस्तऐवजीकृत input 16 वा 24 kHz raw, signed little-endian mono PCM16 आहे; base64 chunks मधील messages मध्ये `input_audio_buffer.append` पाठवला जातो. WAV header नसलेला PCM डेटा. Microsoft 10–20 ms छोटे chunks सुचवते; मोठे chunks network overhead कमी करतात. Python उदाहरण mic audio 100 ms blocks मध्ये वाचते. या वेगळ्या निवडी; BIG CHANGE ची मोजमापे नाहीत.

हा [Speech SDK मार्ग](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) SDK v1.52.0, Azure subscription आणि Foundry वा Speech resource मागतो. Python नमुन्यात `speech_config.model` ची setting `MAI-Transcribe-2-Streaming`आहे; push stream मधून 16 kHz, 16-bit mono audio देते आणि `recognizing` आणि `recognized` इव्हेंट. नमुना आधीपासूनची `audio.pcm` फाइल push stream दाखवण्यासाठी वापरतो; app स्वतःचा audio स्रोत देईल. या दस्तऐवजीकृत interface व अपेक्षित इव्हेंट आहेत; प्रकाशनाने खात्याची compatibility तपासलेली नाही.

## तात्पुरता मजकूर पुष्टी झालेल्या मजकुरापासून वेगळा ठेवा

Live interface साठी Realtime इव्हेंटचा अर्थ महत्त्वाचा. `conversation.item.input_audio_transcription.delta` इव्हेंटमध्ये नवा अंतिम मजकूर येतो; client spacing न बदलता पुष्टीच्या buffer मध्ये जोडतो. `intermediate` इव्हेंटमध्ये सध्याचा संपूर्ण तात्पुरता शेवटचा भाग असतो. नवा भाग मागील भाग बदलतो. स्क्रीन पुष्टीचा मजकूर आणि सध्याचा भाग दाखवू शकते; प्रत्येक मधला इव्हेंट नवी ओळ म्हणून साठवल्यास शब्द पुन्हा दिसू शकतात.

Client `input_audio_buffer.commit` विराम ओळखल्यावर किंवा रेकॉर्डिंगच्या शेवटी पाठवतो. Microsoft नुसार याने शक्य तितक्या लवकर अंतिम मजकूर मागितला जातो; `input_audio_buffer.committed` commit ची पोच देतो आणि `conversation.item.input_audio_transcription.completed` मागील commit पासूनच्या audio चा पूर्ण मजकूर देतो. [Realtime मार्गदर्शक](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) या मॉडेलच्या session मध्ये server turn detection किंवा auto-commit उपलब्ध नाही. आपोआप भाग पूर्ण करायचा असल्यास app ला स्वतःचा विराम किंवा turn boundary ठरवावा लागतो. इव्हेंटचा करार दस्तऐवजीकृत आहे; सर्वांसाठी योग्य boundary detector सुचवलेला नाही.

Microsoft Realtime session ची मर्यादा एक तास सांगते. प्रत्येक audio append ला स्वतंत्र acknowledgment नसतो; त्यातून शून्य वा अनेक transcript इव्हेंट येऊ शकतात. Prototype तपासताना audio संदेश मिळणे आणि अंतिम मजकूर मिळणे वेगळे मोजा व session तुटल्यास app चे वर्तन ठरवा. सार्वजनिक Python उदाहरणात mic queue आणि error handling आहे; प्रत्यक्ष failure तपासण्यासाठी BIG CHANGE ने ते चालवलेले नाही.

## प्रवेश, प्रदेश आणि किंमत

Microsoft मॉडेल जागतिक स्तरावर उपलब्ध असल्याचे सांगते; Azure सेवा-प्रदेशांकडे विनंत्या पाठवते. 1 ऑक्टोबरच्या दोन जोडणी-पानांवर प्रदेश वेगळे आहेत: Realtime मार्गदर्शक Sweden Central, Central US, South India; Speech SDK मार्गदर्शक Sweden Central, Central US, Southeast Asia सांगते. दोन्ही East US 2 लवकरच म्हणतात. वापरायच्या मार्गासाठी सध्याचे deployment व प्रदेश तपासा; याद्या एकसारख्या नाहीत. जागतिक प्रवेश म्हणजे ठरावीक ठिकाणी प्रक्रिया होण्याची हमी नव्हे.

उद्घाटनाची किंमत **2026 अखेरपर्यंत audio च्या तासाला $0.54**अशी जाहीर झाली. गणिताने 1,000 audio मिनिटांसाठी $9; इतर सेवा वा पायाभूत सुविधांचे शुल्क वेगळे. Microsoft मार्गदर्शक संबंधित Foundry Models व Speech सेवा-किंमत पानांकडे पाठवतात. सुरुवातीच्या कालावधीनंतरचा दर वा प्रत्यक्ष बिल उपलब्ध स्रोतांत नाही; बजेटपूर्वी सध्याची किंमत तपासा.

Microsoft नुसार 60 भाषांसाठी सतत स्वयंचलित ओळख उपलब्ध. पहिला आंशिक मजकूर audio मिळाल्यावर थोडा 100 ms पेक्षा अधिक वेळात दिसतो आणि Artificial Analysis मध्ये अग्रस्थानी असल्याचा दावा आहे. [Artificial Analysis चा streaming benchmark](https://artificialanalysis.ai/speech-to-text/streaming) सुमारे आठ तासांच्या भारित dataset वरील word error rate मोजतो; speech संपल्याचे ओळखल्यापासून आंशिक व अंतिम परिणामांचा वेळही मोजतो. हे ठरावीक audio व नियमांचे benchmark आहे; प्रत्येक app मध्ये 100 ms मध्ये अचूक शब्द दिसतील याची हमी नाही. या लेखासाठी मिळालेल्या सार्वजनिक मजकुरात मॉडेलची स्वतंत्र निकाल-ओळ नव्हती; नेमक्या क्रमांकाची Microsoft च्या दाव्यापलीकडे पुष्टी नाही.

वेगळा [MAI-Transcribe-2 Azure Speech मार्गदर्शक](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) फाइल input आणि वक्ते वेगळे ओळखणे, शब्दनिहाय timestamps, keyword biasing, स्वच्छ वा शब्दशः शैलीचे पर्याय सांगते. हे controls MAI-Transcribe-2-Streaming मध्ये असतील असे समजू नका; streaming मार्गदर्शक त्यांची नोंद करत नाहीत. हे output हवे असल्यास file मॉडेल तपासा किंवा बांधणीपूर्वी वर्तमान दस्तऐवज व चाचणीने streaming समर्थन निश्चित करा.

## स्रोत आणि पुढील वाचन

- [Microsoft AI घोषणा](https://microsoft.ai/news/our-first-streaming-transcription-model/): 1 ऑक्टोबर 2026: प्रकाशन, भाषा, वेग आणि सुरुवातीच्या किमतीचे दावे. अचूकता व अंतर्गत वेगाचे दावे वर Microsoft ला श्रेय दिले आहेत.
- [Microsoft Foundry मॉडेल catalog](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft): 2 ऑक्टोबर रोजी तपासले: आवृत्ती, preview टप्पा, input/output प्रकार; catalog कामगिरीची चाचणी नाही.
- [Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Realtime API मार्गदर्शक](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) आणि [Speech SDK मार्गदर्शक](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk): 1 ऑक्टोबरचे दोन integration मार्ग, preview अटी, इव्हेंट, उदाहरणे व प्रदेशांच्या याद्या. BIG CHANGE ने उदाहरणे चालवलेली नाहीत.
- [Azure Speech मधील MAI-Transcribe-2](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe): 2 ऑक्टोबर रोजी तपासले: वेगळा file-transcription मार्ग व त्याचे controls. यावरून streaming ची वैशिष्ट्ये सिद्ध होत नाहीत.
- [Artificial Analysis streaming benchmark](https://artificialanalysis.ai/speech-to-text/streaming) आणि [पद्धत](https://artificialanalysis.ai/methodology/speech-to-text): 2 ऑक्टोबर रोजी तपासले: स्वतंत्र benchmark रचना व वेळ-मापन. मिळालेल्या सार्वजनिक मजकुरात मॉडेलची निकाल-ओळ नव्हती; क्रमवारीची स्वतंत्र पुष्टी नाही.

## Sources

- [Our first streaming transcription model debuts at no. 1 on Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Microsoft AI ची घोषणा: 60 भाषा, वेग आणि क्रमवारीचे दावे; 2026 अखेरपर्यंत audio तासाला $0.54. विक्रेत्याचे दावे; BIG CHANGE मोजमापे नाहीत.
- [MAI-Transcribe-2-Streaming | Model Catalog | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — अधिकृत catalog: आवृत्ती 2026-08-06, preview टप्पा, audio input व text output. मॉडेल आवृत्ती आणि घोषणेची तारीख वेगवेगळी.
- [MAI-Transcribe-2-Streaming overview](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — 1 ऑक्टोबरला अद्ययावत अधिकृत overview: SLA नसलेला public preview, उत्पादनासाठी शिफारस नाही, दोन जोडणी मार्ग.
- [Realtime API वापरून MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — 1 ऑक्टोबरचे अधिकृत Realtime मार्गदर्शन: Foundry deployment, WebSocket, PCM16, इव्हेंट, manual commit, एक तासाची session व प्रदेश. BIG CHANGE ने नमुना चालवलेला नाही.
- [Azure Speech SDK वापरून MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — 1 ऑक्टोबरचे SDK मार्गदर्शन: v1.52.0, push audio व recognition इव्हेंट. प्रदेशांची यादी Realtime मार्गापेक्षा वेगळी. नमुना तपासलेला नाही.
- [Azure Speech मधील MAI-Transcribe (preview)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — वेगळा MAI-Transcribe-2 file मार्ग व त्याचे पर्याय; streaming शी वैशिष्ट्य-समानता सिद्ध नाही.
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — स्वतंत्र benchmark चालक streaming WER व latency मापने स्पष्ट करतो. मिळालेल्या मजकुरात मॉडेलची निकाल-ओळ नसल्याने नेमका क्रमांक स्वतंत्र पुष्टीऐवजी Microsoft ला श्रेय दिला आहे.
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — Streaming audio, dataset, भारांकन व latency ची पद्धत. Benchmark प्रत्येक app ची अचूकता वा latency सिद्ध करत नाही.
BIG CHANGE वृत्तपत्र

मोठे चित्र. तुमच्या गतीने.

AI आणि रोबोटिक्सवरील ताज्या बातम्या, पाहण्यासारखे बदल आणि वापरता येतील अशा व्यावहारिक कल्पना. दैनिक माहिती, साप्ताहिक सारांश किंवा मासिक दृष्टिकोन निवडा.