Microsoft ने 1 अक्टूबर को MAI-Transcribe-2-Streaming की घोषणा की। यह किसी के बोलते समय ऑडियो लेता है और अंतिम ट्रांसक्रिप्ट से पहले बदलता हुआ पाठ देता है। लाइव कैप्शन या वॉइस इनपुट जोड़ने वाले डेवलपर के लिए अहम सवाल यह है कि ये अपडेट ऐप तक कैसे पहुँचते हैं और उन्हें कब अंतिम माना जा सकता है।
यह सार्वजनिक प्रीव्यू का मूल्यांकन कर रहे डेवलपरों के लिए दस्तावेज़ों पर आधारित एकीकरण की व्याख्या है। काम यह तय करना है कि मॉडल का प्रोटोटाइप बनाया जाए या नहीं और लाइव पाठ दिखाने तथा अंतिम पाठ सहेजने के लिए क्लाइंट में कौन-सा काम करना होगा। Microsoft प्रक्रिया और नमूना कोड बताता है; BIG CHANGE ने मॉडल को तैनात नहीं किया, नमूने नहीं चलाए और इसकी सटीकता या विलंबता नहीं मापी।
बड़ा बदलाव
- Microsoft ने एक स्ट्रीमिंग मॉडल पेश किया है जो ऑडियो आते ही अस्थायी पाठ लौटाता है और फिर ट्रांसक्रिप्ट के खंडों की पुष्टि करता है। MAI-Transcribe-2 का अलग फ़ाइल-ट्रांसक्रिप्शन मार्ग रिकॉर्ड किया गया ऑडियो लेता है और उसके विकल्प अलग हैं।
- Realtime API इस्तेमाल करने वाले ऐप को सही प्रारूप में ऑडियो भेजना, अस्थायी पाठ के आखिरी हिस्से में होने वाले संशोधनों को संभालना और तय करना होगा कि अंतिम ट्रांसक्रिप्शन कब माँगा जाए। इन्हीं विकल्पों से तय होता है कि उपयोगकर्ताओं को क्या दिखेगा और ऐप का आगे का लॉजिक अंतिम पाठ पर कब भरोसा कर सकता है।
- स्ट्रीमिंग मॉडल सार्वजनिक प्रीव्यू में है और इसके लिए सेवा-स्तर समझौता नहीं है। Microsoft इसे उत्पादन-कार्यभार के लिए इस्तेमाल करने की सलाह नहीं देता। गति और सटीकता के जो आँकड़े उद्धृत किए गए हैं वे लॉन्च तथा बेंचमार्क के दावे हैं, इस गाइड के माप नहीं।
कनेक्शन का तरीका चुनें
Microsoft का Foundry कैटलॉग इसे MAI-Transcribe-2-Streaming, संस्करण 2026-08-06, ऑडियो इनपुट और टेक्स्ट आउटपुट वाले प्रीव्यू मॉडल के रूप में सूचीबद्ध करता है। Microsoft का 1 अक्टूबर का अवलोकन एकीकरण के दो तरीके बताता है: OpenAI Realtime-जैसे WebSocket प्रोटोकॉल वाला Realtime API या Azure Speech SDK। दोनों बीच के और अंतिम पहचान-नतीजे लौटाते हैं। SDK कनेक्शन और ऑडियो स्ट्रीमिंग संभालता है; Realtime तरीका इवेंट सीधे उपलब्ध कराता है।
इस Realtime API के लिए Microsoft Azure सब्सक्रिप्शन, समर्थित क्षेत्र में Microsoft Foundry संसाधन और स्ट्रीमिंग मॉडल की तैनाती ज़रूरी है। इससे कनेक्ट करें: wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription का उपयोग करके Microsoft Entra bearer token या API key से प्रमाणित करें। दस्तावेज़ Entra प्रमाणीकरण की सिफारिश करता है। session.created के बाद, session.update भेजें, जिसमें अपनी तैनाती का नाम दें और इनपुट प्रारूप तय करें। पहला ऑडियो append करने के बाद यह सेटिंग बदली नहीं जा सकती, commit के बाद भी नहीं।
दर्ज इनपुट 16 या 24 kHz पर raw, signed, little-endian, mono PCM16 ऑडियो है, जिसे base64 chunks के रूप में input_audio_buffer.append संदेशों में भेजा जाता है। यह WAV header के बिना PCM डेटा है। विलंबता घटाने के लिए Microsoft 10 से 20 मिलीसेकंड जैसे छोटे chunks की सिफारिश करता है, साथ ही कहता है कि बड़े chunks से नेटवर्क ओवरहेड कम होता है। उसका Python उदाहरण माइक्रोफ़ोन ऑडियो को 100 ms के ब्लॉक में पढ़ता है; पृष्ठ की छोटी chunk वाली सलाह और नमूने का ब्लॉक आकार अलग विकल्प हैं, BIG CHANGE का मापा हुआ नतीजा नहीं।
इस Speech SDK मार्ग के लिए SDK v1.52.0, Azure सब्सक्रिप्शन और Foundry या Speech संसाधन ज़रूरी हैं। Microsoft का Python नमूना speech_config.model को MAI-Transcribe-2-Streaming पर सेट करता है, push stream के ज़रिए 16 kHz, 16-bit mono ऑडियो देता है और recognizing तथा recognized इवेंट सुनता है। push stream दिखाने के लिए नमूने में पहले से मौजूद audio.pcm फ़ाइल इस्तेमाल हुई है; ऐप को अपना ऑडियो स्रोत देना होगा। ये दस्तावेज़ में बताए गए इंटरफ़ेस और अपेक्षित इवेंट प्रकार हैं, इस प्रकाशन द्वारा खाते के स्तर पर किया गया संगतता परीक्षण नहीं।
अस्थायी पाठ को पक्के पाठ से अलग रखें
लाइव इंटरफ़ेस के लिए Realtime इवेंट का अर्थ मायने रखता है। conversation.item.input_audio_transcription.delta इवेंट में नया अंतिम किया गया पाठ होता है; क्लाइंट ऐप रिक्त स्थान में बदलाव किए बिना इसे अपने पक्के पाठ के बफ़र में जोड़ता है। intermediate इवेंट में इस समय का पूरा अस्थायी अंतिम-हिस्सा होता है। हर नया हिस्सा पिछले हिस्से की जगह लेता है। स्क्रीन पक्के पाठ के बफ़र और मौजूदा अस्थायी हिस्से को साथ दिखा सकती है, लेकिन हर अंतरिम इवेंट को नई पंक्ति की तरह सहेजने से मॉडल के संशोधन के दौरान शब्द दोहरेंगे।
क्लाइंट पहचाने गए विराम पर या रिकॉर्डिंग के अंत में input_audio_buffer.commit भेजता है। Microsoft कहता है कि इससे जल्द-से-जल्द अंतिम ट्रांसक्रिप्ट माँगा जाता है; input_audio_buffer.committed commit की पुष्टि करता है और conversation.item.input_audio_transcription.completed पिछले commit के बाद के ऑडियो का पूरा अंतिम पाठ देता है। Realtime गाइड कहती है कि इस मॉडल के सत्र कॉन्फ़िगरेशन में सर्वर की turn detection और automatic commit उपलब्ध नहीं हैं। इसलिए स्वचालित खंड-समापन चाहिए तो वॉइस ऐप को विराम या turn की सीमा खुद तय करनी होगी। दस्तावेज़ इवेंट का अनुबंध बताता है; वह ऐसा एक सीमा-पहचान तरीका निर्धारित नहीं करता जो हर स्थिति के लिए सही हो।
Microsoft की गाइड हर Realtime सत्र को एक घंटे तक सीमित करती है। यह भी कहती है कि ऑडियो append को अलग से पावती नहीं मिलती और उससे शून्य या कई ट्रांसक्रिप्शन इवेंट आ सकते हैं। प्रोटोटाइप का मूल्यांकन करने वाले डेवलपरों को ऑडियो संदेश मिलने और अंतिम पाठ मिलने के बीच फर्क रखना चाहिए और तय करना चाहिए कि ऐप कनेक्शन टूटने पर क्या करेगा। सार्वजनिक गाइड के Python उदाहरण में माइक्रोफ़ोन कतार और त्रुटि-संभाल है, लेकिन BIG CHANGE ने इसे चलाकर वास्तविक विफलता-व्यवहार स्थापित नहीं किया।
पहुँच, क्षेत्र और कीमत
Microsoft कहता है कि Azure अनुरोधों को सेवा देने वाले क्षेत्रों तक route करके मॉडल को विश्वभर से इस्तेमाल किया जा सकता है। 1 अक्टूबर के एकीकरण पृष्ठों में उपलब्ध क्षेत्रों की अलग-अलग सूची है: Realtime गाइड में Sweden Central, Central US और South India हैं; Speech SDK गाइड में Sweden Central, Central US और Southeast Asia हैं। दोनों में East US 2 को जल्द उपलब्ध होने वाला बताया गया है। जिस तरीके का उपयोग करना है, उसके लिए तैनाती और क्षेत्र के मौजूदा विकल्प जाँचें; इन पृष्ठों में एक समान सूची नहीं है। वैश्विक पहुँच का अर्थ किसी खास प्रोसेसिंग स्थान की गारंटी नहीं है।
घोषणा में 2026 के अंत तक ऑडियो के हर घंटे के लिए शुरुआती कीमत $0.54 प्रति ऑडियो घंटा बताई गई है। हिसाब से यह हर 1,000 ऑडियो मिनट के लिए $9 है; ऐप द्वारा इस्तेमाल की जाने वाली अलग सेवाओं या इंफ़्रास्ट्रक्चर का खर्च इसमें शामिल नहीं। Microsoft संबंधित तरीकों के लिए अपनी गाइड से Foundry Models और Speech सेवा की कीमत वाले पृष्ठों के लिंक देता है। देखे गए स्रोतों में शुरुआती अवधि के बाद की दर या जाँचा हुआ बिल नहीं दिया गया है, इसलिए तैनाती का बजट बनाते समय मौजूदा कीमत जाँचनी होगी।
Microsoft का कहना है कि स्ट्रीमिंग मॉडल लगातार स्वचालित पहचान के साथ 60 भाषाओं को समर्थन देता है। उसके अनुसार ऑडियो मिलने के 100 ms से थोड़ा अधिक समय बाद पहला आंशिक नतीजा आता है और सटीकता में अग्रणी स्थान के लिए Artificial Analysis का हवाला देता है। Artificial Analysis का स्ट्रीमिंग बेंचमार्क लगभग आठ घंटे के भारित डेटासेट पर word error rate मापता है और पहचाने गए भाषण के अंत के सापेक्ष आंशिक तथा अंतिम नतीजों का समय दर्ज करता है। यह निर्धारित ऑडियो और समय-नियमों का बेंचमार्क है, इस बात की गारंटी नहीं कि कोई खास ऐप 100 ms में सही शब्द दिखाएगा। इस लेख के लिए जुटाए गए सार्वजनिक बेंचमार्क पाठ में मॉडल-विशिष्ट नतीजे की पंक्ति न मिलने के कारण हमने Microsoft की सटीक रैंकिंग की स्वतंत्र पुष्टि नहीं की।
अलग MAI-Transcribe-2 Azure Speech गाइड फ़ाइल इनपुट और speaker diarization, शब्द-स्तरीय timestamps, keyword biasing तथा clean या verbatim शैली जैसे विकल्पों का दस्तावेज़ीकरण करती है। यह न मानें कि MAI-Transcribe-2-Streaming में ये नियंत्रण काम करते हैं: स्ट्रीमिंग एकीकरण की गाइड में उनका ज़िक्र नहीं है। उत्पाद को ऐसे आउटपुट चाहिए तो फ़ाइल मॉडल का मूल्यांकन करें या उस पर निर्माण करने से पहले मौजूदा दस्तावेज़ों और परीक्षण से स्ट्रीमिंग समर्थन की पुष्टि करें।
स्रोत और आगे पढ़ें
- Microsoft AI की घोषणा, 1 अक्टूबर 2026: लॉन्च, भाषाओं, गति और शुरुआती कीमत के दावे। Microsoft के अपने सटीकता और आंतरिक गति के दावों का उल्लेख ऊपर स्रोत के साथ किया गया है।
- Microsoft Foundry मॉडल कैटलॉग, 2 अक्टूबर को जाँचा गया: मॉडल संस्करण, प्रीव्यू चरण और इनपुट/आउटपुट के प्रकार; कैटलॉग प्रदर्शन-परीक्षण नहीं है।
- स्ट्रीमिंग अवलोकन, Realtime API गाइड और Speech SDK गाइड, 1 अक्टूबर को अपडेट किए गए: एकीकरण के दोनों दर्ज तरीके, प्रीव्यू की शर्तें, इवेंट व्यवहार, उदाहरण और क्षेत्र की तालिकाएँ। BIG CHANGE ने उदाहरण नहीं चलाए।
- Azure Speech में MAI-Transcribe-2, 2 अक्टूबर को जाँचा गया: अलग फ़ाइल-ट्रांसक्रिप्शन तरीका और उसके दर्ज नियंत्रण। इसकी सुविधा-सूची को स्ट्रीमिंग की सुविधा-सूची न मानें।
- Artificial Analysis का स्ट्रीमिंग बेंचमार्क और कार्य-पद्धति, 2 अक्टूबर को जाँचा गया: स्वतंत्र बेंचमार्क की रूपरेखा और समय माप की परिभाषाएँ। उपलब्ध सार्वजनिक पाठ में मॉडल-विशिष्ट नतीजे की पंक्ति नहीं थी, इसलिए Microsoft की सटीक रैंकिंग की स्वतंत्र पुष्टि नहीं हुई।



