Microsoft ने 1 ऑक्टोबरला MAI-Transcribe-2-Streaming जाहीर केले. बोलताना audio दिल्यास अंतिम प्रत तयार होण्यापूर्वी बदलता मजकूर मिळतो. Voice app मध्ये live captions वा speech input जोडणाऱ्या विकासकांसाठी हे अपडेट app पर्यंत कसे येतात आणि कधी अंतिम मानायचे हे उपयुक्त प्रश्न आहेत.

हा public preview तपासणाऱ्या विकासकांसाठी दस्तऐवजांवर आधारित integration मार्गदर्शक आहे. मॉडेलचा prototype करायचा का आणि live मजकूर दाखवण्यासाठी व अंतिम मजकूर ठेवण्यासाठी client मध्ये काय करावे लागेल हे ठरवणे उद्दिष्ट. Microsoft मार्ग व नमुना कोड देते; BIG CHANGE ने मॉडेल तैनात केलेले, नमुने चालवलेले किंवा अचूकता वा latency मोजलेली नाही.

मोठा बदल

  • Microsoft ने streaming मॉडेल आणले: audio आल्यावर तात्पुरता मजकूर आणि मग पुष्टी केलेले लिप्यंतरित भाग. स्वतंत्र MAI-Transcribe-2 file transcription मार्ग रेकॉर्ड केलेल्या audio साठी आहे; त्यात वेगळे पर्याय आहेत.
  • Realtime API वापरणाऱ्या app ने योग्य audio स्वरूप पाठवावे, तात्पुरत्या मजकुराच्या शेवटच्या भागातील बदल हाताळावेत आणि पूर्ण मजकूर कधी मागवायचा ठरवावे. वापरकर्त्याला काय दिसेल व पुढील app logic अंतिम मजकुरावर केव्हा अवलंबू शकेल हे यावर ठरते.
  • Streaming मॉडेल SLA नसलेला public preview आहे; Microsoft उत्पादनात वापरण्याची शिफारस करत नाही. वेग व अचूकतेचे प्रकाशित आकडे हे प्रारंभिक किंवा benchmark दावे आहेत; या लेखातील मोजमापे नाहीत.

जोडणीचा मार्ग निवडा

या Microsoft Foundry catalog मध्ये सूची आहे: MAI-Transcribe-2-Streamingversion 2026-08-06preview मॉडेल म्हणून audio input व text output. Microsoft चे 1 ऑक्टोबरचे विहंगावलोकन दोन मार्ग सांगते: OpenAI Realtime-सदृश WebSocket protocol असलेला Realtime API किंवा Azure Speech SDK. दोन्ही मधले व अंतिम ओळख-परिणाम देतात. SDK जोडणी व audio streaming सांभाळते; Realtime मार्गात इव्हेंट थेट हाताळावे लागतात.

या मार्गासाठी Realtime API, Microsoft Azure subscription, समर्थित प्रदेशातील Foundry resource आणि streaming मॉडेल deployment मागते. wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription Microsoft Entra bearer token किंवा API key वापरून जोडावे. दस्तऐवज Entra authentication सुचवते. त्यानंतर session.createddeployment चे नाव व input format देणारा session.update संदेश पाठवा. पहिला audio append झाल्यावर, commit नंतरही, setting बदलत नाही.

दस्तऐवजीकृत input 16 वा 24 kHz raw, signed little-endian mono PCM16 आहे; base64 chunks मधील messages मध्ये input_audio_buffer.append पाठवला जातो. WAV header नसलेला PCM डेटा. Microsoft 10–20 ms छोटे chunks सुचवते; मोठे chunks network overhead कमी करतात. Python उदाहरण mic audio 100 ms blocks मध्ये वाचते. या वेगळ्या निवडी; BIG CHANGE ची मोजमापे नाहीत.

हा Speech SDK मार्ग SDK v1.52.0, Azure subscription आणि Foundry वा Speech resource मागतो. Python नमुन्यात speech_config.model ची setting MAI-Transcribe-2-Streamingआहे; push stream मधून 16 kHz, 16-bit mono audio देते आणि recognizing आणि recognized इव्हेंट. नमुना आधीपासूनची audio.pcm फाइल push stream दाखवण्यासाठी वापरतो; app स्वतःचा audio स्रोत देईल. या दस्तऐवजीकृत interface व अपेक्षित इव्हेंट आहेत; प्रकाशनाने खात्याची compatibility तपासलेली नाही.

तात्पुरता मजकूर पुष्टी झालेल्या मजकुरापासून वेगळा ठेवा

Live interface साठी Realtime इव्हेंटचा अर्थ महत्त्वाचा. conversation.item.input_audio_transcription.delta इव्हेंटमध्ये नवा अंतिम मजकूर येतो; client spacing न बदलता पुष्टीच्या buffer मध्ये जोडतो. intermediate इव्हेंटमध्ये सध्याचा संपूर्ण तात्पुरता शेवटचा भाग असतो. नवा भाग मागील भाग बदलतो. स्क्रीन पुष्टीचा मजकूर आणि सध्याचा भाग दाखवू शकते; प्रत्येक मधला इव्हेंट नवी ओळ म्हणून साठवल्यास शब्द पुन्हा दिसू शकतात.

Client input_audio_buffer.commit विराम ओळखल्यावर किंवा रेकॉर्डिंगच्या शेवटी पाठवतो. Microsoft नुसार याने शक्य तितक्या लवकर अंतिम मजकूर मागितला जातो; input_audio_buffer.committed commit ची पोच देतो आणि conversation.item.input_audio_transcription.completed मागील commit पासूनच्या audio चा पूर्ण मजकूर देतो. Realtime मार्गदर्शक या मॉडेलच्या session मध्ये server turn detection किंवा auto-commit उपलब्ध नाही. आपोआप भाग पूर्ण करायचा असल्यास app ला स्वतःचा विराम किंवा turn boundary ठरवावा लागतो. इव्हेंटचा करार दस्तऐवजीकृत आहे; सर्वांसाठी योग्य boundary detector सुचवलेला नाही.

Microsoft Realtime session ची मर्यादा एक तास सांगते. प्रत्येक audio append ला स्वतंत्र acknowledgment नसतो; त्यातून शून्य वा अनेक transcript इव्हेंट येऊ शकतात. Prototype तपासताना audio संदेश मिळणे आणि अंतिम मजकूर मिळणे वेगळे मोजा व session तुटल्यास app चे वर्तन ठरवा. सार्वजनिक Python उदाहरणात mic queue आणि error handling आहे; प्रत्यक्ष failure तपासण्यासाठी BIG CHANGE ने ते चालवलेले नाही.

प्रवेश, प्रदेश आणि किंमत

Microsoft मॉडेल जागतिक स्तरावर उपलब्ध असल्याचे सांगते; Azure सेवा-प्रदेशांकडे विनंत्या पाठवते. 1 ऑक्टोबरच्या दोन जोडणी-पानांवर प्रदेश वेगळे आहेत: Realtime मार्गदर्शक Sweden Central, Central US, South India; Speech SDK मार्गदर्शक Sweden Central, Central US, Southeast Asia सांगते. दोन्ही East US 2 लवकरच म्हणतात. वापरायच्या मार्गासाठी सध्याचे deployment व प्रदेश तपासा; याद्या एकसारख्या नाहीत. जागतिक प्रवेश म्हणजे ठरावीक ठिकाणी प्रक्रिया होण्याची हमी नव्हे.

उद्घाटनाची किंमत 2026 अखेरपर्यंत audio च्या तासाला $0.54अशी जाहीर झाली. गणिताने 1,000 audio मिनिटांसाठी $9; इतर सेवा वा पायाभूत सुविधांचे शुल्क वेगळे. Microsoft मार्गदर्शक संबंधित Foundry Models व Speech सेवा-किंमत पानांकडे पाठवतात. सुरुवातीच्या कालावधीनंतरचा दर वा प्रत्यक्ष बिल उपलब्ध स्रोतांत नाही; बजेटपूर्वी सध्याची किंमत तपासा.

Microsoft नुसार 60 भाषांसाठी सतत स्वयंचलित ओळख उपलब्ध. पहिला आंशिक मजकूर audio मिळाल्यावर थोडा 100 ms पेक्षा अधिक वेळात दिसतो आणि Artificial Analysis मध्ये अग्रस्थानी असल्याचा दावा आहे. Artificial Analysis चा streaming benchmark सुमारे आठ तासांच्या भारित dataset वरील word error rate मोजतो; speech संपल्याचे ओळखल्यापासून आंशिक व अंतिम परिणामांचा वेळही मोजतो. हे ठरावीक audio व नियमांचे benchmark आहे; प्रत्येक app मध्ये 100 ms मध्ये अचूक शब्द दिसतील याची हमी नाही. या लेखासाठी मिळालेल्या सार्वजनिक मजकुरात मॉडेलची स्वतंत्र निकाल-ओळ नव्हती; नेमक्या क्रमांकाची Microsoft च्या दाव्यापलीकडे पुष्टी नाही.

वेगळा MAI-Transcribe-2 Azure Speech मार्गदर्शक फाइल input आणि वक्ते वेगळे ओळखणे, शब्दनिहाय timestamps, keyword biasing, स्वच्छ वा शब्दशः शैलीचे पर्याय सांगते. हे controls MAI-Transcribe-2-Streaming मध्ये असतील असे समजू नका; streaming मार्गदर्शक त्यांची नोंद करत नाहीत. हे output हवे असल्यास file मॉडेल तपासा किंवा बांधणीपूर्वी वर्तमान दस्तऐवज व चाचणीने streaming समर्थन निश्चित करा.

स्रोत आणि पुढील वाचन

  • Microsoft AI घोषणा: 1 ऑक्टोबर 2026: प्रकाशन, भाषा, वेग आणि सुरुवातीच्या किमतीचे दावे. अचूकता व अंतर्गत वेगाचे दावे वर Microsoft ला श्रेय दिले आहेत.
  • Microsoft Foundry मॉडेल catalog: 2 ऑक्टोबर रोजी तपासले: आवृत्ती, preview टप्पा, input/output प्रकार; catalog कामगिरीची चाचणी नाही.
  • Streaming overview, Realtime API मार्गदर्शक आणि Speech SDK मार्गदर्शक: 1 ऑक्टोबरचे दोन integration मार्ग, preview अटी, इव्हेंट, उदाहरणे व प्रदेशांच्या याद्या. BIG CHANGE ने उदाहरणे चालवलेली नाहीत.
  • Azure Speech मधील MAI-Transcribe-2: 2 ऑक्टोबर रोजी तपासले: वेगळा file-transcription मार्ग व त्याचे controls. यावरून streaming ची वैशिष्ट्ये सिद्ध होत नाहीत.
  • Artificial Analysis streaming benchmark आणि पद्धत: 2 ऑक्टोबर रोजी तपासले: स्वतंत्र benchmark रचना व वेळ-मापन. मिळालेल्या सार्वजनिक मजकुरात मॉडेलची निकाल-ओळ नव्हती; क्रमवारीची स्वतंत्र पुष्टी नाही.