Microsoft MAI-Transcribe-2-Streaming-ஐ அக்டோபர் 1 அன்று அறிமுகப்படுத்தியது. ஒருவர் பேசிக்கொண்டிருக்கும்போதே இது ஒலியைப் பெற்று, இறுதி உரைமாற்றத்தை வழங்குவதற்கு முன் மாறிக்கொண்டிருக்கும் உரையைத் தருகிறது. நேரடி வசன வரிகளையோ பேச்சு உள்ளீட்டையோ குரல் செயலியில் சேர்க்கும் உருவாக்குநருக்கு, அந்தப் புதுப்பிப்புகள் செயலியை எவ்வாறு அடைகின்றன, எப்போது அவற்றை உறுதிப்படுத்தப்பட்டதாகக் கருதலாம் என்பதே முக்கியக் கேள்வி.

இது பொது முன்னோட்டத்தை மதிப்பிடும் உருவாக்குநர்களுக்கான ஆவண அடிப்படையிலான ஒருங்கிணைப்பு விளக்கம். மாதிரியைச் சோதனை முறையில் பயன்படுத்தலாமா என்றும், நேரடி உரையைக் காட்டவும் இறுதி உரையைச் சேமிக்கவும் கிளையன்ட் பக்கம் என்ன செய்ய வேண்டும் என்றும் தீர்மானிப்பதே நோக்கம். இணைப்புப் பாதையையும் எடுத்துக்காட்டுக் குறியீட்டையும் Microsoft ஆவணப்படுத்துகிறது; BIG CHANGE மாதிரியைப் பயன்படுத்தியோ எடுத்துக்காட்டுகளை இயக்கியோ, துல்லியம் அல்லது தாமதத்தை அளந்தோ இல்லை.

முக்கிய மாற்றம்

  • ஒலி வரும்போதே இடைக்கால உரையை வழங்கி, பின்னர் உரைமாற்றப் பகுதிகளை உறுதிப்படுத்தும் தொடர் மாதிரியை Microsoft அறிமுகப்படுத்தியுள்ளது. தனியான MAI-Transcribe-2 கோப்பு உரைமாற்றுப் பாதை, பதிவுசெய்யப்பட்ட ஒலிக்காகச் செயல்பட்டு வேறொரு தொகுப்பு விருப்பங்களை ஆவணப்படுத்துகிறது.
  • Realtime API-ஐப் பயன்படுத்தும் செயலி சரியான வடிவிலான ஒலியை அனுப்பி, இடைக்கால உரையின் இறுதிப் பகுதி திருத்தப்படுவதை கையாள வேண்டும்; மேலும் முழுமையான உரைமாற்றத்தைக் கோரும் நேரத்தையும் தீர்மானிக்க வேண்டும். பயனர்கள் எதைப் பார்க்கிறார்கள், அடுத்தடுத்த செயலி தர்க்கம் எப்போது இறுதி உரையை நம்பலாம் என்பவை இந்தத் தேர்வுகளைச் சார்ந்துள்ளன.
  • இந்தத் தொடர் மாதிரி சேவை-நிலை ஒப்பந்தமில்லாத பொது முன்னோட்டம். உற்பத்திப் பணிச்சுமைகளுக்கு இதைப் பயன்படுத்த Microsoft பரிந்துரைக்கவில்லை. மேற்கோள் காட்டப்படும் வேகம், துல்லியம் ஆகியவை அறிமுகம் மற்றும் benchmark கூற்றுகள்; இந்த வழிகாட்டியில் அளந்த முடிவுகள் அல்ல.

இணைப்புப் பாதையைத் தேர்ந்தெடுங்கள்

Microsoft Foundry-இன் மாதிரி பட்டியல் பதிப்பு MAI-Transcribe-2-Streaming-ஐ 2026-08-06 முன்னோட்ட நிலையில் உள்ள, ஒலி உள்ளீடும் உரை வெளியீடும் கொண்ட மாதிரியாகப் பட்டியலிடுகிறது. Microsoft-இன் அக்டோபர் 1 கண்ணோட்டம் இதை ஒருங்கிணைக்க இரண்டு வழிகளை ஆவணப்படுத்துகிறது: OpenAI Realtime போன்ற WebSocket நெறிமுறையைப் பயன்படுத்தும் Realtime API அல்லது Azure Speech SDK. இரண்டும் இடைநிலை மற்றும் இறுதி உரைமாற்ற முடிவுகளைத் தருகின்றன. SDK இணைப்பையும் ஒலி ஸ்ட்ரீமிங்கையும் நிர்வகிக்கிறது; Realtime பாதை நிகழ்வுகளை நேரடியாகச் செயலிக்கு வழங்குகிறது.

இந்த Realtime API-க்கு Azure subscription-உம் ஆதரிக்கப்படும் பிராந்தியத்தில் Microsoft Foundry வளமும், தொடர் மாதிரியின் deployment-உம் தேவை என Microsoft கூறுகிறது. Microsoft Entra bearer token அல்லது API key கொண்டு wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription உடன் இணைக்கவும். Entra அங்கீகாரத்தை ஆவணம் பரிந்துரைக்கிறது. session.created, session.update எனும் செய்தியை அனுப்பும்போது deployment பெயரையும் உள்ளீட்டு வடிவத்தையும் குறிப்பிடுங்கள். முதல் ஒலி append செய்த பிறகு—commit செய்த பின்னர்கூட—இந்த அமைப்பை மாற்ற முடியாது.

ஆவணப்படுத்தப்பட்ட உள்ளீடு என்பது 16 அல்லது 24 kHz-இல் உள்ள, header இல்லாத raw, signed, little-endian, mono PCM16 ஒலி. இதை base64 துண்டுகளாக input_audio_buffer.append செய்திகளில் அனுப்ப வேண்டும். இது WAV header இல்லாத PCM தரவு. தாமதத்தைக் குறைக்க 10 முதல் 20 மில்லிவினாடி போன்ற சிறிய துண்டுகளை Microsoft பரிந்துரைக்கிறது; பெரிய துண்டுகள் நெட்வொர்க் மேல்சுமையைக் குறைக்கும் என்றும் குறிப்பிடுகிறது. அதன் Python எடுத்துக்காட்டு ஒலிவாங்கி ஒலியை 100 ms தொகுதிகளாகப் படிக்கிறது. சிறிய துண்டு குறித்த ஆலோசனையும் எடுத்துக்காட்டுத் தொகுதி அளவும் வெவ்வேறு தேர்வுகள்; BIG CHANGE அளந்த முடிவுகள் அல்ல.

இந்த Speech SDK பாதைக்கு SDK v1.52.0, Azure subscription, Foundry அல்லது Speech வளம் ஆகியவை தேவை. Microsoft-இன் Python எடுத்துக்காட்டில் speech_config.model-ஐ MAI-Transcribe-2-Streaming என அமைத்து, push stream வழியாக 16 kHz, 16-bit mono ஒலியை வழங்கி, recognizing மற்றும் recognized நிகழ்வுகளைக் கவனிக்கிறது. push stream-ஐ விளக்குவதற்கு முன்பே உள்ள audio.pcm கோப்பை எடுத்துக்காட்டு பயன்படுத்துகிறது; செயலி தனது ஒலி மூலத்தை வழங்க வேண்டும். இவை ஆவணப்படுத்தப்பட்ட இடைமுகங்களும் எதிர்பார்க்கப்படும் நிகழ்வு வகைகளும் மட்டுமே; இந்த வெளியீடு கணக்கு அளவில் இணக்கத்தன்மையைச் சோதித்ததல்ல.

இடைக்கால உரையையும் உறுதிப்படுத்தப்பட்ட உரையையும் தனித்தனியாக வைத்திருங்கள்

நேரடி இடைமுகத்திற்கு Realtime நிகழ்வுகளின் பொருள் முக்கியம். conversation.item.input_audio_transcription.delta நிகழ்வு புதிதாக இறுதிப்படுத்தப்பட்ட உரையைக் கொண்டிருக்கும்; இடைவெளியை மாற்றாமல் செயலி அதை உறுதிப்படுத்தப்பட்ட உரைப் பகுதியில் சேர்க்க வேண்டும். intermediate நிகழ்வு, தற்போது இடைக்காலமாக உள்ள முழு இறுதிப் பகுதியையும் கொண்டிருக்கும். ஒவ்வொரு புதிய பகுதியும் முந்தையதை மாற்றும். திரையில் உறுதிப்படுத்தப்பட்ட உரையையும் தற்போதைய இடைக்காலப் பகுதியையும் சேர்த்துக் காட்டலாம்; ஆனால் ஒவ்வொரு இடைநிலை நிகழ்வையும் புதிய வரியாகச் சேமித்தால், மாதிரி திருத்தும்போது சொற்கள் மீண்டும் மீண்டும் தோன்றும்.

இடைநிறுத்தம் எனக் கண்டறிந்தபோதோ அல்லது பதிவின் முடிவிலோ கிளையன்ட் input_audio_buffer.commit-ஐ அனுப்புகிறது. இது இறுதி உரைமாற்றத்தை விரைவில் கோருவதாக Microsoft கூறுகிறது; input_audio_buffer.committed commit செய்யப்பட்டதை உறுதிப்படுத்துகிறது; conversation.item.input_audio_transcription.completed முந்தைய commit-க்குப் பிறகு கிடைத்த ஒலிக்கான முழு இறுதி உரையை வழங்குகிறது. இந்த மாதிரியின் session அமைப்பில் server பக்க turn detection-உம் தானியங்கி commit-உம் கிடையாது என Realtime வழிகாட்டி கூறுகிறது. எனவே தானாகப் பகுதிகளை முடிக்க விரும்பும் குரல் செயலி, இடைநிறுத்தம் அல்லது உரையாடல் எல்லையைத் தானே கண்டறிய வேண்டும். நிகழ்வுகளின் ஒப்பந்தத்தை ஆவணம் விளக்குகிறது; எல்லாச் செயலிகளுக்கும் ஏற்ற ஒரே எல்லைக் கண்டறிதல் முறையை அது பரிந்துரைக்கவில்லை.

ஒவ்வொரு Realtime session-மும் அதிகபட்சம் ஒரு மணிநேரம் நீடிக்கலாம் என Microsoft வழிகாட்டி வரையறுக்கிறது. ஒவ்வொரு audio append-க்கும் தனிப்பட்ட உறுதிப்படுத்தல் கிடையாது; அதற்கு பதிலாக பூஜ்ஜியமோ பல உரைமாற்ற நிகழ்வுகளோ வரலாம் என்றும் அது கூறுகிறது. சோதனைச் செயலியை மதிப்பிடும் உருவாக்குநர்கள், ஒலி செய்தி கிடைத்ததை இறுதி உரை கிடைத்ததிலிருந்து வேறுபடுத்திப் பார்க்க வேண்டும்; இணைப்பு துண்டிக்கப்பட்டால் செயலி என்ன செய்யும் என்பதையும் தீர்மானிக்க வேண்டும். Microsoft-இன் Python எடுத்துக்காட்டில் ஒலிவாங்கி வரிசை மற்றும் பிழை கையாளுதல் உள்ளது; ஆனால் BIG CHANGE அதை இயக்கி உண்மையான தோல்வி நடத்தையை நிறுவவில்லை.

அணுகல், பிராந்தியங்கள், விலை

மாதிரியை உலகளவில் அணுகலாம் என்றும், Azure கோரிக்கைகளை வழங்கும் பிராந்தியங்களுக்குத் திருப்பிவிடும் என்றும் Microsoft கூறுகிறது. அக்டோபர் 1-ஆம் தேதியிட்ட இரண்டு ஒருங்கிணைப்பு ஆவணங்களும் வெவ்வேறு கிடைக்கக்கூடிய பிராந்தியங்களைப் பட்டியலிடுகின்றன: Realtime வழிகாட்டியில் Sweden Central, Central US, South India; Speech SDK வழிகாட்டியில் Sweden Central, Central US, Southeast Asia. இரண்டும் East US 2 விரைவில் கிடைக்கும் எனக் குறிப்பிடுகின்றன. பயன்படுத்தத் திட்டமிடும் பாதைக்கான தற்போதைய deployment மற்றும் பிராந்திய விருப்பங்களைச் சரிபாருங்கள்; இந்தப் பக்கங்கள் ஒரே சீரான பட்டியலை வழங்கவில்லை. உலகளாவிய அணுகல் என்பது குறிப்பிட்ட இடத்தில் தரவு செயலாக்கப்படும் என்ற உறுதிமொழி அல்ல.

அறிமுக விலையாக 2026 இறுதிவரை ஒலி நேரத்தின் ஒரு மணிநேரத்திற்கு $0.54 என அறிவிப்பு கூறுகிறது. கணக்குப்படி, பிற சேவைகள் அல்லது செயலி பயன்படுத்தும் உள்கட்டமைப்புச் செலவுகளுக்கு முன், 1,000 ஒலி நிமிடங்களுக்கு இது $9 ஆகும். ஒவ்வொரு பாதைக்கும் உரிய Foundry Models மற்றும் Speech சேவை விலைப் பக்கங்களுக்கு Microsoft தனது வழிகாட்டிகளில் இணைப்பு தருகிறது. ஆய்வு செய்த ஆதாரங்கள் அறிமுகக் காலத்துக்குப் பிந்தைய விலையையோ சோதிக்கப்பட்ட கட்டண விவரத்தையோ தரவில்லை; எனவே deployment பட்ஜெட்டுக்கு தற்போதைய விலையைச் சரிபார்க்க வேண்டும்.

தொடர்ச்சியான தானியங்கி கண்டறிதலுடன் 60 மொழிகளை இந்தத் தொடர் மாதிரி ஆதரிக்கிறது என Microsoft கூறுகிறது. ஒலியைப் பெற்ற 100 ms-க்கு சற்று மேல் நேரத்தில் முதல் இடைக்கால உரை தோன்றும் என்றும், துல்லியத்தில் முன்னணி இடத்தைப் பெற்றதாக Artificial Analysis-ஐ மேற்கோள் காட்டுகிறது. Artificial Analysis-இன் தொடர் உரைமாற்ற benchmark சுமார் எட்டு மணிநேர எடையிடப்பட்ட தரவுத்தொகுப்புகளில் சொல் பிழை விகிதத்தை அளந்து, கண்டறியப்பட்ட பேச்சு முடிவுடன் ஒப்பிட்டு இடைக்கால மற்றும் இறுதி முடிவுகளுக்கான நேரத்தைக் கணக்கிடுகிறது. அது குறிப்பிட்ட ஒலி மற்றும் நேர விதிகளுக்கான benchmark; 100 ms-இல் ஒரு செயலி சரியான சொற்களைக் காட்டும் என்பதற்கான உத்தரவாதமல்ல. இந்தக் கதைக்காகப் பெறப்பட்ட பொது benchmark உரையில் மாதிரி வாரியான முடிவு வரியைப் பார்க்க முடியாததால், Microsoft கூறிய துல்லியமான தரவரிசையைத் தனியாகச் சரிபார்க்கவில்லை.

தனியான Azure Speech-இலுள்ள MAI-Transcribe-2 வழிகாட்டி கோப்பு உள்ளீட்டையும் பேச்சாளர் பிரிப்பு, சொல்-நிலை நேர முத்திரைகள், முக்கியச்சொல் முன்னுரிமை, சுத்தமான அல்லது சொற்சொல்லான பாணி உள்ளிட்ட விருப்பங்களையும் ஆவணப்படுத்துகிறது. அந்தக் கட்டுப்பாடுகள் MAI-Transcribe-2-Streaming-இலும் உள்ளன எனக் கருத வேண்டாம்: தொடர் ஒருங்கிணைப்பு வழிகாட்டிகள் அவற்றை ஆவணப்படுத்தவில்லை. ஒரு தயாரிப்புக்கு இத்தகைய வெளியீடுகள் தேவைப்பட்டால், கோப்பு மாதிரியை மதிப்பிடுங்கள் அல்லது அதை அடிப்படையாகக் கொண்டு உருவாக்குவதற்கு முன் தற்போதைய ஆவணங்களிலும் சோதனையிலும் தொடர் ஆதரவை உறுதிப்படுத்துங்கள்.

ஆதாரங்களும் மேலும் வாசிப்பும்

  • Microsoft AI அறிவிப்பு, 2026 அக்டோபர் 1: வெளியீடு, மொழிகள், வேகம், அறிமுக விலை குறித்த கூற்றுகள். Microsoft-இன் துல்லியம் மற்றும் உள் வேகம் பற்றிய கூற்றுகள் மேலே அதற்கே உரியவையாகக் குறிப்பிடப்பட்டுள்ளன.
  • Microsoft Foundry மாதிரி பட்டியல், அக்டோபர் 2 அன்று சரிபார்க்கப்பட்டது: மாதிரிப் பதிப்பு, முன்னோட்ட நிலை, உள்ளீடு/வெளியீட்டு வகைகள்; இந்தப் பட்டியல் செயல்திறன் சோதனை அல்ல.
  • தொடர் கண்ணோட்டம், Realtime API வழிகாட்டி மற்றும் Speech SDK வழிகாட்டி, அக்டோபர் 1 அன்று புதுப்பிக்கப்பட்டது: ஆவணப்படுத்தப்பட்ட இரண்டு ஒருங்கிணைப்புப் பாதைகள், முன்னோட்ட நிபந்தனைகள், நிகழ்வு நடத்தை, எடுத்துக்காட்டுகள், பிராந்தியப் பட்டியல்கள். BIG CHANGE எடுத்துக்காட்டுகளை இயக்கவில்லை.
  • Azure Speech-இல் MAI-Transcribe-2, அக்டோபர் 2 அன்று சரிபார்க்கப்பட்டது: தனியான கோப்பு உரைமாற்றுப் பாதையும் அதற்கான ஆவணப்படுத்தப்பட்ட கட்டுப்பாடுகளும். அதன் அம்சப் பட்டியல் தொடர் மாதிரிக்கான அம்சப் பட்டியல் அல்ல.
  • Artificial Analysis தொடர் benchmark மற்றும் முறையியல், அக்டோபர் 2 அன்று சரிபார்க்கப்பட்டது: சுயாதீன benchmark வடிவமைப்பும் நேர வரையறைகளும். தரவரிசையைச் சுயாதீனமாக உறுதிப்படுத்தத் தேவையான மாதிரி வாரியான முடிவு வரி, பெறப்பட்ட பொது உரையில் கிடைக்கவில்லை.