AI-translated from English; not yet reviewed by a fluent editor.
# MAI-Transcribe-2-Streaming ng Microsoft: live na transcription at mga limitasyon nito
> Nagbabalik ang bagong streaming transcription model ng Microsoft ng pansamantala at pinal na teksto habang dumarating ang audio. Ipinauubaya rin ng preview API sa client ang pagtukoy ng turn at pagtatapos nito.
By BIG CHANGE Editorial
Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

AI-generated conceptual illustration by BIG CHANGE.
Inanunsiyo ng Microsoft ang [MAI-Transcribe-2-Streaming noong Oktubre 1](https://microsoft.ai/news/our-first-streaming-transcription-model/). Tumatanggap ito ng audio habang may nagsasalita at nagbabalik ng nagbabagong teksto bago ang pinal na transcript. Para sa developer na nagdaragdag ng live caption o speech input sa voice app, mahalagang malaman kung paano nakararating sa app ang mga update at kung kailan maituturing na pinal ang mga ito.
Gabay ito para sa mga developer na nagsusuri sa pampublikong preview, batay sa dokumentasyon ng integrasyon. Kailangang pagpasyahan kung gagawa ng prototype ng model at tukuyin ang gawaing kailangan sa client upang maipakita ang live na teksto at mapanatili ang pinal na teksto. Itinatala ng Microsoft ang endpoint at sample code; hindi ini-deploy ng BIG CHANGE ang model, pinatakbo ang mga sample, o sinukat ang katumpakan o latency nito.
## Ang pangunahing pagbabago
- Nagpakilala ang Microsoft ng streaming model na nagbabalik ng pansamantalang teksto habang dumarating ang audio, saka nagkukumpirma sa mga bahagi ng transcript. Iba ang MAI-Transcribe-2 file transcription path nito, na para sa naka-record na audio at nagdodokumento ng ibang mga opsiyon.
- Kailangang magpadala ang app na gumagamit ng Realtime API ng wastong format ng audio, humawak sa mga rebisyon ng pansamantalang hulihan ng teksto, at magpasya kung kailan hihiling ng kumpletong transcript. Tinutukoy ng mga pagpiling ito kung ano ang makikita ng user at kung kailan maaasahan ng kasunod na logic ng app ang pinal na teksto.
- Pampublikong preview ang streaming model at wala itong service-level agreement. Hindi ito inirerekomenda ng Microsoft para sa production workload. Mga pahayag sa paglulunsad at benchmark ang binanggit na bilis at katumpakan, hindi mga sukat mula sa gabay na ito.
## Pumili ng paraan ng koneksiyon
Ang [katalogo ng Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) ay naglilista sa `MAI-Transcribe-2-Streaming`, bersiyong `2026-08-06`, bilang preview model na tumatanggap ng audio at naglalabas ng teksto. Inilalarawan ng [pangkalahatang-ideya noong Oktubre 1](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) ng Microsoft ang dalawang paraan ng integrasyon: Realtime API na gumagamit ng WebSocket protocol na kahawig ng OpenAI Realtime, o Azure Speech SDK. Pareho silang nagbabalik ng pansamantala at pinal na resulta ng pagkilala. Pinamamahalaan ng SDK ang koneksiyon at streaming ng audio; direktang inilalantad naman ng Realtime route ang mga event.
Para sa [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), kailangan ng Microsoft Foundry ang Azure subscription, resource sa sinusuportahang rehiyon, at deployment ng streaming model. Kumonekta sa `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` gamit ang Microsoft Entra bearer token o API key. Inirerekomenda ng dokumentasyon ang Entra authentication. Pagkatapos ng `session.created` ipadala ang `session.update` at pangalanan ang deployment mo at itakda ang format ng input. Hindi na mababago ang setting matapos ang unang pagdagdag ng audio, kahit pagkatapos ng commit.
Raw, signed, little-endian, mono PCM16 sa 16 o 24 kHz ang dokumentadong input; ipinadadala ito bilang mga base64 chunk sa mga `input_audio_buffer.append` message. PCM data ito na walang WAV header. Inirerekomenda ng Microsoft ang maliliit na chunk, gaya ng 10 hanggang 20 millisecond, upang bawasan ang latency; binabanggit din nitong nababawasan ng mas malalaking chunk ang overhead ng network. Nagbabasa ang Python example nito ng audio mula sa mikropono sa mga block na tig-100 ms. Magkaibang pagpili ang payo sa maliliit na chunk at sukat ng block sa sample; hindi ito resultang sinukat ng BIG CHANGE.
Nangangailangan ang [ruta ng Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) ng SDK v1.52.0, Azure subscription, at Foundry o Speech resource. Itinatakda ng Python sample ng Microsoft ang `speech_config.model` sa `MAI-Transcribe-2-Streaming`, nagbibigay ng 16 kHz, 16-bit mono audio sa pamamagitan ng push stream, at nakikinig sa mga event na `recognizing` at `recognized`. Gumagamit ang sample ng dati nang `audio.pcm` file upang ipakita ang push stream; sariling audio source ang ibibigay ng isang app. Dokumentadong interface at inaasahang uri ng event ang mga ito, hindi pagsubok ng publikasyong ito sa compatibility ng isang partikular na account.
## Ihiwalay ang pansamantalang teksto sa nakumpirmang teksto
Mahalaga sa live interface ang semantika ng Realtime event. May bagong pinal na teksto ang event na `conversation.item.input_audio_transcription.delta`; idinadagdag ito ng client app sa nakumpirmang buffer nang hindi binabago ang pagitan ng mga salita. Taglay naman ng event na `intermediate` ang buong kasalukuyang hulihan ng pansamantalang teksto. Pinapalitan ng bawat bagong hulihan ang nauna. Maaaring ipakita ng screen ang nakumpirmang buffer kasama ang kasalukuyang hulihan, ngunit magdodoble ang mga salita kung ise-save ang bawat pansamantalang event bilang panibagong linya habang binabago ito ng model.
Ipinadadala ng client ang `input_audio_buffer.commit` kapag may natukoy itong paghinto o sa dulo ng recording. Ayon sa Microsoft, hinihiling nito ang pinal na transcript sa lalong madaling panahon; kinukumpirma ng `input_audio_buffer.committed` ang commit, at ibinibigay ng `conversation.item.input_audio_transcription.completed` ang buong pinal na teksto para sa audio mula sa naunang commit. Ayon sa [gabay sa Realtime](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) hindi magagamit ang server turn detection at awtomatikong commit sa configuration ng session ng model na ito. Kaya kailangan ng voice app ng sarili nitong paghinto o hangganan ng turn kung nais nitong awtomatikong kumpletuhin ang mga segment. Inilalarawan ng dokumentasyon ang kontrata ng mga event; hindi ito nag-uutos ng iisang angkop na paraan ng pagtukoy sa hangganan para sa lahat.
Nililimitahan ng gabay ng Microsoft sa isang oras ang bawat Realtime session. Sinasabi rin nitong walang indibidwal na kumpirmasyon ang bawat audio append at maaari itong magbunga ng zero o ilang transcript event. Dapat pag-ibahin ng developer na sumusubok ng prototype ang pagtanggap ng audio message at ang pagtanggap ng pinal na teksto, at pagpasiyahan kung paano hahawakan ng app ang naputol na session. May queue ng mikropono at paghawak ng error ang Python example sa pampublikong gabay, ngunit hindi ito pinatakbo ng BIG CHANGE upang alamin ang aktuwal na gawi kapag pumalya.
## Access, mga rehiyon, at presyo
Ayon sa Microsoft, maa-access ang model sa buong mundo at niruruta ng Azure ang mga request sa mga rehiyong nagbibigay ng serbisyo. Magkaibang listahan ng mga available na rehiyon ang nasa dalawang pahina ng integrasyon noong Oktubre 1: Sweden Central, Central US, at South India ang nasa gabay ng Realtime; Sweden Central, Central US, at Southeast Asia naman sa gabay ng Speech SDK. Pareho nilang inililista ang East US 2 bilang paparating pa lamang. Tingnan ang kasalukuyang deployment at mga opsiyon sa rehiyon para sa rutang gagamitin; walang iisang magkakatugmang listahan sa mga pahinang ito. Hindi garantiya ng partikular na lokasyon ng pagproseso ang pandaigdigang access.
Binabanggit sa anunsiyo ng Microsoft ang panimulang presyong **$0.54 bawat oras ng audio hanggang sa katapusan ng 2026**. Katumbas iyon ng $9 kada 1,000 minuto ng audio ayon sa kalkulasyon, bago ang anumang hiwalay na serbisyo o imprastrakturang gagamitin ng app. Nagli-link ang mga gabay ng Microsoft sa mga pahina ng pagpepresyo ng Foundry Models at Speech service para sa kani-kanilang ruta. Walang ibinigay na presyo matapos ang panimulang alok o aktuwal na bill ang mga sinuring sanggunian; kailangan ng kasalukuyang pagsusuri sa presyo para sa badyet ng deployment.
Ayon sa Microsoft, sumusuporta ang streaming model sa tuloy-tuloy na awtomatikong pagtukoy sa 60 wika. Sinasabi nitong lumilitaw ang unang bahagyang resulta pagkaraan lamang ng mahigit 100 ms mula sa pagtanggap ng audio, at binabanggit nito ang nangungunang ranggo sa katumpakan ayon sa Artificial Analysis. [Sinusukat ng streaming benchmark ng Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) ang word error rate sa humigit-kumulang walong oras ng mga dataset na binigyan ng timbang, at itinatala ang oras ng pansamantala at pinal na resulta kaugnay ng natukoy na katapusan ng pagsasalita. Benchmark ito para sa tinukoy na audio at mga tuntunin sa pagsukat ng oras, hindi garantiya na magpapakita ng tamang mga salita ang isang partikular na app sa loob ng 100 ms. Hindi namin nakumpirma nang hiwalay ang eksaktong ranggo na binanggit ng Microsoft mula sa resultang partikular sa model sa pampublikong teksto ng benchmark na nakuha para sa artikulong ito.
Hiwalay na dinodokumento ng [gabay sa MAI-Transcribe-2 para sa Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) ang file input at mga opsiyong gaya ng speaker diarization, timestamp sa bawat salita, keyword biasing, at malinis o verbatim na estilo. Huwag ipalagay na gumagana ang mga kontrol na ito sa MAI-Transcribe-2-Streaming: hindi nakadokumento ang mga ito sa mga gabay sa streaming integration. Kung kailangan ng produkto ang mga output na iyon, suriin ang file model o tiyakin muna sa kasalukuyang dokumentasyon at pagsubok kung sinusuportahan ito ng streaming bago ito gawing batayan ng build.
## Mga sanggunian at karagdagang babasahin
- [Anunsiyo ng Microsoft AI](https://microsoft.ai/news/our-first-streaming-transcription-model/), Oktubre 1, 2026: mga pahayag tungkol sa release, wika, bilis, at panimulang presyo. Iniuugnay sa Microsoft sa itaas ang sarili nitong mga pahayag tungkol sa katumpakan at bilis.
- [Katalogo ng modelo ng Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), sinuri noong Oktubre 2: bersiyon ng model, yugto ng preview, at mga uri ng input at output; hindi ito pagsubok sa performance.
- [Pangkalahatang-ideya ng streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [gabay sa Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) at [gabay sa Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), na-update noong Oktubre 1: dalawang dokumentadong paraan ng integrasyon, mga tuntunin sa preview, gawi ng event, halimbawa, at talahanayan ng mga rehiyon. Hindi pinatakbo ng BIG CHANGE ang mga halimbawa.
- [MAI-Transcribe-2 sa Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), sinuri noong Oktubre 2: hiwalay na file transcription path at mga dokumentadong kontrol nito. Hindi nito pinatutunayan na kapareho ang mga feature ng streaming.
- [Artificial Analysis streaming benchmark](https://artificialanalysis.ai/speech-to-text/streaming) at [pamamaraan](https://artificialanalysis.ai/methodology/speech-to-text); sinuri noong Oktubre 2: disenyo ng independiyenteng benchmark at mga depinisyon sa pagsukat ng oras. Hindi ipinakita sa nakuha naming pampublikong teksto ang eksaktong result row ng model upang makumpirma nang hiwalay ang ranggo.
## Sources
- [Nag-debut ang una naming streaming transcription model sa unang puwesto sa Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Mga pahayag ng Microsoft AI tungkol sa paglulunsad, suporta sa 60 wika at bilis, ranggo, at panimulang presyong $0.54 bawat oras ng audio hanggang 2026. Mga pahayag ng vendor, hindi mga sukat ng BIG CHANGE.
- [MAI-Transcribe-2-Streaming | Katalogo ng modelo | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — Opisyal na katalogo: bersiyon ng model na 2026-08-06, yugto ng preview, input ng audio, at output na teksto. Iba ang petsa ng bersiyon sa petsa ng anunsiyo.
- [Pangkalahatang-ideya ng MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — Opisyal na overview na huling na-update noong Oktubre 1: pampublikong preview na walang SLA, hindi inirerekomenda para sa production, at dalawang paraan ng integrasyon.
- [Gamitin ang MAI-Transcribe-2-Streaming sa Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — Opisyal na gabay sa Realtime na huling na-update noong Oktubre 1: deployment sa Foundry, WebSocket, PCM16, semantika ng event, manual commit, session na hanggang isang oras, at listahan ng rehiyon. Hindi pinatakbo ng BIG CHANGE ang sample.
- [Gamitin ang MAI-Transcribe-2-Streaming sa Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — Opisyal na gabay ng SDK na huling na-update noong Oktubre 1: v1.52.0, push audio, at mga event ng pagkilala. Naiiba ang talahanayan ng mga rehiyon sa gabay ng Realtime. Hindi sinubukan ang sample ng BIG CHANGE.
- [MAI-Transcribe sa Azure Speech (preview)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — Hiwalay na MAI-Transcribe-2 file path at mga opsiyon nito. Hindi nito pinatutunayang kapareho ang mga feature ng streaming.
- [Leaderboard at paghahambing ng Speech to Text](https://artificialanalysis.ai/speech-to-text/streaming) — Ipinapaliwanag ng independiyenteng operator ng benchmark ang mga sukatan ng streaming WER at latency. Hindi ipinakita sa nakuha naming pampublikong teksto ang result row na partikular sa model, kaya iniuugnay sa Microsoft ang pahayag tungkol sa eksaktong ranggo at hindi ito kinukumpirmang hiwalay.
- [Pamamaraan sa pag-benchmark ng Speech to Text](https://artificialanalysis.ai/methodology/speech-to-text) — Pamamaraan ng benchmark para sa streamed audio, mga dataset, weighting, at latency. Hindi pinatutunayan ng mga benchmark ang latency o katumpakan ng bawat app.
Newsletter ng BIG CHANGE
Ang kabuuang larawan, sa sarili mong bilis.
Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.
Ipinapadala nang 09:00 oras sa Belgrade: araw-araw, tuwing Lunes, o sa unang araw ng buwan. Darating ang una mong edisyon sa susunod na nakaiskedyul na pagpapadala pagkatapos mong magkumpirma.
Privacy mo, pasya mo.
Tumutulong ang kinakailangang storage na panatilihing ligtas ang site at tandaan ang mga pinili mo. Nananatiling naka-off ang opsyonal na Google Analytics hangga’t hindi mo ito pinapahintulutan. Mababasa mo ang lahat ng kuwento gamit lamang ang kinakailangang storage. Mga detalye tungkol sa privacy