Inanunsiyo ng Microsoft ang MAI-Transcribe-2-Streaming noong Oktubre 1. Tumatanggap ito ng audio habang may nagsasalita at nagbabalik ng nagbabagong teksto bago ang pinal na transcript. Para sa developer na nagdaragdag ng live caption o speech input sa voice app, mahalagang malaman kung paano nakararating sa app ang mga update at kung kailan maituturing na pinal ang mga ito.

Gabay ito para sa mga developer na nagsusuri sa pampublikong preview, batay sa dokumentasyon ng integrasyon. Kailangang pagpasyahan kung gagawa ng prototype ng model at tukuyin ang gawaing kailangan sa client upang maipakita ang live na teksto at mapanatili ang pinal na teksto. Itinatala ng Microsoft ang endpoint at sample code; hindi ini-deploy ng BIG CHANGE ang model, pinatakbo ang mga sample, o sinukat ang katumpakan o latency nito.

Ang pangunahing pagbabago

  • Nagpakilala ang Microsoft ng streaming model na nagbabalik ng pansamantalang teksto habang dumarating ang audio, saka nagkukumpirma sa mga bahagi ng transcript. Iba ang MAI-Transcribe-2 file transcription path nito, na para sa naka-record na audio at nagdodokumento ng ibang mga opsiyon.
  • Kailangang magpadala ang app na gumagamit ng Realtime API ng wastong format ng audio, humawak sa mga rebisyon ng pansamantalang hulihan ng teksto, at magpasya kung kailan hihiling ng kumpletong transcript. Tinutukoy ng mga pagpiling ito kung ano ang makikita ng user at kung kailan maaasahan ng kasunod na logic ng app ang pinal na teksto.
  • Pampublikong preview ang streaming model at wala itong service-level agreement. Hindi ito inirerekomenda ng Microsoft para sa production workload. Mga pahayag sa paglulunsad at benchmark ang binanggit na bilis at katumpakan, hindi mga sukat mula sa gabay na ito.

Pumili ng paraan ng koneksiyon

Ang katalogo ng Microsoft Foundry ay naglilista sa MAI-Transcribe-2-Streaming, bersiyong 2026-08-06, bilang preview model na tumatanggap ng audio at naglalabas ng teksto. Inilalarawan ng pangkalahatang-ideya noong Oktubre 1 ng Microsoft ang dalawang paraan ng integrasyon: Realtime API na gumagamit ng WebSocket protocol na kahawig ng OpenAI Realtime, o Azure Speech SDK. Pareho silang nagbabalik ng pansamantala at pinal na resulta ng pagkilala. Pinamamahalaan ng SDK ang koneksiyon at streaming ng audio; direktang inilalantad naman ng Realtime route ang mga event.

Para sa Realtime API, kailangan ng Microsoft Foundry ang Azure subscription, resource sa sinusuportahang rehiyon, at deployment ng streaming model. Kumonekta sa wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription gamit ang Microsoft Entra bearer token o API key. Inirerekomenda ng dokumentasyon ang Entra authentication. Pagkatapos ng session.created ipadala ang session.update at pangalanan ang deployment mo at itakda ang format ng input. Hindi na mababago ang setting matapos ang unang pagdagdag ng audio, kahit pagkatapos ng commit.

Raw, signed, little-endian, mono PCM16 sa 16 o 24 kHz ang dokumentadong input; ipinadadala ito bilang mga base64 chunk sa mga input_audio_buffer.append message. PCM data ito na walang WAV header. Inirerekomenda ng Microsoft ang maliliit na chunk, gaya ng 10 hanggang 20 millisecond, upang bawasan ang latency; binabanggit din nitong nababawasan ng mas malalaking chunk ang overhead ng network. Nagbabasa ang Python example nito ng audio mula sa mikropono sa mga block na tig-100 ms. Magkaibang pagpili ang payo sa maliliit na chunk at sukat ng block sa sample; hindi ito resultang sinukat ng BIG CHANGE.

Nangangailangan ang ruta ng Speech SDK ng SDK v1.52.0, Azure subscription, at Foundry o Speech resource. Itinatakda ng Python sample ng Microsoft ang speech_config.model sa MAI-Transcribe-2-Streaming, nagbibigay ng 16 kHz, 16-bit mono audio sa pamamagitan ng push stream, at nakikinig sa mga event na recognizing at recognized. Gumagamit ang sample ng dati nang audio.pcm file upang ipakita ang push stream; sariling audio source ang ibibigay ng isang app. Dokumentadong interface at inaasahang uri ng event ang mga ito, hindi pagsubok ng publikasyong ito sa compatibility ng isang partikular na account.

Ihiwalay ang pansamantalang teksto sa nakumpirmang teksto

Mahalaga sa live interface ang semantika ng Realtime event. May bagong pinal na teksto ang event na conversation.item.input_audio_transcription.delta; idinadagdag ito ng client app sa nakumpirmang buffer nang hindi binabago ang pagitan ng mga salita. Taglay naman ng event na intermediate ang buong kasalukuyang hulihan ng pansamantalang teksto. Pinapalitan ng bawat bagong hulihan ang nauna. Maaaring ipakita ng screen ang nakumpirmang buffer kasama ang kasalukuyang hulihan, ngunit magdodoble ang mga salita kung ise-save ang bawat pansamantalang event bilang panibagong linya habang binabago ito ng model.

Ipinadadala ng client ang input_audio_buffer.commit kapag may natukoy itong paghinto o sa dulo ng recording. Ayon sa Microsoft, hinihiling nito ang pinal na transcript sa lalong madaling panahon; kinukumpirma ng input_audio_buffer.committed ang commit, at ibinibigay ng conversation.item.input_audio_transcription.completed ang buong pinal na teksto para sa audio mula sa naunang commit. Ayon sa gabay sa Realtime hindi magagamit ang server turn detection at awtomatikong commit sa configuration ng session ng model na ito. Kaya kailangan ng voice app ng sarili nitong paghinto o hangganan ng turn kung nais nitong awtomatikong kumpletuhin ang mga segment. Inilalarawan ng dokumentasyon ang kontrata ng mga event; hindi ito nag-uutos ng iisang angkop na paraan ng pagtukoy sa hangganan para sa lahat.

Nililimitahan ng gabay ng Microsoft sa isang oras ang bawat Realtime session. Sinasabi rin nitong walang indibidwal na kumpirmasyon ang bawat audio append at maaari itong magbunga ng zero o ilang transcript event. Dapat pag-ibahin ng developer na sumusubok ng prototype ang pagtanggap ng audio message at ang pagtanggap ng pinal na teksto, at pagpasiyahan kung paano hahawakan ng app ang naputol na session. May queue ng mikropono at paghawak ng error ang Python example sa pampublikong gabay, ngunit hindi ito pinatakbo ng BIG CHANGE upang alamin ang aktuwal na gawi kapag pumalya.

Access, mga rehiyon, at presyo

Ayon sa Microsoft, maa-access ang model sa buong mundo at niruruta ng Azure ang mga request sa mga rehiyong nagbibigay ng serbisyo. Magkaibang listahan ng mga available na rehiyon ang nasa dalawang pahina ng integrasyon noong Oktubre 1: Sweden Central, Central US, at South India ang nasa gabay ng Realtime; Sweden Central, Central US, at Southeast Asia naman sa gabay ng Speech SDK. Pareho nilang inililista ang East US 2 bilang paparating pa lamang. Tingnan ang kasalukuyang deployment at mga opsiyon sa rehiyon para sa rutang gagamitin; walang iisang magkakatugmang listahan sa mga pahinang ito. Hindi garantiya ng partikular na lokasyon ng pagproseso ang pandaigdigang access.

Binabanggit sa anunsiyo ng Microsoft ang panimulang presyong $0.54 bawat oras ng audio hanggang sa katapusan ng 2026. Katumbas iyon ng $9 kada 1,000 minuto ng audio ayon sa kalkulasyon, bago ang anumang hiwalay na serbisyo o imprastrakturang gagamitin ng app. Nagli-link ang mga gabay ng Microsoft sa mga pahina ng pagpepresyo ng Foundry Models at Speech service para sa kani-kanilang ruta. Walang ibinigay na presyo matapos ang panimulang alok o aktuwal na bill ang mga sinuring sanggunian; kailangan ng kasalukuyang pagsusuri sa presyo para sa badyet ng deployment.

Ayon sa Microsoft, sumusuporta ang streaming model sa tuloy-tuloy na awtomatikong pagtukoy sa 60 wika. Sinasabi nitong lumilitaw ang unang bahagyang resulta pagkaraan lamang ng mahigit 100 ms mula sa pagtanggap ng audio, at binabanggit nito ang nangungunang ranggo sa katumpakan ayon sa Artificial Analysis. Sinusukat ng streaming benchmark ng Artificial Analysis ang word error rate sa humigit-kumulang walong oras ng mga dataset na binigyan ng timbang, at itinatala ang oras ng pansamantala at pinal na resulta kaugnay ng natukoy na katapusan ng pagsasalita. Benchmark ito para sa tinukoy na audio at mga tuntunin sa pagsukat ng oras, hindi garantiya na magpapakita ng tamang mga salita ang isang partikular na app sa loob ng 100 ms. Hindi namin nakumpirma nang hiwalay ang eksaktong ranggo na binanggit ng Microsoft mula sa resultang partikular sa model sa pampublikong teksto ng benchmark na nakuha para sa artikulong ito.

Hiwalay na dinodokumento ng gabay sa MAI-Transcribe-2 para sa Azure Speech ang file input at mga opsiyong gaya ng speaker diarization, timestamp sa bawat salita, keyword biasing, at malinis o verbatim na estilo. Huwag ipalagay na gumagana ang mga kontrol na ito sa MAI-Transcribe-2-Streaming: hindi nakadokumento ang mga ito sa mga gabay sa streaming integration. Kung kailangan ng produkto ang mga output na iyon, suriin ang file model o tiyakin muna sa kasalukuyang dokumentasyon at pagsubok kung sinusuportahan ito ng streaming bago ito gawing batayan ng build.

Mga sanggunian at karagdagang babasahin

  • Anunsiyo ng Microsoft AI, Oktubre 1, 2026: mga pahayag tungkol sa release, wika, bilis, at panimulang presyo. Iniuugnay sa Microsoft sa itaas ang sarili nitong mga pahayag tungkol sa katumpakan at bilis.
  • Katalogo ng modelo ng Microsoft Foundry, sinuri noong Oktubre 2: bersiyon ng model, yugto ng preview, at mga uri ng input at output; hindi ito pagsubok sa performance.
  • Pangkalahatang-ideya ng streaming, gabay sa Realtime API at gabay sa Speech SDK, na-update noong Oktubre 1: dalawang dokumentadong paraan ng integrasyon, mga tuntunin sa preview, gawi ng event, halimbawa, at talahanayan ng mga rehiyon. Hindi pinatakbo ng BIG CHANGE ang mga halimbawa.
  • MAI-Transcribe-2 sa Azure Speech, sinuri noong Oktubre 2: hiwalay na file transcription path at mga dokumentadong kontrol nito. Hindi nito pinatutunayan na kapareho ang mga feature ng streaming.
  • Artificial Analysis streaming benchmark at pamamaraan; sinuri noong Oktubre 2: disenyo ng independiyenteng benchmark at mga depinisyon sa pagsukat ng oras. Hindi ipinakita sa nakuha naming pampublikong teksto ang eksaktong result row ng model upang makumpirma nang hiwalay ang ranggo.