Microsoft je 1. oktobra najavio model MAI-Transcribe-2-Streaming. Prima zvuk dok osoba govori i prikazuje tekst koji se menja, a zatim i konačni transkript. Za programera koji glasovnoj aplikaciji dodaje titlove uživo ili glasovni unos, važno je kako te izmene stižu do aplikacije i kada se tekst može smatrati konačnim.
Ovaj vodič za integraciju zasniva se na dokumentaciji i namenjen je programerima koji procenjuju javnu probnu verziju. Cilj je da odluče da li da naprave prototip sa ovim modelom i utvrde koje poslove klijentska aplikacija mora da obavi da bi prikazivala tekst uživo i sačuvala konačni transkript. Microsoft opisuje način povezivanja i primer koda; BIG CHANGE nije postavio model, pokrenuo primere niti merio tačnost ili kašnjenje.
Suštinska promena
- Microsoft je predstavio striming model koji prikazuje privremeni tekst dok zvuk pristiže, a zatim potvrđuje segmente transkripta. Odvojeni put za transkripciju datoteka MAI-Transcribe-2 obrađuje snimljeni zvuk i ima drugačiji skup dokumentovanih opcija.
- Aplikacija koja koristi Realtime API mora da šalje pravilno formatiran zvuk, obrađuje izmene privremenog završnog dela transkripta i odluči kada da zatraži dovršen transkript. Te odluke određuju šta korisnici vide i kada se logika aplikacije može osloniti na konačni tekst.
- Striming model je u javnoj probnoj verziji i nema ugovor o nivou usluge. Microsoft ne preporučuje njegovu upotrebu u produkcionim sistemima. Navedeni rezultati brzine i tačnosti predstavljaju tvrdnje iz objave i poređenja, a ne merenja iz ovog vodiča.
Izaberite način povezivanja
U katalogu usluge Microsoft Foundry naveden je model MAI-Transcribe-2-Streaming, verzija 2026-08-06, kao probni model sa zvučnim ulazom i tekstualnim izlazom. Microsoftov pregled od 1. oktobra opisuje dva načina integracije: Realtime API koji koristi protokol WebSocket nalik OpenAI Realtime-u ili Azure Speech SDK. Oba vraćaju međurezultate i konačne rezultate prepoznavanja. SDK upravlja vezom i strimingom zvuka, dok Realtime put neposredno prikazuje događaje.
Za Realtime API, Microsoft zahteva pretplatu na Azure, resurs Microsoft Foundry u podržanom regionu i objavljenu instancu striming modela. Povežite se na wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription pomoću bearer tokena Microsoft Entra ili API ključa. U dokumentaciji se preporučuje autentifikacija Entra sistemom. Posle povezivanja pošaljite session.created, a zatim poruku session.update u kojoj navodite objavljenu verziju i format ulaza. Podešavanje se ne može promeniti nakon dodavanja prvog zvuka, čak ni nakon potvrde unosa.
Dokumentovani ulaz je sirovi mono PCM16 zvuk sa predznakom i malim redosledom bajtova, frekvencije 16 ili 24 kHz, koji se šalje u Base64 segmentima kroz poruke input_audio_buffer.append. To su PCM podaci bez WAV zaglavlja. Da bi se smanjilo kašnjenje, Microsoft preporučuje male segmente od 10 do 20 milisekundi, uz napomenu da veći segmenti smanjuju opterećenje mreže. U njihovom primeru za Python zvuk iz mikrofona čita se u blokovima od 100 ms; savet o malim segmentima i veličina bloka u primeru predstavljaju različite izbore, a ne rezultat merenja BIG CHANGE-a.
Za povezivanje preko Speech SDK-a potrebni su SDK v1.52.0, pretplata na Azure i resurs Foundry ili Speech. U Microsoftovom primeru za Python, speech_config.model se postavlja na MAI-Transcribe-2-Streaming, zvuk frekvencije 16 kHz i dubine 16 bita šalje se kroz ulazni tok, a aplikacija osluškuje događaje recognizing i recognized. Primer koristi postojeću datoteku audio.pcm kao izvor zvuka za ulazni tok; aplikacija bi koristila sopstveni izvor zvuka. Reč je o dokumentovanim interfejsima i očekivanim vrstama događaja, a ne o proveri kompatibilnosti naloga koju je izvršila naša redakcija.
Odvojite privremeni tekst od potvrđenog teksta
Semantika događaja u Realtime API-ju važna je za prikaz uživo. Događaj conversation.item.input_audio_transcription.delta sadrži novopotvrđeni tekst, koji klijentska aplikacija dodaje u potvrđeni sadržaj bez promene razmaka. Događaj intermediate sadrži ceo aktuelni privremeni završni deo transkripta. Svaki novi takav deo zamenjuje prethodni. Ekran može da prikaže potvrđeni sadržaj zajedno sa trenutnim privremenim delom, ali bi čuvanje svakog međudogađaja u novom redu dupliralo reči dok ih model menja.
Klijent šalje poruku input_audio_buffer.commit kada prepozna pauzu ili na kraju snimka. Microsoft navodi da se time zahteva konačni transkript čim bude spreman; poruka input_audio_buffer.committed potvrđuje zahtev, a conversation.item.input_audio_transcription.completed vraća ceo konačni tekst zvuka od prethodne potvrde. U vodiču za Realtime API navodi se da u konfiguraciji sesije ovog modela nisu dostupni utvrđivanje kraja govorne smene na serverskoj strani ni automatska potvrda. Zato glasovna aplikacija mora sama da prepozna pauzu ili granicu govorne smene ako želi automatski da završava segmente. Dokumentacija opisuje ugovor o događajima, ali ne propisuje jedan univerzalno prikladan način za prepoznavanje te granice.
Microsoftov vodič ograničava svaku Realtime sesiju na jedan sat. Takođe navodi da pojedinačno dodavanje zvuka nema potvrdu prijema i može da proizvede nula ili više događaja transkripta. Programeri koji procenjuju prototip treba da razlikuju prijem zvučnih poruka od prijema konačnog teksta i odluče kako će aplikacija postupiti pri prekidu veze. Javni primer za Python sadrži red za mikrofon i obradu grešaka, ali BIG CHANGE ga nije pokrenuo da bi utvrdio ponašanje pri kvaru.
Pristup, regioni i cena
Microsoft navodi da se modelu može pristupiti iz celog sveta, dok Azure usmerava zahteve ka regionima u kojima se oni obrađuju. Dve stranice za integraciju od 1. oktobra navode različite dostupne regione: u vodiču za Realtime API navedeni su Sweden Central, Central US i South India; u vodiču za Speech SDK navedeni su Sweden Central, Central US i Southeast Asia. Na obe stranice se navodi da će East US 2 biti dostupan naknadno. Proverite aktuelne opcije za objavljivanje modela i region za put koji nameravate da koristite; ove stranice ne daju jedan dosledan spisak. Globalni pristup ne znači da je obećana obrada podataka na određenoj lokaciji.
U objavi je navedena uvodna cena od 0,54 dolara po satu zvučnog materijala do kraja 2026.. Računski, to je 9 dolara za 1.000 minuta zvuka, pre posebnih usluga ili infrastrukture koje aplikacija koristi. Microsoft u svojim vodičima upućuje na stranice sa cenama Foundry modela i Speech usluge za odgovarajuće načine povezivanja. U pregledanim izvorima nisu navedeni cena nakon uvodnog perioda ni stvarni račun, pa je pri planiranju budžeta za postavljanje potrebno proveriti aktuelne cene.
Microsoft navodi da striming model podržava 60 jezika uz neprekidno automatsko prepoznavanje jezika. Kaže da se prvi privremeni rezultat prikazuje nešto više od 100 ms nakon prijema zvuka i poziva se na Artificial Analysis za vodeći rezultat po tačnosti. Test striming transkripcije Artificial Analysis-a meri stopu grešaka u rečima na oko osam sati ponderisanih skupova podataka i vreme do privremenih i konačnih rezultata u odnosu na prepoznati kraj govora. To je test jasno određenih zvučnih zapisa i pravila merenja vremena, a ne garancija da će određena aplikacija prikazati tačne reči za 100 ms. Nismo nezavisno potvrdili tačan plasman koji navodi Microsoft jer u javnom tekstu testa preuzetom za ovu priču nismo pronašli red sa rezultatom konkretnog modela.
U zasebnom vodiču za Azure Speech model MAI-Transcribe-2 opisuju se ulazne datoteke i opcije, uključujući razdvajanje govornika, vremenske oznake za svaku reč, davanje prednosti ključnim rečima i stilove sa poštapalicama ili bez njih. Nemojte pretpostaviti da su te kontrole dostupne u modelu MAI-Transcribe-2-Streaming: vodiči za integraciju striming modela ih ne opisuju. Ako su takvi rezultati potrebni proizvodu, pre izrade proverite trenutnu dokumentaciju i sprovedite test ili procenite model za datoteke.
Izvori i dodatna literatura
- Objava Microsoft AI-ja, 1. oktobar 2026: objava modela i tvrdnje o broju jezika, brzini i uvodnoj ceni. Microsoftove tvrdnje o tačnosti i internoj brzini pripisane su kompaniji u tekstu iznad.
- Katalog modela Microsoft Foundry, proveren 2. oktobra: verzija modela, probna faza i vrste ulaza i izlaza; katalog nije test performansi.
- Pregled striming modela, Vodič za Realtime API i Vodič za Speech SDK, ažurirani 1. oktobra: opisuju dva načina integracije, uslove probne verzije, ponašanje događaja, primere i tabele regiona. BIG CHANGE nije pokrenuo primere.
- MAI-Transcribe-2 u Azure Speech-u, provereno 2. oktobra: zaseban put za transkripciju datoteka i dokumentovane kontrole. Njegov spisak funkcija ne opisuje mogućnosti striming modela.
- Test striming transkripcije Artificial Analysis-a i metodologija, provereni 2. oktobra: dizajn nezavisnog testa i definicije merenja vremena. U javnom tekstu koji smo preuzeli nije prikazan red sa tačnim rezultatom modela za nezavisnu potvrdu njegovog plasmana.



