SVET NE STOJI U MESTU.RSS
BIG CHANGE.

Markdown izdanje

AI-translated from English; not yet reviewed by a fluent editor.

# MAI-Transcribe-2-Streaming kompanije Microsoft: transkripcija uživo i njena ograničenja

> Microsoftov novi model za striming transkripciju vraća privremeni, a zatim konačni tekst dok zvuk pristiže. Njegov API u probnoj verziji prepušta klijentskoj aplikaciji utvrđivanje kraja govorne smene i završavanje segmenta.

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Microsoft je [1. oktobra najavio model MAI-Transcribe-2-Streaming](https://microsoft.ai/news/our-first-streaming-transcription-model/). Prima zvuk dok osoba govori i prikazuje tekst koji se menja, a zatim i konačni transkript. Za programera koji glasovnoj aplikaciji dodaje titlove uživo ili glasovni unos, važno je kako te izmene stižu do aplikacije i kada se tekst može smatrati konačnim.

Ovaj vodič za integraciju zasniva se na dokumentaciji i namenjen je programerima koji procenjuju javnu probnu verziju. Cilj je da odluče da li da naprave prototip sa ovim modelom i utvrde koje poslove klijentska aplikacija mora da obavi da bi prikazivala tekst uživo i sačuvala konačni transkript. Microsoft opisuje način povezivanja i primer koda; BIG CHANGE nije postavio model, pokrenuo primere niti merio tačnost ili kašnjenje.

## Suštinska promena

- Microsoft je predstavio striming model koji prikazuje privremeni tekst dok zvuk pristiže, a zatim potvrđuje segmente transkripta. Odvojeni put za transkripciju datoteka MAI-Transcribe-2 obrađuje snimljeni zvuk i ima drugačiji skup dokumentovanih opcija.
- Aplikacija koja koristi Realtime API mora da šalje pravilno formatiran zvuk, obrađuje izmene privremenog završnog dela transkripta i odluči kada da zatraži dovršen transkript. Te odluke određuju šta korisnici vide i kada se logika aplikacije može osloniti na konačni tekst.
- Striming model je u javnoj probnoj verziji i nema ugovor o nivou usluge. Microsoft ne preporučuje njegovu upotrebu u produkcionim sistemima. Navedeni rezultati brzine i tačnosti predstavljaju tvrdnje iz objave i poređenja, a ne merenja iz ovog vodiča.

## Izaberite način povezivanja

U katalogu usluge [Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) naveden je model `MAI-Transcribe-2-Streaming`, verzija `2026-08-06`, kao probni model sa zvučnim ulazom i tekstualnim izlazom. Microsoftov [pregled od 1. oktobra](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) opisuje dva načina integracije: Realtime API koji koristi protokol WebSocket nalik OpenAI Realtime-u ili Azure Speech SDK. Oba vraćaju međurezultate i konačne rezultate prepoznavanja. SDK upravlja vezom i strimingom zvuka, dok Realtime put neposredno prikazuje događaje.

Za [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), Microsoft zahteva pretplatu na Azure, resurs Microsoft Foundry u podržanom regionu i objavljenu instancu striming modela. Povežite se na `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` pomoću bearer tokena Microsoft Entra ili API ključa. U dokumentaciji se preporučuje autentifikacija Entra sistemom. Posle povezivanja pošaljite `session.created`, a zatim poruku `session.update` u kojoj navodite objavljenu verziju i format ulaza. Podešavanje se ne može promeniti nakon dodavanja prvog zvuka, čak ni nakon potvrde unosa.

Dokumentovani ulaz je sirovi mono PCM16 zvuk sa predznakom i malim redosledom bajtova, frekvencije 16 ili 24 kHz, koji se šalje u Base64 segmentima kroz poruke `input_audio_buffer.append`. To su PCM podaci bez WAV zaglavlja. Da bi se smanjilo kašnjenje, Microsoft preporučuje male segmente od 10 do 20 milisekundi, uz napomenu da veći segmenti smanjuju opterećenje mreže. U njihovom primeru za Python zvuk iz mikrofona čita se u blokovima od 100 ms; savet o malim segmentima i veličina bloka u primeru predstavljaju različite izbore, a ne rezultat merenja BIG CHANGE-a.

Za povezivanje preko [Speech SDK-a](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) potrebni su SDK v1.52.0, pretplata na Azure i resurs Foundry ili Speech. U Microsoftovom primeru za Python, `speech_config.model` se postavlja na `MAI-Transcribe-2-Streaming`, zvuk frekvencije 16 kHz i dubine 16 bita šalje se kroz ulazni tok, a aplikacija osluškuje događaje `recognizing` i `recognized`. Primer koristi postojeću datoteku `audio.pcm` kao izvor zvuka za ulazni tok; aplikacija bi koristila sopstveni izvor zvuka. Reč je o dokumentovanim interfejsima i očekivanim vrstama događaja, a ne o proveri kompatibilnosti naloga koju je izvršila naša redakcija.

## Odvojite privremeni tekst od potvrđenog teksta

Semantika događaja u Realtime API-ju važna je za prikaz uživo. Događaj `conversation.item.input_audio_transcription.delta` sadrži novopotvrđeni tekst, koji klijentska aplikacija dodaje u potvrđeni sadržaj bez promene razmaka. Događaj `intermediate` sadrži ceo aktuelni privremeni završni deo transkripta. Svaki novi takav deo zamenjuje prethodni. Ekran može da prikaže potvrđeni sadržaj zajedno sa trenutnim privremenim delom, ali bi čuvanje svakog međudogađaja u novom redu dupliralo reči dok ih model menja.

Klijent šalje poruku `input_audio_buffer.commit` kada prepozna pauzu ili na kraju snimka. Microsoft navodi da se time zahteva konačni transkript čim bude spreman; poruka `input_audio_buffer.committed` potvrđuje zahtev, a `conversation.item.input_audio_transcription.completed` vraća ceo konačni tekst zvuka od prethodne potvrde. [U vodiču za Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) navodi se da u konfiguraciji sesije ovog modela nisu dostupni utvrđivanje kraja govorne smene na serverskoj strani ni automatska potvrda. Zato glasovna aplikacija mora sama da prepozna pauzu ili granicu govorne smene ako želi automatski da završava segmente. Dokumentacija opisuje ugovor o događajima, ali ne propisuje jedan univerzalno prikladan način za prepoznavanje te granice.

Microsoftov vodič ograničava svaku Realtime sesiju na jedan sat. Takođe navodi da pojedinačno dodavanje zvuka nema potvrdu prijema i može da proizvede nula ili više događaja transkripta. Programeri koji procenjuju prototip treba da razlikuju prijem zvučnih poruka od prijema konačnog teksta i odluče kako će aplikacija postupiti pri prekidu veze. Javni primer za Python sadrži red za mikrofon i obradu grešaka, ali BIG CHANGE ga nije pokrenuo da bi utvrdio ponašanje pri kvaru.

## Pristup, regioni i cena

Microsoft navodi da se modelu može pristupiti iz celog sveta, dok Azure usmerava zahteve ka regionima u kojima se oni obrađuju. Dve stranice za integraciju od 1. oktobra navode različite dostupne regione: u vodiču za Realtime API navedeni su Sweden Central, Central US i South India; u vodiču za Speech SDK navedeni su Sweden Central, Central US i Southeast Asia. Na obe stranice se navodi da će East US 2 biti dostupan naknadno. Proverite aktuelne opcije za objavljivanje modela i region za put koji nameravate da koristite; ove stranice ne daju jedan dosledan spisak. Globalni pristup ne znači da je obećana obrada podataka na određenoj lokaciji.

U objavi je navedena uvodna cena od **0,54 dolara po satu zvučnog materijala do kraja 2026.**. Računski, to je 9 dolara za 1.000 minuta zvuka, pre posebnih usluga ili infrastrukture koje aplikacija koristi. Microsoft u svojim vodičima upućuje na stranice sa cenama Foundry modela i Speech usluge za odgovarajuće načine povezivanja. U pregledanim izvorima nisu navedeni cena nakon uvodnog perioda ni stvarni račun, pa je pri planiranju budžeta za postavljanje potrebno proveriti aktuelne cene.

Microsoft navodi da striming model podržava 60 jezika uz neprekidno automatsko prepoznavanje jezika. Kaže da se prvi privremeni rezultat prikazuje nešto više od 100 ms nakon prijema zvuka i poziva se na Artificial Analysis za vodeći rezultat po tačnosti. [Test striming transkripcije Artificial Analysis-a](https://artificialanalysis.ai/speech-to-text/streaming) meri stopu grešaka u rečima na oko osam sati ponderisanih skupova podataka i vreme do privremenih i konačnih rezultata u odnosu na prepoznati kraj govora. To je test jasno određenih zvučnih zapisa i pravila merenja vremena, a ne garancija da će određena aplikacija prikazati tačne reči za 100 ms. Nismo nezavisno potvrdili tačan plasman koji navodi Microsoft jer u javnom tekstu testa preuzetom za ovu priču nismo pronašli red sa rezultatom konkretnog modela.

U zasebnom vodiču za Azure Speech model [MAI-Transcribe-2](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) opisuju se ulazne datoteke i opcije, uključujući razdvajanje govornika, vremenske oznake za svaku reč, davanje prednosti ključnim rečima i stilove sa poštapalicama ili bez njih. Nemojte pretpostaviti da su te kontrole dostupne u modelu MAI-Transcribe-2-Streaming: vodiči za integraciju striming modela ih ne opisuju. Ako su takvi rezultati potrebni proizvodu, pre izrade proverite trenutnu dokumentaciju i sprovedite test ili procenite model za datoteke.

## Izvori i dodatna literatura

- [Objava Microsoft AI-ja](https://microsoft.ai/news/our-first-streaming-transcription-model/), 1. oktobar 2026: objava modela i tvrdnje o broju jezika, brzini i uvodnoj ceni. Microsoftove tvrdnje o tačnosti i internoj brzini pripisane su kompaniji u tekstu iznad.
- [Katalog modela Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), proveren 2. oktobra: verzija modela, probna faza i vrste ulaza i izlaza; katalog nije test performansi.
- [Pregled striming modela](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Vodič za Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) i [Vodič za Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), ažurirani 1. oktobra: opisuju dva načina integracije, uslove probne verzije, ponašanje događaja, primere i tabele regiona. BIG CHANGE nije pokrenuo primere.
- [MAI-Transcribe-2 u Azure Speech-u](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), provereno 2. oktobra: zaseban put za transkripciju datoteka i dokumentovane kontrole. Njegov spisak funkcija ne opisuje mogućnosti striming modela.
- [Test striming transkripcije Artificial Analysis-a](https://artificialanalysis.ai/speech-to-text/streaming) i [metodologija](https://artificialanalysis.ai/methodology/speech-to-text), provereni 2. oktobra: dizajn nezavisnog testa i definicije merenja vremena. U javnom tekstu koji smo preuzeli nije prikazan red sa tačnim rezultatom modela za nezavisnu potvrdu njegovog plasmana.

## Sources

- [Prvi striming model za transkripciju kompanije Microsoft debitovao je na prvom mestu Artificial Analysis-a](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Objava Microsoft AI-ja o predstavljanju modela, podršci za 60 jezika, brzini, navodnom plasmanu i uvodnoj ceni od 0,54 dolara po satu zvučnog materijala do kraja 2026. Tvrdnje dobavljača, a ne merenja BIG CHANGE-a.
- [MAI-Transcribe-2-Streaming | Katalog modela | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — Zvanični katalog: verzija modela 2026-08-06, probna faza, zvučni ulaz i tekstualni izlaz. Verzija se razlikuje od datuma objave.
- [Pregled modela MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — Zvanični pregled, poslednji put ažuriran 1. oktobra: javna probna verzija bez ugovora o nivou usluge, ne preporučuje se za produkciju i nudi dva načina integracije.
- [Korišćenje modela MAI-Transcribe-2-Streaming uz Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — Zvanični vodič za Realtime API, poslednji put ažuriran 1. oktobra: objavljivanje preko Foundry-ja, WebSocket, PCM16, semantika događaja, ručna potvrda, sesije od jednog sata i spisak regiona. BIG CHANGE nije pokrenuo primer.
- [Korišćenje modela MAI-Transcribe-2-Streaming uz Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — Zvanični vodič za SDK, poslednji put ažuriran 1. oktobra: v1.52.0, slanje zvuka i događaji prepoznavanja. Tabela regiona razlikuje se od vodiča za Realtime API. BIG CHANGE nije testirao primer.
- [MAI-Transcribe u Azure Speech-u (probna verzija)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — Odvojen put za transkripciju datoteka modelom MAI-Transcribe-2 i njegove opcije. Ne potvrđuje da striming model ima iste funkcije.
- [Rang-lista i poređenje pružalaca usluge pretvaranja govora u tekst](https://artificialanalysis.ai/speech-to-text/streaming) — Nezavisni pružalac testa objašnjava metrike grešaka u rečima i kašnjenja za striming. U preuzetom javnom tekstu nije prikazan red sa rezultatom konkretnog modela, pa se tačan plasman pripisuje Microsoftu i nije nezavisno potvrđen.
- [Metodologija testiranja pretvaranja govora u tekst](https://artificialanalysis.ai/methodology/speech-to-text) — Metodologija za striming zvuka, skupove podataka, ponderisanje i kašnjenje. Rezultati testa ne utvrđuju kašnjenje ili tačnost svake pojedinačne aplikacije.
Bilten BIG CHANGE

Šira slika. Vašim tempom.

Nedavne priče o veštačkoj inteligenciji i robotici, promene vredne praćenja i praktične ideje za primenu. Izaberite dnevni pregled, nedeljni sažetak ili mesečnu perspektivu.