AI-translated from English; not yet reviewed by a fluent editor.

# MAI-Transcribe-2-Streaming компаније Microsoft: транскрипција уживо и њена ограничења

> Microsoftов нови модел за стриминг транскрипцију враћа привремени, а затим коначни текст док звук пристиже. Његов API у пробној верзији препушта клијентској апликацији утврђивање краја говорне смене и завршавање сегмента.

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Microsoft је [1. октобра најавио модел MAI-Transcribe-2-Streaming](https://microsoft.ai/news/our-first-streaming-transcription-model/). Прима звук док особа говори и приказује текст који се мења, а затим и коначни транскрипт. За програмера који гласовној апликацији додаје титлове уживо или гласовни унос, важно је како те измене стижу до апликације и када се текст може сматрати коначним.

Овај водич за интеграцију заснива се на документацији и намењен је програмерима који процењују јавну пробну верзију. Циљ је да одлуче да ли да направе прототип са овим моделом и утврде које послове клијентска апликација мора да обави да би приказивала текст уживо и сачувала коначни транскрипт. Microsoft описује начин повезивања и пример кода; BIG CHANGE није поставио модел, покренуо примере нити мерио тачност или кашњење.

## Суштинска промена

- Microsoft је представио стриминг модел који приказује привремени текст док звук пристиже, а затим потврђује сегменте транскрипта. Одвојени пут за транскрипцију датотека MAI-Transcribe-2 обрађује снимљени звук и има другачији скуп документованих опција.
- Апликација која користи Реалтиме API мора да шаље правилно форматиран звук, обрађује измене привременог завршног дела транскрипта и одлучи када да затражи довршен транскрипт. Те одлуке одређују шта корисници виде и када се логика апликације може ослонити на коначни текст.
- Стриминг модел је у јавној пробној верзији и нема уговор о нивоу услуге. Microsoft не препоручује његову употребу у продукционим системима. Наведени резултати брзине и тачности представљају тврдње из објаве и поређења, а не мерења из овог водича.

## Изаберите начин повезивања

У каталогу услуге [Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) наведен је модел `MAI-Transcribe-2-Streaming`, верзија `2026-08-06`, као пробни модел са звучним улазом и текстуалним излазом. Microsoftов [преглед од 1. октобра](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) описује два начина интеграције: Реалтиме API који користи протокол WebSocket налик OpenAI Реалтиме-у или Azure Speech SDK. Оба враћају међурезултате и коначне резултате препознавања. SDK управља везом и стримингом звука, док Реалтиме пут непосредно приказује догађаје.

За [Реалтиме API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), Microsoft захтева претплату на Azure, ресурс Microsoft Foundry у подржаном региону и објављену инстанцу стриминг модела. Повежите се на `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` помоћу беарер токена Microsoft Entra или API кључа. У документацији се препоручује аутентификација Entra системом. После повезивања пошаљите `session.created`, а затим поруку `session.update` у којој наводите објављену верзију и формат улаза. Подешавање се не може променити након додавања првог звука, чак ни након потврде уноса.

Документовани улаз је сирови моно PCM16 звук са предзнаком и малим редоследом бајтова, фреквенције 16 или 24 кХз, који се шаље у Басе64 сегментима кроз поруке `input_audio_buffer.append`. То су PCM подаци без WAV заглавља. Да би се смањило кашњење, Microsoft препоручује мале сегменте од 10 до 20 милисекунди, уз напомену да већи сегменти смањују оптерећење мреже. У њиховом примеру за Python звук из микрофона чита се у блоковима од 100 мс; савет о малим сегментима и величина блока у примеру представљају различите изборе, а не резултат мерења BIG ЦХАНГЕ-а.

За повезивање преко [Speech СДК-а](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) потребни су SDK в1.52.0, претплата на Azure и ресурс Foundry или Speech. У Microsoftовом примеру за Python, `speech_config.model` се поставља на `MAI-Transcribe-2-Streaming`, звук фреквенције 16 кХз и дубине 16 бита шаље се кроз улазни ток, а апликација ослушкује догађаје `recognizing` и `recognized`. Пример користи постојећу датотеку `audio.pcm` као извор звука за улазни ток; апликација би користила сопствени извор звука. Реч је о документованим интерфејсима и очекиваним врстама догађаја, а не о провери компатибилности налога коју је извршила наша редакција.

## Одвојите привремени текст од потврђеног текста

Семантика догађаја у Реалтиме АПИ-ју важна је за приказ уживо. Догађај `conversation.item.input_audio_transcription.delta` садржи новопотврђени текст, који клијентска апликација додаје у потврђени садржај без промене размака. Догађај `intermediate` садржи цео актуелни привремени завршни део транскрипта. Сваки нови такав део замењује претходни. Екран може да прикаже потврђени садржај заједно са тренутним привременим делом, али би чување сваког међудогађаја у новом реду дуплирало речи док их модел мења.

Клијент шаље поруку `input_audio_buffer.commit` када препозна паузу или на крају снимка. Microsoft наводи да се тиме захтева коначни транскрипт чим буде спреман; порука `input_audio_buffer.committed` потврђује захтев, а `conversation.item.input_audio_transcription.completed` враћа цео коначни текст звука од претходне потврде. [У водичу за Реалтиме API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) наводи се да у конфигурацији сесије овог модела нису доступни утврђивање краја говорне смене на серверској страни ни аутоматска потврда. Зато гласовна апликација мора сама да препозна паузу или границу говорне смене ако жели аутоматски да завршава сегменте. Документација описује уговор о догађајима, али не прописује један универзално прикладан начин за препознавање те границе.

Microsoftов водич ограничава сваку Реалтиме сесију на један сат. Такође наводи да појединачно додавање звука нема потврду пријема и може да произведе нула или више догађаја транскрипта. Програмери који процењују прототип треба да разликују пријем звучних порука од пријема коначног текста и одлуче како ће апликација поступити при прекиду везе. Јавни пример за Python садржи ред за микрофон и обраду грешака, али BIG CHANGE га није покренуо да би утврдио понашање при квару.

## Приступ, региони и цена

Microsoft наводи да се моделу може приступити из целог света, док Azure усмерава захтеве ка регионима у којима се они обрађују. Две странице за интеграцију од 1. октобра наводе различите доступне регионе: у водичу за Реалтиме API наведени су Сwеден Централ, Централ US и Соутх Индиа; у водичу за Speech SDK наведени су Сwеден Централ, Централ US и Соутхеаст Асиа. На обе странице се наводи да ће Еаст US 2 бити доступан накнадно. Проверите актуелне опције за објављивање модела и регион за пут који намеравате да користите; ове странице не дају један доследан списак. Глобални приступ не значи да је обећана обрада података на одређеној локацији.

У објави је наведена уводна цена од **0,54 долара по сату звучног материјала до краја 2026.**. Рачунски, то је 9 долара за 1.000 минута звука, пре посебних услуга или инфраструктуре које апликација користи. Microsoft у својим водичима упућује на странице са ценама Foundry модела и Speech услуге за одговарајуће начине повезивања. У прегледаним изворима нису наведени цена након уводног периода ни стварни рачун, па је при планирању буџета за постављање потребно проверити актуелне цене.

Microsoft наводи да стриминг модел подржава 60 језика уз непрекидно аутоматско препознавање језика. Каже да се први привремени резултат приказује нешто више од 100 мс након пријема звука и позива се на Артифициал Аналyсис за водећи резултат по тачности. [Тест стриминг транскрипције Артифициал Аналyсис-а](https://artificialanalysis.ai/speech-to-text/streaming) мери стопу грешака у речима на око осам сати пондерисаних скупова података и време до привремених и коначних резултата у односу на препознати крај говора. То је тест јасно одређених звучних записа и правила мерења времена, а не гаранција да ће одређена апликација приказати тачне речи за 100 мс. Нисмо независно потврдили тачан пласман који наводи Microsoft јер у јавном тексту теста преузетом за ову причу нисмо пронашли ред са резултатом конкретног модела.

У засебном водичу за Azure Speech модел [MAI-Transcribe-2](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) описују се улазне датотеке и опције, укључујући раздвајање говорника, временске ознаке за сваку реч, давање предности кључним речима и стилове са поштапалицама или без њих. Немојте претпоставити да су те контроле доступне у моделу MAI-Transcribe-2-Streaming: водичи за интеграцију стриминг модела их не описују. Ако су такви резултати потребни производу, пре израде проверите тренутну документацију и спроведите тест или процените модел за датотеке.

## Извори и додатна литература

- [Објава Microsoft АИ-ја](https://microsoft.ai/news/our-first-streaming-transcription-model/), 1. октобар 2026: објава модела и тврдње о броју језика, брзини и уводној цени. Microsoftове тврдње о тачности и интерној брзини приписане су компанији у тексту изнад.
- [Каталог модела Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), проверен 2. октобра: верзија модела, пробна фаза и врсте улаза и излаза; каталог није тест перформанси.
- [Преглед стриминг модела](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Водич за Реалтиме API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) и [Водич за Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), ажурирани 1. октобра: описују два начина интеграције, услове пробне верзије, понашање догађаја, примере и табеле региона. BIG CHANGE није покренуо примере.
- [MAI-Transcribe-2 у Azure Спеецх-у](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), проверено 2. октобра: засебан пут за транскрипцију датотека и документоване контроле. Његов списак функција не описује могућности стриминг модела.
- [Тест стриминг транскрипције Артифициал Аналyсис-а](https://artificialanalysis.ai/speech-to-text/streaming) и [методологија](https://artificialanalysis.ai/methodology/speech-to-text), проверени 2. октобра: дизајн независног теста и дефиниције мерења времена. У јавном тексту који смо преузели није приказан ред са тачним резултатом модела за независну потврду његовог пласмана.

## Sources

- [Први стриминг модел за транскрипцију компаније Microsoft дебитовао је на првом месту Артифициал Аналyсис-а](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Објава Microsoft АИ-ја о представљању модела, подршци за 60 језика, брзини, наводном пласману и уводној цени од 0,54 долара по сату звучног материјала до краја 2026. Тврдње добављача, а не мерења BIG ЦХАНГЕ-а.
- [MAI-Transcribe-2-Streaming | Каталог модела | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — Званични каталог: верзија модела 2026-08-06, пробна фаза, звучни улаз и текстуални излаз. Верзија се разликује од датума објаве.
- [Преглед модела MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — Званични преглед, последњи пут ажуриран 1. октобра: јавна пробна верзија без уговора о нивоу услуге, не препоручује се за продукцију и нуди два начина интеграције.
- [Коришћење модела MAI-Transcribe-2-Streaming уз Реалтиме API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — Званични водич за Реалтиме API, последњи пут ажуриран 1. октобра: објављивање преко Фоундрy-ја, WebSocket, PCM16, семантика догађаја, ручна потврда, сесије од једног сата и списак региона. BIG CHANGE није покренуо пример.
- [Коришћење модела MAI-Transcribe-2-Streaming уз Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — Званични водич за SDK, последњи пут ажуриран 1. октобра: в1.52.0, слање звука и догађаји препознавања. Табела региона разликује се од водича за Реалтиме API. BIG CHANGE није тестирао пример.
- [МАИ-Трансцрибе у Azure Спеецх-у (пробна верзија)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — Одвојен пут за транскрипцију датотека моделом MAI-Transcribe-2 и његове опције. Не потврђује да стриминг модел има исте функције.
- [Ранг-листа и поређење пружалаца услуге претварања говора у текст](https://artificialanalysis.ai/speech-to-text/streaming) — Независни пружалац теста објашњава метрике грешака у речима и кашњења за стриминг. У преузетом јавном тексту није приказан ред са резултатом конкретног модела, па се тачан пласман приписује Microsoftу и није независно потврђен.
- [Методологија тестирања претварања говора у текст](https://artificialanalysis.ai/methodology/speech-to-text) — Методологија за стриминг звука, скупове података, пондерисање и кашњење. Резултати теста не утврђују кашњење или тачност сваке појединачне апликације.
