Microsoft је 1. октобра најавио модел MAI-Transcribe-2-Streaming. Прима звук док особа говори и приказује текст који се мења, а затим и коначни транскрипт. За програмера који гласовној апликацији додаје титлове уживо или гласовни унос, важно је како те измене стижу до апликације и када се текст може сматрати коначним.

Овај водич за интеграцију заснива се на документацији и намењен је програмерима који процењују јавну пробну верзију. Циљ је да одлуче да ли да направе прототип са овим моделом и утврде које послове клијентска апликација мора да обави да би приказивала текст уживо и сачувала коначни транскрипт. Microsoft описује начин повезивања и пример кода; BIG CHANGE није поставио модел, покренуо примере нити мерио тачност или кашњење.

Суштинска промена

  • Microsoft је представио стриминг модел који приказује привремени текст док звук пристиже, а затим потврђује сегменте транскрипта. Одвојени пут за транскрипцију датотека MAI-Transcribe-2 обрађује снимљени звук и има другачији скуп документованих опција.
  • Апликација која користи Реалтиме API мора да шаље правилно форматиран звук, обрађује измене привременог завршног дела транскрипта и одлучи када да затражи довршен транскрипт. Те одлуке одређују шта корисници виде и када се логика апликације може ослонити на коначни текст.
  • Стриминг модел је у јавној пробној верзији и нема уговор о нивоу услуге. Microsoft не препоручује његову употребу у продукционим системима. Наведени резултати брзине и тачности представљају тврдње из објаве и поређења, а не мерења из овог водича.

Изаберите начин повезивања

У каталогу услуге Microsoft Foundry наведен је модел MAI-Transcribe-2-Streaming, верзија 2026-08-06, као пробни модел са звучним улазом и текстуалним излазом. Microsoftов преглед од 1. октобра описује два начина интеграције: Реалтиме API који користи протокол WebSocket налик OpenAI Реалтиме-у или Azure Speech SDK. Оба враћају међурезултате и коначне резултате препознавања. SDK управља везом и стримингом звука, док Реалтиме пут непосредно приказује догађаје.

За Реалтиме API, Microsoft захтева претплату на Azure, ресурс Microsoft Foundry у подржаном региону и објављену инстанцу стриминг модела. Повежите се на wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription помоћу беарер токена Microsoft Entra или API кључа. У документацији се препоручује аутентификација Entra системом. После повезивања пошаљите session.created, а затим поруку session.update у којој наводите објављену верзију и формат улаза. Подешавање се не може променити након додавања првог звука, чак ни након потврде уноса.

Документовани улаз је сирови моно PCM16 звук са предзнаком и малим редоследом бајтова, фреквенције 16 или 24 кХз, који се шаље у Басе64 сегментима кроз поруке input_audio_buffer.append. То су PCM подаци без WAV заглавља. Да би се смањило кашњење, Microsoft препоручује мале сегменте од 10 до 20 милисекунди, уз напомену да већи сегменти смањују оптерећење мреже. У њиховом примеру за Python звук из микрофона чита се у блоковима од 100 мс; савет о малим сегментима и величина блока у примеру представљају различите изборе, а не резултат мерења BIG ЦХАНГЕ-а.

За повезивање преко Speech СДК-а потребни су SDK в1.52.0, претплата на Azure и ресурс Foundry или Speech. У Microsoftовом примеру за Python, speech_config.model се поставља на MAI-Transcribe-2-Streaming, звук фреквенције 16 кХз и дубине 16 бита шаље се кроз улазни ток, а апликација ослушкује догађаје recognizing и recognized. Пример користи постојећу датотеку audio.pcm као извор звука за улазни ток; апликација би користила сопствени извор звука. Реч је о документованим интерфејсима и очекиваним врстама догађаја, а не о провери компатибилности налога коју је извршила наша редакција.

Одвојите привремени текст од потврђеног текста

Семантика догађаја у Реалтиме АПИ-ју важна је за приказ уживо. Догађај conversation.item.input_audio_transcription.delta садржи новопотврђени текст, који клијентска апликација додаје у потврђени садржај без промене размака. Догађај intermediate садржи цео актуелни привремени завршни део транскрипта. Сваки нови такав део замењује претходни. Екран може да прикаже потврђени садржај заједно са тренутним привременим делом, али би чување сваког међудогађаја у новом реду дуплирало речи док их модел мења.

Клијент шаље поруку input_audio_buffer.commit када препозна паузу или на крају снимка. Microsoft наводи да се тиме захтева коначни транскрипт чим буде спреман; порука input_audio_buffer.committed потврђује захтев, а conversation.item.input_audio_transcription.completed враћа цео коначни текст звука од претходне потврде. У водичу за Реалтиме API наводи се да у конфигурацији сесије овог модела нису доступни утврђивање краја говорне смене на серверској страни ни аутоматска потврда. Зато гласовна апликација мора сама да препозна паузу или границу говорне смене ако жели аутоматски да завршава сегменте. Документација описује уговор о догађајима, али не прописује један универзално прикладан начин за препознавање те границе.

Microsoftов водич ограничава сваку Реалтиме сесију на један сат. Такође наводи да појединачно додавање звука нема потврду пријема и може да произведе нула или више догађаја транскрипта. Програмери који процењују прототип треба да разликују пријем звучних порука од пријема коначног текста и одлуче како ће апликација поступити при прекиду везе. Јавни пример за Python садржи ред за микрофон и обраду грешака, али BIG CHANGE га није покренуо да би утврдио понашање при квару.

Приступ, региони и цена

Microsoft наводи да се моделу може приступити из целог света, док Azure усмерава захтеве ка регионима у којима се они обрађују. Две странице за интеграцију од 1. октобра наводе различите доступне регионе: у водичу за Реалтиме API наведени су Сwеден Централ, Централ US и Соутх Индиа; у водичу за Speech SDK наведени су Сwеден Централ, Централ US и Соутхеаст Асиа. На обе странице се наводи да ће Еаст US 2 бити доступан накнадно. Проверите актуелне опције за објављивање модела и регион за пут који намеравате да користите; ове странице не дају један доследан списак. Глобални приступ не значи да је обећана обрада података на одређеној локацији.

У објави је наведена уводна цена од 0,54 долара по сату звучног материјала до краја 2026.. Рачунски, то је 9 долара за 1.000 минута звука, пре посебних услуга или инфраструктуре које апликација користи. Microsoft у својим водичима упућује на странице са ценама Foundry модела и Speech услуге за одговарајуће начине повезивања. У прегледаним изворима нису наведени цена након уводног периода ни стварни рачун, па је при планирању буџета за постављање потребно проверити актуелне цене.

Microsoft наводи да стриминг модел подржава 60 језика уз непрекидно аутоматско препознавање језика. Каже да се први привремени резултат приказује нешто више од 100 мс након пријема звука и позива се на Артифициал Аналyсис за водећи резултат по тачности. Тест стриминг транскрипције Артифициал Аналyсис-а мери стопу грешака у речима на око осам сати пондерисаних скупова података и време до привремених и коначних резултата у односу на препознати крај говора. То је тест јасно одређених звучних записа и правила мерења времена, а не гаранција да ће одређена апликација приказати тачне речи за 100 мс. Нисмо независно потврдили тачан пласман који наводи Microsoft јер у јавном тексту теста преузетом за ову причу нисмо пронашли ред са резултатом конкретног модела.

У засебном водичу за Azure Speech модел MAI-Transcribe-2 описују се улазне датотеке и опције, укључујући раздвајање говорника, временске ознаке за сваку реч, давање предности кључним речима и стилове са поштапалицама или без њих. Немојте претпоставити да су те контроле доступне у моделу MAI-Transcribe-2-Streaming: водичи за интеграцију стриминг модела их не описују. Ако су такви резултати потребни производу, пре израде проверите тренутну документацију и спроведите тест или процените модел за датотеке.

Извори и додатна литература

  • Објава Microsoft АИ-ја, 1. октобар 2026: објава модела и тврдње о броју језика, брзини и уводној цени. Microsoftове тврдње о тачности и интерној брзини приписане су компанији у тексту изнад.
  • Каталог модела Microsoft Foundry, проверен 2. октобра: верзија модела, пробна фаза и врсте улаза и излаза; каталог није тест перформанси.
  • Преглед стриминг модела, Водич за Реалтиме API и Водич за Speech SDK, ажурирани 1. октобра: описују два начина интеграције, услове пробне верзије, понашање догађаја, примере и табеле региона. BIG CHANGE није покренуо примере.
  • MAI-Transcribe-2 у Azure Спеецх-у, проверено 2. октобра: засебан пут за транскрипцију датотека и документоване контроле. Његов списак функција не описује могућности стриминг модела.
  • Тест стриминг транскрипције Артифициал Аналyсис-а и методологија, проверени 2. октобра: дизајн независног теста и дефиниције мерења времена. У јавном тексту који смо преузели није приказан ред са тачним резултатом модела за независну потврду његовог пласмана.