AI-translated from English; not yet reviewed by a fluent editor.

# Microsoft MAI-Transcribe-2-Streaming: fluxo de transcrição ao vivo e seus limites

> O novo modelo de transcrição em streaming da Microsoft devolve texto provisório e final à medida que o áudio chega. Sua API de prévia também deixa a detecção de turnos e a finalização a cargo do cliente.

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

A Microsoft [anunciou o MAI-Transcribe-2-Streaming em 1º de outubro](https://microsoft.ai/news/our-first-streaming-transcription-model/). O modelo recebe áudio enquanto alguém fala e devolve texto que muda antes de gerar uma transcrição final. Para quem desenvolve um aplicativo de voz com legendas ao vivo ou entrada por fala, a questão útil é como essas atualizações chegam ao aplicativo e quando o texto pode ser considerado definitivo.

Este é um guia de integração baseado na documentação para desenvolvedores que avaliam a prévia pública. A tarefa é decidir se vale a pena prototipar o modelo e identificar o trabalho que o cliente precisa fazer para exibir texto ao vivo e preservar o texto final. A Microsoft documenta a rota e o código de exemplo; a BIG CHANGE não implantou o modelo, executou os exemplos nem mediu sua precisão ou latência.

## A grande mudança

- A Microsoft apresentou um modelo de streaming que devolve texto provisório à medida que o áudio chega e, depois, confirma os trechos da transcrição. O fluxo separado de transcrição de arquivos do MAI-Transcribe-2 processa áudio gravado e documenta um conjunto diferente de opções.
- Um aplicativo que usa a Realtime API precisa enviar áudio formatado corretamente, lidar com revisões do trecho provisório e decidir quando solicitar uma transcrição concluída. Essas escolhas determinam o que as pessoas veem e quando a lógica posterior do aplicativo pode confiar no texto final.
- O modelo de streaming está em prévia pública e não tem contrato de nível de serviço. A Microsoft não o recomenda para cargas de trabalho de produção. As alegações de velocidade e precisão citadas são dados de lançamento e de benchmarks, não medições deste guia.

## Escolha uma forma de conexão

O catálogo do [Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) lista o `MAI-Transcribe-2-Streaming`, versão `2026-08-06`, como modelo em prévia com entrada de áudio e saída de texto. A visão geral da Microsoft de [1º de outubro](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) documenta duas formas de integração: uma Realtime API que usa um protocolo WebSocket semelhante ao OpenAI Realtime ou o Azure Speech SDK. Ambas retornam resultados intermediários e finais de reconhecimento. O SDK gerencia a conexão e o streaming de áudio; a rota Realtime expõe os eventos diretamente.

Para usar a [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), a Microsoft exige uma assinatura do Azure, um recurso do Microsoft Foundry em uma região compatível e uma implantação do modelo de streaming. Conecte-se a `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` usando um token bearer do Microsoft Entra ou uma chave de API. A documentação recomenda a autenticação Entra. Depois de `session.created`, envie `session.update` com o nome da implantação e o formato de entrada definido. Essa configuração não pode ser alterada depois do primeiro envio de áudio, nem mesmo após um commit.

A entrada documentada é PCM16 mono, raw, assinado e little-endian, a 16 ou 24 kHz, enviado como blocos em base64 nas mensagens `input_audio_buffer.append`. Os dados PCM não incluem cabeçalho WAV. A Microsoft recomenda blocos pequenos, como os de 10 a 20 milissegundos, para reduzir a latência, embora observe que blocos maiores diminuem a sobrecarga de rede. O exemplo Python usa blocos de áudio do microfone de 100 ms; a recomendação de blocos pequenos e o tamanho usado no exemplo são escolhas diferentes, não um resultado medido pela BIG CHANGE.

A rota do [Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) requer a versão 1.52.0 do SDK, uma assinatura do Azure e um recurso do Foundry ou do Speech. O exemplo Python da Microsoft define `speech_config.model` como `MAI-Transcribe-2-Streaming`, fornece áudio mono de 16 kHz e 16 bits por meio de um fluxo push e aguarda eventos `recognizing` e `recognized`. O exemplo usa um arquivo `audio.pcm` preexistente para ilustrar o fluxo push; um aplicativo usaria sua própria fonte de áudio. Essas são interfaces documentadas e tipos de eventos esperados, não um teste de compatibilidade de contas feito por esta publicação.

## Mantenha o texto provisório separado do texto confirmado

A semântica dos eventos Realtime importa para uma interface ao vivo. Um evento `conversation.item.input_audio_transcription.delta` contém texto recém-finalizado, que o aplicativo cliente acrescenta ao buffer confirmado sem alterar os espaços. Um evento `intermediate` contém todo o trecho provisório atual. Cada novo trecho substitui o anterior. A tela pode mostrar o buffer confirmado junto com o trecho provisório atual, mas armazenar cada evento intermediário como uma linha nova duplicaria as palavras à medida que o modelo revisa o texto.

O cliente envia `input_audio_buffer.commit` em uma pausa que detectou ou no fim de uma gravação. Segundo a Microsoft, isso solicita uma transcrição final assim que possível; `input_audio_buffer.committed` confirma o commit, e `conversation.item.input_audio_transcription.completed` fornece o texto final completo do áudio recebido desde o commit anterior. O [guia Realtime](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) diz que a detecção de turnos no servidor e o commit automático não estão disponíveis na configuração de sessão deste modelo. Portanto, se um aplicativo de voz quiser finalizar os segmentos automaticamente, precisará detectar suas próprias pausas ou limites entre turnos. A documentação descreve o contrato dos eventos; não determina um detector de limites universalmente adequado.

A Microsoft limita cada sessão Realtime a uma hora. Também informa que um envio de áudio não recebe confirmação individual e pode produzir zero ou vários eventos de transcrição. Ao avaliar um protótipo, os desenvolvedores devem distinguir o recebimento de mensagens de áudio do recebimento de texto finalizado e decidir como o aplicativo lidará com uma sessão desconectada. O exemplo Python do guia público inclui uma fila de microfone e tratamento de erros, mas a BIG CHANGE não o executou para observar como as falhas se comportam.

## Acesso, regiões e preço

Segundo a Microsoft, o modelo pode ser acessado globalmente, com o Azure encaminhando as solicitações a regiões de atendimento. As duas páginas de integração de 1º de outubro listam regiões disponíveis diferentes: o guia Realtime cita Suécia Central, EUA Central e Sul da Índia; o guia do Speech SDK cita Suécia Central, EUA Central e Sudeste Asiático. Ambos indicam o Leste dos EUA 2 como disponibilidade futura. Confira as opções atuais de implantação e região para a rota pretendida; essas páginas não fornecem uma lista única e consistente. O acesso global não deve ser interpretado como garantia de uma localização específica para o processamento.

O anúncio cita um preço introdutório de **US$ 0,54 por hora de áudio até o fim de 2026**. Por cálculo, isso equivale a US$ 9 por 1.000 minutos de áudio, antes de eventuais serviços ou infraestrutura adicionais usados pelo aplicativo. A Microsoft direciona os leitores de seus guias às páginas de preços do Foundry Models e do Speech para cada rota. As fontes consultadas não informam a tarifa após o período introdutório nem uma fatura medida; o orçamento para implantação exige verificar os preços atuais.

Segundo a Microsoft, o modelo de streaming oferece suporte a 60 idiomas com detecção automática contínua. A empresa diz que o primeiro resultado parcial aparece pouco mais de 100 ms após receber o áudio e cita a Artificial Analysis para sustentar uma posição de liderança em precisão. [O benchmark de streaming da Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) mede a taxa de erro de palavras em cerca de oito horas de conjuntos de dados ponderados e registra os tempos dos resultados parciais e finais em relação ao fim da fala detectado. Trata-se de um benchmark com regras específicas de áudio e cronometragem, não de uma garantia de que um aplicativo em particular exibirá as palavras corretas em 100 ms. Não verificamos de forma independente a posição exata atribuída pela Microsoft: o texto público do benchmark consultado não expôs uma linha de resultados específica para esse modelo.

O guia separado do [MAI-Transcribe-2 no Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) documenta entrada de arquivos e opções como diarização de locutores, marcas de tempo por palavra, viés para palavras-chave e estilos limpo ou literal. Não presuma que esses controles funcionem no MAI-Transcribe-2-Streaming: os guias de integração de streaming não os documentam. Se um produto precisar dessas saídas, avalie o modelo de arquivos ou confirme o suporte no streaming com a documentação atual e um teste antes de desenvolver a solução em torno deles.

## Fontes e leituras complementares

- [Anúncio da Microsoft sobre IA](https://microsoft.ai/news/our-first-streaming-transcription-model/), de 1º de outubro de 2026: lançamento, idiomas, alegações de velocidade e preço introdutório. As alegações de precisão e velocidade interna da própria Microsoft são atribuídas acima.
- [Catálogo de modelos do Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), consultado em 2 de outubro: versão do modelo, estágio de prévia e tipos de entrada e saída; o catálogo não é um teste de desempenho.
- [Visão geral do streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [guia da Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) e [guia do Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), atualizados em 1º de outubro: as duas rotas de integração documentadas, os termos da prévia, o comportamento dos eventos, os exemplos e as tabelas de regiões. A BIG CHANGE não executou os exemplos.
- [MAI-Transcribe-2 no Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), consultado em 2 de outubro: o fluxo separado de transcrição de arquivos e os controles documentados. A lista de recursos do modelo de arquivos não comprova que os mesmos recursos existam no streaming.
- [Benchmark de streaming da Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) e [metodologia](https://artificialanalysis.ai/methodology/speech-to-text), consultados em 2 de outubro: desenho do benchmark independente e definições de cronometragem. O texto público recuperado não exibiu a linha de resultado precisa do modelo para confirmar a posição de forma independente.

## Sources

- [Our first streaming transcription model debuts at no. 1 on Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Anúncio da Microsoft sobre IA. Alegações de suporte a 60 idiomas, velocidade, posição no ranking e preço introdutório de US$ 0,54 por hora de áudio até 2026. Alegações do fornecedor, não medições da BIG CHANGE.
- [MAI-Transcribe-2-Streaming | Catálogo de modelos | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — Catálogo oficial: versão 2026-08-06, estágio de prévia, entrada de áudio e saída de texto. A versão não é a data do anúncio.
- [Visão geral do MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — Visão geral oficial atualizada em 1º de outubro: prévia pública sem contrato de nível de serviço, não recomendada para produção, com duas rotas de integração.
- [Usar o MAI-Transcribe-2-Streaming com a Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — Guia oficial Realtime atualizado em 1º de outubro: implantação no Foundry, WebSocket, PCM16, semântica dos eventos, commit manual, sessões de uma hora e lista de regiões. A BIG CHANGE não executou o exemplo.
- [Usar o MAI-Transcribe-2-Streaming com o Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — Guia oficial do SDK atualizado em 1º de outubro: v1.52.0, áudio push e eventos de reconhecimento. A tabela de regiões difere do guia Realtime. O exemplo não foi testado.
- [MAI-Transcribe no Azure Speech (prévia)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — Fluxo separado do MAI-Transcribe-2 para arquivos e suas opções. Não demonstra paridade de recursos com o streaming.
- [Speech to Text Providers Leaderboard & Comparison](https://artificialanalysis.ai/speech-to-text/streaming) — O operador do benchmark independente explica as métricas de WER e latência em streaming. O texto público consultado não exibiu uma linha específica para o modelo; portanto, a posição exata é atribuída à Microsoft, não confirmada de forma independente.
- [Speech to Text Benchmarking Methodology](https://artificialanalysis.ai/methodology/speech-to-text) — Metodologia de benchmark para áudio em streaming, conjuntos de dados, ponderação e latência. Os benchmarks não determinam a latência ou a precisão em cada aplicativo.
