Microsoftは10月1日に MAI-Transcribe-2-Streamingを発表した。このモデルは話者が話している最中に音声を受け取り、最終的な文字起こしの前に更新されるテキストを返す。ライブ字幕や音声入力をアプリに追加する開発者にとって、重要なのは更新をアプリがどのように受け取り、いつ確定済みとして扱えるかだ。
これは公開プレビューを評価する開発者向けに、ドキュメントに基づいて統合方法を説明する記事だ。モデルを試作に使うかどうかを判断し、ライブテキストの表示と確定テキストの保存に必要なクライアント側の作業を把握することが目的である。Microsoftは接続方法とサンプルコードを公開しているが、BIG CHANGEはモデルを導入・実行しておらず、精度や遅延も測定していない。
大きな変化
- Microsoftは、音声の到着に合わせて暫定テキストを返し、その後、文字起こしの各区間を確定するストリーミングモデルを公開した。別のMAI-Transcribe-2ファイル文字起こし経路は、録音済み音声を対象とし、異なるオプションを提供する。
- Realtime APIを使うアプリは、正しい形式の音声を送り、暫定テキスト末尾の修正を処理し、確定した文字起こしをいつ要求するか判断する必要がある。こうした選択によって、利用者に表示される内容と、後続のアプリ処理が確定テキストをいつ信頼できるかが決まる。
- ストリーミングモデルはサービスレベル契約のない公開プレビューであり、Microsoftは本番環境での利用を推奨していない。公表された速度と精度は、発表時およびベンチマークの主張であって、この記事で測定した結果ではない。
接続方法を選ぶ
Microsoft Foundryの モデルカタログ には MAI-Transcribe-2-Streaming、モデルバージョン 2026-08-06のプレビューモデルとして、音声入力とテキスト出力に対応している。Microsoftの 10月1日の概要 は、OpenAI Realtimeに似たWebSocketプロトコルを使うRealtime APIと、Azure Speech SDKという2つの統合方法を説明している。どちらも中間認識結果と最終認識結果を返す。SDKは接続と音声ストリーミングを管理する一方、Realtime経路ではイベントを直接扱う。
次の接続方法として、 Realtime APIではAzureサブスクリプション、対応リージョンのMicrosoft Foundryリソース、ストリーミングモデルのデプロイが必要だ。接続先は wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription で、Microsoft EntraのベアラートークンまたはAPIキーを使う。ドキュメントではEntra認証を推奨している。 session.createdを受信したら、 session.update を送信し、デプロイ名と入力形式を指定する。この設定は最初の音声追加後に変更できず、commit後も同様だ。
ドキュメントに記載された入力は、16 kHzまたは24 kHzのモノラルPCM16(符号付きリトルエンディアン)の生音声で、base64形式のチャンクとして input_audio_buffer.append メッセージで送る。WAVヘッダーのないPCMデータを使う。Microsoftは遅延を抑えるため10〜20ミリ秒程度の小さなチャンクを推奨する一方、大きなチャンクはネットワーク負荷を減らすとしている。Pythonの例ではマイク音声を100ミリ秒単位で読み込む。この推奨とサンプルのブロックサイズは異なる選択肢であり、BIG CHANGEが測定した結果ではない。
また、 Speech SDK の利用にはv1.52.0、Azureサブスクリプション、FoundryまたはSpeechリソースが必要だ。MicrosoftのPythonサンプルは speech_config.model を MAI-Transcribe-2-Streamingに設定し、16 kHz、16ビットのモノラル音声をプッシュストリームで渡し、 recognizing と recognized イベントを待ち受ける。サンプルでは既存の audio.pcm ファイルを使ってプッシュストリームを説明している。アプリでは独自の音声入力を用意する。これらはドキュメントに記載されたインターフェースと想定イベントであり、BIG CHANGEがアカウント単位の互換性を検証したものではない。
暫定テキストと確定テキストを分ける
Realtimeのイベントの意味はライブ画面の実装で重要になる。 conversation.item.input_audio_transcription.delta イベントには新たに確定したテキストが含まれ、クライアントアプリは空白を変えずに確定済みバッファーへ追記する。次の intermediate イベントには現在の暫定テキストの末尾全体が含まれ、届くたびに前の末尾を置き換える。画面には確定済みバッファーと現在の末尾を合わせて表示できるが、途中のイベントをすべて別行として保存すると、モデルが修正した単語が重複する。
クライアントは input_audio_buffer.commit を検出した無音時または録音終了時に送る。Microsoftによると、これは可能な限り速やかに最終文字起こしを要求する。次に input_audio_buffer.committed がcommitを確認し、 conversation.item.input_audio_transcription.completed は直前のcommit以降の音声に対する最終テキストを返す。この Realtimeガイド によれば、このモデルのセッション設定ではサーバー側のターン検出と自動commitは利用できない。そのため、音声アプリが区間を自動的に確定したい場合は、独自に無音や発話ターンの境界を検出する必要がある。ドキュメントはイベント仕様を説明しているが、あらゆる用途に適した境界検出方法を一つ示しているわけではない。
MicrosoftのガイドではRealtimeの1セッションは最大1時間とされる。音声追加ごとの個別確認応答はなく、一度の追加から文字起こしイベントが0件の場合も複数件の場合もある。試作を評価する開発者は、音声メッセージの受信と確定テキストの受信を区別し、切断されたセッションをどう扱うか決める必要がある。公開ガイドのPython例にはマイク入力キューとエラー処理が含まれるが、BIG CHANGEは実行して障害時の挙動を確認していない。
利用条件、リージョン、料金
Microsoftによると、このモデルには世界各地からアクセスでき、Azureがリクエストを提供リージョンへルーティングする。10月1日付の2つの統合ガイドでは、利用可能なリージョン一覧が異なる。Realtimeガイドはスウェーデン中部、米国中部、南インドを挙げ、Speech SDKガイドはスウェーデン中部、米国中部、東南アジアを挙げる。どちらも東米国2を近日提供予定としている。利用する経路の現在のデプロイ先とリージョン選択肢を確認する必要がある。これらのページには一貫した単一の一覧がない。「世界各地からアクセス可能」は、特定の処理場所を保証するものではない。
Microsoftの発表によると、導入価格は2026年末まで音声1時間当たり 0.54ドル。算術上は音声1,000分当たり9ドルで、別サービスやアプリのインフラ費用は含まれない。Microsoftは各経路のガイドからFoundry ModelsとSpeechサービスの料金ページを案内している。確認した資料には導入価格終了後の料金も実際の請求額もない。デプロイ予算の策定時には最新価格を確認する必要がある。
Microsoftは、このモデルが連続的な自動検出により60言語に対応するとしている。また、音声受信から最初の暫定テキストが現れるまで100ミリ秒強と説明し、Artificial Analysisを根拠に精度が首位だとしている。 Artificial Analysisのストリーミングベンチマーク は、加重データセット約8時間分の単語誤り率を測定し、検出された発話終了からの時間を基準に暫定・確定結果を計測する。これは定められた音声と時間計測ルールに基づくベンチマークであり、どのアプリでも100ミリ秒で正しい単語が表示されると保証するものではない。本記事の調査で取得した公開本文からはモデル別の結果行を確認できず、Microsoftが述べる正確な順位を独立に検証していない。
別の MAI-Transcribe-2 Azure Speechガイド では、ファイル入力に加えて、話者ダイアライゼーション、単語単位のタイムスタンプ、キーワードによるバイアス指定、クリーンまたは逐語的なスタイルなどのオプションが説明されている。ストリーミング版でも使えるとは限らない。ストリーミング統合ガイドにはこれらの機能が記載されていないため、その出力が必要な製品ではファイル用モデルを評価するか、実装前に最新ドキュメントとテストでストリーミング版の対応を確認する。
出典・参考資料
- Microsoft AIの発表(2026年10月1日)。公開、対応言語、速度、導入価格に関する主張を説明している。精度と社内測定の速度はMicrosoft自身の主張として本文で明記した。
- Microsoft Foundryモデルカタログ(10月2日確認)。モデルのバージョン、プレビュー段階、入出力形式を確認できる。性能試験ではない。
- ストリーミングの概要、 Realtime APIガイド 、 Speech SDKガイド(10月1日更新)。2つの統合経路、プレビュー条件、イベントの動作、サンプル、リージョン表を説明している。BIG CHANGEはサンプルを実行していない。
- Azure SpeechのMAI-Transcribe-2(10月2日確認)。別系統のファイル文字起こし経路と、そこで利用できる機能を説明している。機能一覧はストリーミング版の機能一覧ではない。
- Artificial Analysisのストリーミングベンチマーク と 方法論(10月2日確認)。独立ベンチマークの設計と時間計測の定義を説明している。取得した公開本文にはモデル別の正確な結果行がなく、順位を独立に確認できなかった。



