DUNIA TERUS BERGERAK.RSS
BIG CHANGE.

Edisi Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# MAI-Transcribe-2-Streaming dari Microsoft: jalur transkripsi langsung dan batasannya

> Model transkripsi streaming baru Microsoft mengembalikan teks sementara dan final saat audio masuk. API pratinjaunya juga menyerahkan deteksi giliran bicara dan finalisasi kepada klien.

By BIG CHANGE Editorial

Published: 2026-10-02T18:45:00.209Z
Updated: 2026-10-02T18:45:00.209Z
Canonical: https://bigchange.ai/blog/microsoft-mai-transcribe-2-streaming-integration

![Conceptual illustration of a microphone beside a tablet; a teal waveform leads to a faint provisional line of marks above a crisp final line.](https://bigchange.ai/api/media/file/mai-transcribe-streaming-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Microsoft [mengumumkan MAI-Transcribe-2-Streaming pada 1 Oktober](https://microsoft.ai/news/our-first-streaming-transcription-model/). Model ini menerima audio saat seseorang berbicara dan mengembalikan teks yang terus berubah sebelum menghasilkan transkrip final. Bagi pengembang yang menambahkan takarir langsung atau input suara ke aplikasi suara, pertanyaan pentingnya adalah bagaimana pembaruan itu sampai ke aplikasi dan kapan teks dapat dianggap final.

Ini adalah penjelasan integrasi berbasis dokumentasi bagi pengembang yang mengevaluasi pratinjau publik. Tujuannya adalah menentukan apakah model layak dibuatkan prototipe dan mengidentifikasi pekerjaan klien yang diperlukan untuk menampilkan teks langsung serta menyimpan teks final. Microsoft mendokumentasikan rute dan kode contoh; BIG CHANGE belum menerapkan model ini, menjalankan contoh, atau mengukur akurasi maupun latensinya.

## Perubahan besar

- Microsoft memperkenalkan model streaming yang mengembalikan teks sementara saat audio masuk, lalu mengonfirmasi segmen transkrip. Jalur transkripsi file MAI-Transcribe-2 yang terpisah menangani audio rekaman dan mendokumentasikan rangkaian opsi yang berbeda.
- Aplikasi yang menggunakan Realtime API harus mengirim audio dengan format yang benar, menangani revisi pada akhiran sementara, dan menentukan kapan meminta transkrip selesai. Pilihan tersebut menentukan apa yang dilihat pengguna dan kapan logika aplikasi selanjutnya dapat mengandalkan teks final.
- Model streaming ini masih berupa pratinjau publik tanpa perjanjian tingkat layanan. Microsoft tidak merekomendasikannya untuk beban kerja produksi. Klaim kecepatan dan akurasi yang dikutip berasal dari peluncuran dan benchmark, bukan pengukuran dalam panduan ini.

## Pilih jalur koneksi

Katalog [Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) mencantumkan `MAI-Transcribe-2-Streaming`, versi `2026-08-06`, sebagai model pratinjau dengan input audio dan output teks. [Ikhtisar 1 Oktober dari Microsoft](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) mendokumentasikan dua cara integrasi: Realtime API yang menggunakan protokol WebSocket mirip OpenAI Realtime, atau Azure Speech SDK. Keduanya mengembalikan hasil pengenalan sementara dan final. SDK mengelola koneksi dan streaming audio; rute Realtime mengekspos event secara langsung.

Untuk [Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime), Microsoft mensyaratkan langganan Azure, sumber daya Microsoft Foundry di wilayah yang didukung, dan deployment model streaming. Sambungkan ke `wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription` menggunakan token bearer Microsoft Entra atau kunci API. Dokumentasi menyarankan autentikasi Entra. Setelah `session.created`, kirim `session.update` dengan nama deployment Anda dan tetapkan format input. Pengaturan ini tidak dapat diubah setelah penambahan audio pertama, bahkan setelah commit.

Input yang didokumentasikan adalah PCM16 mentah bertanda, little-endian, mono pada 16 atau 24 kHz, dikirim sebagai potongan base64 dalam pesan `input_audio_buffer.append` pesan. Data tersebut berupa PCM tanpa header WAV. Microsoft menyarankan potongan kecil, misalnya 10 hingga 20 milidetik, untuk mengurangi latensi, sambil mencatat bahwa potongan lebih besar mengurangi overhead jaringan. Contoh Python-nya membaca audio mikrofon dalam blok 100 ms; saran potongan kecil pada halaman dan ukuran blok contoh adalah pilihan yang berbeda, bukan hasil pengukuran BIG CHANGE.

Rute [Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) memerlukan SDK v1.52.0, langganan Azure, serta sumber daya Foundry atau Speech. Contoh Python Microsoft menetapkan `speech_config.model` menjadi `MAI-Transcribe-2-Streaming`, menyediakan audio mono 16 kHz dan 16-bit melalui push stream, lalu mendengarkan event `recognizing` dan `recognized`. Contoh tersebut menggunakan berkas `audio.pcm` yang sudah ada untuk menjelaskan push stream; aplikasi akan memasok sumber audionya sendiri. Ini adalah antarmuka dan jenis event yang didokumentasikan, bukan pengujian kompatibilitas tingkat akun oleh publikasi ini.

## Pisahkan teks sementara dari teks yang sudah dikonfirmasi

Semantik event Realtime penting bagi antarmuka langsung. Event `conversation.item.input_audio_transcription.delta` memuat teks baru yang telah difinalisasi, yang ditambahkan aplikasi klien ke buffer terkonfirmasi tanpa mengubah spasi. Event `intermediate` memuat seluruh akhiran sementara saat ini. Setiap akhiran baru menggantikan akhiran sebelumnya. Layar dapat menampilkan buffer terkonfirmasi ditambah akhiran saat ini, tetapi menyimpan setiap event sementara sebagai baris baru akan menggandakan kata saat model merevisinya.

Klien mengirim `input_audio_buffer.commit` saat jeda yang terdeteksi atau di akhir rekaman. Menurut Microsoft, ini meminta transkrip final sesegera mungkin; `input_audio_buffer.committed` mengonfirmasi commit, dan `conversation.item.input_audio_transcription.completed` memberikan seluruh teks final untuk audio sejak commit sebelumnya. [Panduan Realtime](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) menyebut deteksi giliran di server dan commit otomatis tidak tersedia untuk konfigurasi sesi model ini. Karena itu, aplikasi suara memerlukan batas jeda atau giliran sendiri jika ingin menyelesaikan segmen secara otomatis. Dokumentasi menjelaskan kontrak event; panduan itu tidak menetapkan satu pendeteksi batas yang cocok untuk semua kebutuhan.

Panduan Microsoft membatasi setiap sesi Realtime hingga satu jam. Panduan itu juga menyebut penambahan audio tidak memiliki konfirmasi individual dan dapat menghasilkan nol atau beberapa event transkrip. Pengembang yang mengevaluasi prototipe perlu membedakan penerimaan pesan audio dari penerimaan teks final, serta menentukan cara aplikasi menangani sesi yang terputus. Contoh Python pada panduan publik mencakup antrean mikrofon dan penanganan error, tetapi BIG CHANGE belum menjalankannya untuk memastikan perilaku kegagalan yang teramati.

## Akses, wilayah, dan harga

Microsoft menyatakan model ini dapat diakses secara global, dengan Azure merutekan permintaan ke wilayah penyedia layanan. Dua halaman integrasi 1 Oktober mencantumkan wilayah tersedia yang berbeda: panduan Realtime menyebut Sweden Central, Central US, dan South India; panduan Speech SDK menyebut Sweden Central, Central US, dan Southeast Asia. Keduanya mencantumkan East US 2 sebagai wilayah yang akan segera tersedia. Periksa opsi deployment dan wilayah terkini untuk rute yang hendak digunakan; halaman-halaman ini tidak memberikan satu daftar yang konsisten. Akses global tidak berarti jaminan lokasi pemrosesan tertentu.

Pengumuman Microsoft mengutip harga pengantar sebesar **$0,54 per jam audio hingga akhir 2026**. Dengan perhitungan aritmetis, itu setara dengan $9 per 1.000 menit audio, sebelum biaya layanan atau infrastruktur lain yang digunakan aplikasi. Dari panduannya, Microsoft menautkan halaman harga Foundry Models dan layanan Speech untuk masing-masing rute. Sumber yang ditinjau tidak mencantumkan tarif setelah masa pengantar atau tagihan hasil pengujian, sehingga anggaran deployment perlu didasarkan pada pemeriksaan harga terkini.

Microsoft menyatakan model streaming ini mendukung 60 bahasa dengan deteksi otomatis berkelanjutan. Microsoft mengatakan hasil parsial pertama muncul sedikit di atas 100 ms setelah audio diterima, dan mengutip Artificial Analysis untuk klaim posisi teratas dalam akurasi. [Benchmark streaming Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) mengukur tingkat kesalahan kata pada sekitar delapan jam dataset berbobot dan menghitung waktu hasil parsial serta final relatif terhadap akhir ucapan yang terdeteksi. Itu adalah benchmark dengan aturan audio dan waktu tertentu, bukan jaminan bahwa aplikasi tertentu akan menampilkan kata yang benar dalam 100 ms. Kami tidak memverifikasi secara independen peringkat persis yang diklaim Microsoft melalui baris hasil khusus model dalam teks benchmark publik yang diperoleh untuk artikel ini.

Panduan [MAI-Transcribe-2 untuk Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) yang terpisah mendokumentasikan input file dan opsi seperti diarization pembicara, cap waktu tingkat kata, penyesuaian kata kunci, serta gaya bersih atau verbatim. Jangan berasumsi bahwa kontrol tersebut berfungsi pada MAI-Transcribe-2-Streaming: panduan integrasi streaming tidak mendokumentasikannya. Jika produk memerlukan keluaran itu, evaluasi model file atau pastikan dukungan streaming melalui dokumentasi terkini dan pengujian sebelum menjadikannya dasar pengembangan.

## Sumber & bacaan lebih lanjut

- [Pengumuman Microsoft AI](https://microsoft.ai/news/our-first-streaming-transcription-model/), 1 Oktober 2026: klaim peluncuran, bahasa, kecepatan, dan harga pengantar. Klaim Microsoft sendiri mengenai akurasi dan kecepatan internal diatribusikan di atas.
- [Katalog model Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft), diperiksa 2 Oktober: versi model, tahap pratinjau, serta jenis input/output; katalog ini bukan pengujian kinerja.
- [Ikhtisar streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming), [Panduan Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) dan [Panduan Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk), diperbarui 1 Oktober: dua jalur integrasi yang didokumentasikan, ketentuan pratinjau, perilaku event, contoh, dan tabel wilayah. BIG CHANGE belum menjalankan contoh-contohnya.
- [MAI-Transcribe-2 di Azure Speech](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe), diperiksa 2 Oktober: jalur transkripsi file yang berbeda dan kontrol yang didokumentasikan. Daftar fiturnya tidak menunjukkan fitur streaming.
- [Benchmark streaming Artificial Analysis](https://artificialanalysis.ai/speech-to-text/streaming) dan [metodologi](https://artificialanalysis.ai/methodology/speech-to-text), diperiksa 2 Oktober: rancangan benchmark independen dan definisi waktu. Teks publik yang diperoleh tidak menampilkan baris hasil model ini untuk mengonfirmasi peringkat secara independen.

## Sources

- [Pengumuman Microsoft AI: Model transkripsi streaming pertama kami debut di posisi No. 1 pada Artificial Analysis](https://microsoft.ai/news/our-first-streaming-transcription-model/) — Pengumuman peluncuran Microsoft AI; klaim dukungan 60 bahasa dan kecepatan, pernyataan peringkat, serta harga pengantar $0,54 per jam audio hingga 2026. Klaim vendor, bukan pengukuran BIG CHANGE.
- [MAI-Transcribe-2-Streaming | Katalog Model | Microsoft Foundry](https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft) — Katalog resmi: versi model 2026-08-06, siklus pratinjau, input audio, dan output teks. Versi berbeda dari tanggal pengumuman.
- [Ikhtisar MAI-Transcribe-2-Streaming](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming) — Ikhtisar resmi terakhir diperbarui 1 Oktober: pratinjau publik tanpa SLA, tidak direkomendasikan untuk produksi, serta dua rute integrasi.
- [Menggunakan MAI-Transcribe-2-Streaming dengan Realtime API](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime) — Panduan Realtime resmi terakhir diperbarui 1 Oktober: deployment Foundry, WebSocket, PCM16, semantik event, commit manual, sesi satu jam, dan daftar wilayah. Contoh tidak dijalankan oleh BIG CHANGE.
- [Menggunakan MAI-Transcribe-2-Streaming dengan Azure Speech SDK](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-speech-sdk) — Panduan SDK resmi terakhir diperbarui 1 Oktober: v1.52.0, audio push, dan event pengenalan. Tabel wilayahnya berbeda dari panduan Realtime. Contoh belum diuji oleh BIG CHANGE.
- [MAI-Transcribe di Azure Speech (pratinjau)](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe) — Jalur file MAI-Transcribe-2 yang terpisah dan opsinya. Sumber ini tidak membuktikan kesetaraan fitur dengan streaming.
- [Papan Peringkat & Perbandingan Penyedia Speech-to-Text](https://artificialanalysis.ai/speech-to-text/streaming) — Operator benchmark independen menjelaskan metrik WER streaming dan latensi. Teks publik yang diperoleh tidak menampilkan baris khusus model ini, sehingga peringkat persis tetap diatribusikan kepada Microsoft dan tidak dikonfirmasi secara independen.
- [Metodologi Benchmark Speech-to-Text](https://artificialanalysis.ai/methodology/speech-to-text) — Metodologi benchmark untuk audio streaming, dataset, pembobotan, dan latensi. Benchmark tidak menetapkan latensi atau akurasi setiap aplikasi.
Buletin BIG CHANGE

Gambaran besar. Sesuai tempo Anda.

Kisah terbaru tentang AI dan robotika, perubahan yang patut diikuti, serta gagasan praktis yang dapat diterapkan. Pilih rangkuman harian, mingguan, atau perspektif bulanan.