Microsoft mengumumkan MAI-Transcribe-2-Streaming pada 1 Oktober. Model ini menerima audio saat seseorang berbicara dan mengembalikan teks yang terus berubah sebelum menghasilkan transkrip final. Bagi pengembang yang menambahkan takarir langsung atau input suara ke aplikasi suara, pertanyaan pentingnya adalah bagaimana pembaruan itu sampai ke aplikasi dan kapan teks dapat dianggap final.

Ini adalah penjelasan integrasi berbasis dokumentasi bagi pengembang yang mengevaluasi pratinjau publik. Tujuannya adalah menentukan apakah model layak dibuatkan prototipe dan mengidentifikasi pekerjaan klien yang diperlukan untuk menampilkan teks langsung serta menyimpan teks final. Microsoft mendokumentasikan rute dan kode contoh; BIG CHANGE belum menerapkan model ini, menjalankan contoh, atau mengukur akurasi maupun latensinya.

Perubahan besar

  • Microsoft memperkenalkan model streaming yang mengembalikan teks sementara saat audio masuk, lalu mengonfirmasi segmen transkrip. Jalur transkripsi file MAI-Transcribe-2 yang terpisah menangani audio rekaman dan mendokumentasikan rangkaian opsi yang berbeda.
  • Aplikasi yang menggunakan Realtime API harus mengirim audio dengan format yang benar, menangani revisi pada akhiran sementara, dan menentukan kapan meminta transkrip selesai. Pilihan tersebut menentukan apa yang dilihat pengguna dan kapan logika aplikasi selanjutnya dapat mengandalkan teks final.
  • Model streaming ini masih berupa pratinjau publik tanpa perjanjian tingkat layanan. Microsoft tidak merekomendasikannya untuk beban kerja produksi. Klaim kecepatan dan akurasi yang dikutip berasal dari peluncuran dan benchmark, bukan pengukuran dalam panduan ini.

Pilih jalur koneksi

Katalog Microsoft Foundry mencantumkan MAI-Transcribe-2-Streaming, versi 2026-08-06, sebagai model pratinjau dengan input audio dan output teks. Ikhtisar 1 Oktober dari Microsoft mendokumentasikan dua cara integrasi: Realtime API yang menggunakan protokol WebSocket mirip OpenAI Realtime, atau Azure Speech SDK. Keduanya mengembalikan hasil pengenalan sementara dan final. SDK mengelola koneksi dan streaming audio; rute Realtime mengekspos event secara langsung.

Untuk Realtime API, Microsoft mensyaratkan langganan Azure, sumber daya Microsoft Foundry di wilayah yang didukung, dan deployment model streaming. Sambungkan ke wss://{your_resource_name}.services.ai.azure.com/mai/v1/realtime?intent=transcription menggunakan token bearer Microsoft Entra atau kunci API. Dokumentasi menyarankan autentikasi Entra. Setelah session.created, kirim session.update dengan nama deployment Anda dan tetapkan format input. Pengaturan ini tidak dapat diubah setelah penambahan audio pertama, bahkan setelah commit.

Input yang didokumentasikan adalah PCM16 mentah bertanda, little-endian, mono pada 16 atau 24 kHz, dikirim sebagai potongan base64 dalam pesan input_audio_buffer.append pesan. Data tersebut berupa PCM tanpa header WAV. Microsoft menyarankan potongan kecil, misalnya 10 hingga 20 milidetik, untuk mengurangi latensi, sambil mencatat bahwa potongan lebih besar mengurangi overhead jaringan. Contoh Python-nya membaca audio mikrofon dalam blok 100 ms; saran potongan kecil pada halaman dan ukuran blok contoh adalah pilihan yang berbeda, bukan hasil pengukuran BIG CHANGE.

Rute Speech SDK memerlukan SDK v1.52.0, langganan Azure, serta sumber daya Foundry atau Speech. Contoh Python Microsoft menetapkan speech_config.model menjadi MAI-Transcribe-2-Streaming, menyediakan audio mono 16 kHz dan 16-bit melalui push stream, lalu mendengarkan event recognizing dan recognized. Contoh tersebut menggunakan berkas audio.pcm yang sudah ada untuk menjelaskan push stream; aplikasi akan memasok sumber audionya sendiri. Ini adalah antarmuka dan jenis event yang didokumentasikan, bukan pengujian kompatibilitas tingkat akun oleh publikasi ini.

Pisahkan teks sementara dari teks yang sudah dikonfirmasi

Semantik event Realtime penting bagi antarmuka langsung. Event conversation.item.input_audio_transcription.delta memuat teks baru yang telah difinalisasi, yang ditambahkan aplikasi klien ke buffer terkonfirmasi tanpa mengubah spasi. Event intermediate memuat seluruh akhiran sementara saat ini. Setiap akhiran baru menggantikan akhiran sebelumnya. Layar dapat menampilkan buffer terkonfirmasi ditambah akhiran saat ini, tetapi menyimpan setiap event sementara sebagai baris baru akan menggandakan kata saat model merevisinya.

Klien mengirim input_audio_buffer.commit saat jeda yang terdeteksi atau di akhir rekaman. Menurut Microsoft, ini meminta transkrip final sesegera mungkin; input_audio_buffer.committed mengonfirmasi commit, dan conversation.item.input_audio_transcription.completed memberikan seluruh teks final untuk audio sejak commit sebelumnya. Panduan Realtime menyebut deteksi giliran di server dan commit otomatis tidak tersedia untuk konfigurasi sesi model ini. Karena itu, aplikasi suara memerlukan batas jeda atau giliran sendiri jika ingin menyelesaikan segmen secara otomatis. Dokumentasi menjelaskan kontrak event; panduan itu tidak menetapkan satu pendeteksi batas yang cocok untuk semua kebutuhan.

Panduan Microsoft membatasi setiap sesi Realtime hingga satu jam. Panduan itu juga menyebut penambahan audio tidak memiliki konfirmasi individual dan dapat menghasilkan nol atau beberapa event transkrip. Pengembang yang mengevaluasi prototipe perlu membedakan penerimaan pesan audio dari penerimaan teks final, serta menentukan cara aplikasi menangani sesi yang terputus. Contoh Python pada panduan publik mencakup antrean mikrofon dan penanganan error, tetapi BIG CHANGE belum menjalankannya untuk memastikan perilaku kegagalan yang teramati.

Akses, wilayah, dan harga

Microsoft menyatakan model ini dapat diakses secara global, dengan Azure merutekan permintaan ke wilayah penyedia layanan. Dua halaman integrasi 1 Oktober mencantumkan wilayah tersedia yang berbeda: panduan Realtime menyebut Sweden Central, Central US, dan South India; panduan Speech SDK menyebut Sweden Central, Central US, dan Southeast Asia. Keduanya mencantumkan East US 2 sebagai wilayah yang akan segera tersedia. Periksa opsi deployment dan wilayah terkini untuk rute yang hendak digunakan; halaman-halaman ini tidak memberikan satu daftar yang konsisten. Akses global tidak berarti jaminan lokasi pemrosesan tertentu.

Pengumuman Microsoft mengutip harga pengantar sebesar $0,54 per jam audio hingga akhir 2026. Dengan perhitungan aritmetis, itu setara dengan $9 per 1.000 menit audio, sebelum biaya layanan atau infrastruktur lain yang digunakan aplikasi. Dari panduannya, Microsoft menautkan halaman harga Foundry Models dan layanan Speech untuk masing-masing rute. Sumber yang ditinjau tidak mencantumkan tarif setelah masa pengantar atau tagihan hasil pengujian, sehingga anggaran deployment perlu didasarkan pada pemeriksaan harga terkini.

Microsoft menyatakan model streaming ini mendukung 60 bahasa dengan deteksi otomatis berkelanjutan. Microsoft mengatakan hasil parsial pertama muncul sedikit di atas 100 ms setelah audio diterima, dan mengutip Artificial Analysis untuk klaim posisi teratas dalam akurasi. Benchmark streaming Artificial Analysis mengukur tingkat kesalahan kata pada sekitar delapan jam dataset berbobot dan menghitung waktu hasil parsial serta final relatif terhadap akhir ucapan yang terdeteksi. Itu adalah benchmark dengan aturan audio dan waktu tertentu, bukan jaminan bahwa aplikasi tertentu akan menampilkan kata yang benar dalam 100 ms. Kami tidak memverifikasi secara independen peringkat persis yang diklaim Microsoft melalui baris hasil khusus model dalam teks benchmark publik yang diperoleh untuk artikel ini.

Panduan MAI-Transcribe-2 untuk Azure Speech yang terpisah mendokumentasikan input file dan opsi seperti diarization pembicara, cap waktu tingkat kata, penyesuaian kata kunci, serta gaya bersih atau verbatim. Jangan berasumsi bahwa kontrol tersebut berfungsi pada MAI-Transcribe-2-Streaming: panduan integrasi streaming tidak mendokumentasikannya. Jika produk memerlukan keluaran itu, evaluasi model file atau pastikan dukungan streaming melalui dokumentasi terkini dan pengujian sebelum menjadikannya dasar pengembangan.

Sumber & bacaan lebih lanjut

  • Pengumuman Microsoft AI, 1 Oktober 2026: klaim peluncuran, bahasa, kecepatan, dan harga pengantar. Klaim Microsoft sendiri mengenai akurasi dan kecepatan internal diatribusikan di atas.
  • Katalog model Microsoft Foundry, diperiksa 2 Oktober: versi model, tahap pratinjau, serta jenis input/output; katalog ini bukan pengujian kinerja.
  • Ikhtisar streaming, Panduan Realtime API dan Panduan Speech SDK, diperbarui 1 Oktober: dua jalur integrasi yang didokumentasikan, ketentuan pratinjau, perilaku event, contoh, dan tabel wilayah. BIG CHANGE belum menjalankan contoh-contohnya.
  • MAI-Transcribe-2 di Azure Speech, diperiksa 2 Oktober: jalur transkripsi file yang berbeda dan kontrol yang didokumentasikan. Daftar fiturnya tidak menunjukkan fitur streaming.
  • Benchmark streaming Artificial Analysis dan metodologi, diperiksa 2 Oktober: rancangan benchmark independen dan definisi waktu. Teks publik yang diperoleh tidak menampilkan baris hasil model ini untuk mengonfirmasi peringkat secara independen.