DUNIA TERUS BERGERAK.RSS
BIG CHANGE.

Edisi Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 memperluas jajaran suaranya. Pemangkasan harga 95% perlu konteks

> Qwen Audio 3.1 menambahkan pembuatan dan pemahaman suara. Dokumentasi API-nya belum merata, dan perubahan satuan penagihan mempersulit klaim penghematan ASR.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tim Qwen di Alibaba memperkenalkan lima model Qwen Audio 3.1 untuk transkripsi, pembuatan suara, dan interaksi suara langsung. ASR, TTS-Next, dan Realtime Plus memiliki endpoint ter-host yang terdokumentasi. TTS Flash memiliki ID model dan harga yang dipublikasikan, tetapi dokumentasi integrasinya kurang lengkap; dokumen pengembang publik yang ditinjau BIG CHANGE tidak mencantumkan ID model, wilayah, atau harga untuk ASR-Next.

[The Decoder melaporkan](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) klaim pemangkasan harga Qwen sekitar 70% untuk text-to-speech, 85% untuk audio waktu nyata, dan hingga 95% untuk pengenalan suara. Satuan penagihan penting saat memeriksa angka tersebut.

## Perubahan besar

- **Yang berubah:** Kini Qwen mencakup lebih banyak fungsi produk suara dalam satu keluarga ter-host, mulai dari transkripsi dan suara buatan hingga produksi suasana audio serta percakapan langsung. Namun, akses pengembang untuk kelima komponennya belum sama lengkapnya.
- **Mengapa ini penting:** Bagi pengembang yang menganggarkan biaya transkripsi atau layanan suara, durasi satu menit audio saja tidak lagi cukup untuk menentukan harga setiap endpoint. Tagihan ASR berbasis token mencakup audio yang masuk dan teks hasilnya; percakapan langsung memiliki empat aliran dengan harga terpisah.
- **Yang perlu dipantau:** Selain akses ASR-Next, perhatikan apakah pengujian bahasa dan latensi oleh pihak independen mengonfirmasi penghematan yang berguna. Jika terbukti, pertanyaan berikutnya ialah apakah penyedia agen suara, transkripsi, dan sulih suara meneruskan penghematan itu ke harga pelanggan, serta apakah API suara pesaing mengikuti.

## Peta lima model

| Model yang diumumkan | Kegunaan yang dituju | Akses terdokumentasi per 23 September | Harga dan batas praktis |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Transkripsi streaming, berkas, dan bentuk pendek; endpoint berkas dan bentuk pendek menyediakan diarization pembicara opsional | API WebSocket atau HTTP ter-host di Singapura dan Beijing. [Panduan internasional](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) mencantumkan 30 bahasa dan 10 ragam dialek Tionghoa. | Tarif Singapura berkisar dari **$0.15/M token masukan audio + $0.47/M token keluaran teks** untuk berkas/bentuk pendek hingga **$0.93 + $0.70** untuk streaming per pesan. Transkripsi berkas mendukung durasi hingga 12 jam/2 GB; bentuk pendek hingga 5 menit/2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Atribusi pembicara dan cap waktu, serta pengenalan emosi, peristiwa sekitar, dan suara mesin | Diumumkan oleh Qwen; dokumentasi Model Studio dan QwenCloud terkini yang ditinjau tidak memuat ID model API publik, wilayah, tarif, atau batas penggunaan | **Belum didokumentasikan secara publik** |
| **Qwen Audio 3.1 TTS** | Suara multibahasa, transfer suara lintas bahasa, dan kontrol penyampaian lewat prompt | `qwen-audio-3.1-tts-flash` tercantum dalam pemberitahuan harga Alibaba. Namun, [API kloning suara](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) yang ditinjau masih mencantumkan 3.0 TTS Flash. | Singapura: **$0.23/M token masukan teks + $1.87/M token keluaran audio**. Materi publik 3.1 yang ditinjau tidak menyebutkan batas penggunaan terkini. |
| **Qwen Audio 3.1 TTS-Next** | Pembuatan bersama suara, efek, dan audio latar | API HTTPS non-streaming yang di-host di Beijing, dengan dokumentasi untuk bahasa Tionghoa dan Inggris | **$0.848/M token masukan + $1.696/M token keluaran**. Hingga 3.000 karakter masukan; keluaran podcast dibatasi empat menit dan keluaran lainnya dua menit. |
| **Qwen Audio 3.1 Realtime Plus** | Percakapan suara dupleks penuh dengan interupsi dan pemanggilan alat | API WebSocket ter-host di Singapura dan Beijing. [Panduan tersebut](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) mencantumkan 11 bahasa. | Singapura: **$0.80/M masukan teks, $6.40/M masukan audio, $6.40/M keluaran teks, dan $24/M keluaran audio**. Model ini menyimpan hingga 50 giliran audio atau 300 detik riwayat audio. |

Semua ini merupakan produk API ter-host. BIG CHANGE tidak menemukan bobot model 3.1 yang dapat diunduh atau lisensi bobot model. Lisensi MIT di repositori GitHub QwenAudio mencakup situs proyek, jadi lisensi itu tidak boleh dianggap sebagai lisensi untuk modelnya.

Jumlah bahasa juga bergantung pada dokumen yang dirujuk. [Unggahan peluncuran terverifikasi dari Qwen](https://www.sina.cn/news/detail/5346330620985983.html) menyebut ASR mendukung 30 bahasa dan 16 dialek Tionghoa; panduan API internasional mencantumkan 30 bahasa dan 10 ragam dialek. Pengembang sebaiknya menggunakan daftar yang terkait dengan endpoint yang benar-benar dapat mereka akses.

## Klaim 95% tidak cocok dengan tabel tarif publik

Alibaba menerbitkan [pemberitahuan perubahan harga](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) yang mulai berlaku pada 22 September. Perbandingan persisnya mencakup `qwen-audio-3.0-realtime-flash`, bukan Realtime Plus 3.1 yang baru. Pemangkasan tarif Singapura dihitung sebagai (tarif lama − tarif baru) / tarif lama:

| Aliran Realtime Flash | Sebelum (USD) | Sesudah (USD) | Penurunan |
| --- | --- | --- | --- |
| Masukan teks, per sejuta token | $0.45 | $0.23 | 48.89% |
| Masukan audio, per sejuta token | $4.50 | $0.93 | 79.33% |
| Keluaran teks, per sejuta token | $4.50 | $0.70 | 84.44% |
| Keluaran (teks + audio), per sejuta token | $15.00 | $1.87 | **87.53%** |

Pemberitahuan yang sama mengubah TTS Flash 3.1 dari US$0,15 per 10.000 karakter menjadi tarif terpisah berdasarkan token masukan dan keluaran. [Halaman harga saat ini](https://www.alibabacloud.com/help/en/model-studio/model-pricing) juga mencantumkan ASR 3.1 berdasarkan token masukan dan keluaran, sedangkan ASR 3.0 mengenakan biaya per detik audio dengan keluaran gratis. Persentase untuk salah satu pasangan tarif itu bergantung pada teks, durasi audio, dan tokenisasi. Karena itu, tabel publik yang ditinjau di sini tidak menghasilkan kembali angka pengurangan ASR tepat 95%.

## Bukti independen masih merujuk pada Qwen 3.0

Pada hari peluncuran, sumber yang ditinjau belum menyediakan pengujian independen atas kelima model 3.1. [Halaman proyek ASR Qwen](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) melaporkan hasil tolok ukur, tetapi menyebut hasil itu belum diuji ulang secara independen.

Artificial Analysis menempatkan [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) di peringkat kedua dalam arena suara penyedia (semua aksen dan kategori), dengan 1.259 Elo, interval kepercayaan 95% sebesar plus atau minus 17, dan 1.447 sampel perbandingan buta. Dalam [arena agen suara](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) terpisah, Qwen Audio 3.0 Realtime Plus meraih 699 Elo preferensi dengan waktu menuju audio pertama 1,54 detik. Pesertanya membandingkan model tersembunyi dalam percakapan langsung dengan skenario yang telah ditentukan.

## Sources

- [Alibaba meluncurkan Qwen Audio 3.1 dengan lima model baru](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Laporan peluncuran yang merangkum kelima model dan mengatribusikan perkiraan pemangkasan harga TTS, realtime, dan ASR kepada Qwen. BIG CHANGE memeriksa tarifnya dengan membandingkannya dengan tabel resmi Alibaba.
- [Unggahan peluncuran Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Unggahan akun Qwen terverifikasi yang menyebut kelima model dan kemampuan yang dituju. Klaim kemampuan dan kecepatan tetap diatribusikan kepada vendor.
- [Pemberitahuan pengurangan harga Model Studio untuk model audio terpilih](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Perubahan harga resmi pada 22 September yang memuat tarif Singapura sebelum dan sesudah untuk 3.0 Realtime Flash serta perubahan satuan penagihan untuk 3.1 TTS Flash.
- [Harga model Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Harga resmi terkini berdasarkan model, modalitas, dan wilayah, termasuk ASR 3.1 dan Realtime Plus.
- [Model speech-to-text QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — ID endpoint ASR terkini, metode akses, daftar bahasa, dukungan diarization, dan batas durasi.
- [Obrolan Audio Realtime QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Contoh WebSocket Realtime Plus 3.1 terkini, dukungan suara dan bahasa, serta batas riwayat percakapan yang disimpan.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Ketersediaan resmi API yang hanya mencakup Beijing, harga, bahasa, panjang masukan, dan batas durasi keluaran.
- [Halaman proyek ASR Qwen Audio 3.1](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Halaman proyek Qwen yang tidak berubah, berisi kemampuan ASR dan ASR-Next serta tolok ukur yang dilaporkan vendor; halaman itu menyebut hasilnya belum direplikasi secara independen.
- [Papan peringkat Text to Speech Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Hasil preferensi buta untuk model pendahulu Qwen Audio 3.0 TTS Plus, termasuk jumlah sampel dan interval kepercayaan.
- [Arena Agen Suara Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Hasil preferensi dan waktu menuju audio pertama yang terpisah untuk Qwen Audio 3.0 Realtime Plus; bukan evaluasi 3.1.
- [Referensi API HTTP untuk kloning suara](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Contoh model target yang tersedia saat ini mencantumkan 3.0 TTS Flash. Contoh tersebut tidak secara independen mengonfirmasi jalur integrasi sintesis 3.1.