HINDI TUMITIGIL ANG MUNDO.RSS
BIG CHANGE.

Markdown edition

AI-translated from English; not yet reviewed by a fluent editor.

# Pinalalawak ng Qwen Audio 3.1 ang mga kakayahan nito sa boses. Kailangang lagyan ng konteksto ang 95% na bawas-presyo

> Nagdaragdag ang Qwen Audio 3.1 ng paglikha at pag-unawa sa tunog. Hindi magkakapareho ang pagkakadetalyado ng dokumentasyon nito sa API, at nagpapahirap sa pagberipika sa ipinahayag na matitipid sa ASR ang pagbabago ng yunit ng pagsingil.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Nagpakilala ang pangkat ng Qwen ng Alibaba ng limang modelo ng Qwen Audio 3.1 para sa transkripsiyon, paglikha ng pananalita at live na interaksiyon gamit ang boses. May dokumentadong hosted endpoint ang ASR, TTS-Next at Realtime Plus. May inilathalang model ID at presyo ang TTS Flash, ngunit hindi gaanong kumpleto ang dokumentasyon ng integrasyon nito; wala namang model ID, rehiyon o presyo ang ASR-Next sa mga pampublikong dokumento para sa developer na sinuri ng BIG CHANGE.

[Iniulat ng The Decoder](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) ang ipinahayag ng Qwen na pagbawas sa presyo na humigit-kumulang 70% para sa text-to-speech, 85% para sa realtime audio at hanggang 95% para sa pagkilala ng pananalita. Mahalaga ang mga yunit ng pagsingil sa pagberipika sa mga bilang na ito.

## Ang malaking pagbabago

- **Ano ang nagbago:** Mas marami nang bahagi ng isang produktong boses ang saklaw ng Qwen sa iisang pamilyang naka-host: mula transkripsiyon at nalikhang pananalita hanggang paglikha ng tanawin ng tunog at live na usapan. Hindi pa magkakapantay ang pagkakakumpleto ng akses para sa developer sa limang bahagi nito.
- **Bakit ito mahalaga:** Para sa mga developer na nagtatakda ng badyet para sa transkripsiyon o serbisyo ng boses, hindi na sapat ang isang minuto ng audio para presyuhan ang bawat endpoint. Kasama sa singil ng ASR na batay sa token ang papasok na audio at ang kalalabasang teksto; apat na magkakahiwalay na stream ang may sariling presyo sa live na usapan.
- **Ano ang dapat bantayan:** Kasabay ng akses sa ASR-Next, tingnan kung mapatutunayan ng malalayang pagsusuri sa wika at latency ang kapaki-pakinabang na matitipid. Kung gayon, susunod na tanong kung ipapasa ng mga provider ng voice agent, transkripsiyon at dubbing ang matitipid na ito sa mga presyo para sa customer, at kung susunod ang mga karibal na speech API.

## Gabay sa limang modelo

| Inanunsiyong modelo | Layunin | Akses na dokumentado noong Setyembre 23 | Presyo at praktikal na limitasyon |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Streaming, transkripsiyon ng file at maiikling audio; opsyonal ang paghihiwalay ng tagapagsalita sa mga endpoint para sa file at maiikling audio | Mga naka-host na WebSocket o HTTP API sa Singapore at Beijing. Nakatala sa [internasyonal na gabay](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) ang 30 wika at 10 baryasyon ng diyalektong Tsino. | Sa Singapore, mula sa **$0.15 kada milyong audio-input token + $0.47 kada milyong text-output token** ang presyo para sa file/maiikling audio hanggang sa **$0.93 + $0.70** para sa streaming/mensahe. Hanggang 12 oras/2 GB ang transkripsiyon ng file; hanggang 5 minuto/2 GB naman ang maiikling audio. |
| **Qwen Audio 3.1 ASR-Next** | Pagtukoy sa tagapagsalita at mga timestamp, pati pagkilala sa emosyon, mga pangyayari sa paligid at tunog ng makina | Inanunsiyo ng Qwen; walang nakitang pampublikong model ID ng API, rehiyon, presyo o limitasyon sa kasalukuyang dokumentasyon ng Model Studio at QwenCloud | **Hindi dokumentado sa publiko** |
| **Qwen Audio 3.1 TTS** | Pananalita sa iba’t ibang wika, paglilipat ng boses sa ibang wika at kontrol sa paraan ng pagbigkas sa pamamagitan ng prompt | `qwen-audio-3.1-tts-flash` Nakalista sa abiso ng presyo ng Alibaba. Sa sinuring [API para sa voice cloning](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api), 3.0 TTS Flash pa rin ang nakapangalan. | Singapore: **$0.23 kada milyong text-input token + $1.87 kada milyong audio-output token**. Hindi tinukoy ang kasalukuyang pampublikong limitasyon sa sinuring materyal tungkol sa 3.1. |
| **Qwen Audio 3.1 TTS-Next** | Pinagsamang paglikha ng pananalita, sound effect at audio sa likuran | Naka-host na HTTPS API na hindi nag-stream sa Beijing, dokumentado para sa Tsino at Ingles | **$0.848 kada milyong input token + $1.696 kada milyong output token**. Hanggang 3,000 karakter ang input; apat na minuto ang output ng podcast at dalawang minuto naman para sa iba. |
| **Qwen Audio 3.1 Realtime Plus** | Usapang boses na full-duplex, may pagputol sa nagsasalita at pagtawag sa tool | Naka-host na WebSocket API sa Singapore at Beijing. Nakatala sa [gabay](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) ang 11 wika. | Singapore: **$0.80 kada milyong text input, $6.40 kada milyong audio input, $6.40 kada milyong text output at $24 kada milyong audio output**. Nagtatago ito ng hanggang 50 audio turn o 300 segundo ng kasaysayan ng audio. |

Mga naka-host na API product ang mga ito. Walang nadaanang mada-download na timbang ng modelo ng 3.1 o lisensiya para sa timbang ng modelo ang BIG CHANGE. Sumasaklaw sa website ng proyekto ang lisensiyang MIT sa GitHub repository ng QwenAudio, kaya hindi ito dapat ituring na lisensiya para sa mga modelo.

Nag-iiba rin ang bilang ng wika depende sa dokumento. Sinasabi sa [beripikadong post tungkol sa paglulunsad](https://www.sina.cn/news/detail/5346330620985983.html) ng Qwen na may 30 wika at 16 diyalektong Tsino ang ASR; 30 wika at 10 baryasyon ng diyalekto naman ang nakatala sa internasyonal na gabay ng API. Dapat gamitin ng mga developer ang listahang kaugnay ng endpoint na talagang matatawag nila.

## Hindi tumutugma ang pahayag na 95% sa pampublikong talaan ng presyo

Nagkabisa noong Setyembre 22 ang [abiso ng Alibaba tungkol sa pagbabago ng presyo](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1). Tumpak na paghahambing nito ang tungkol sa `qwen-audio-3.0-realtime-flash`, hindi sa bagong 3.1 Realtime Plus. Kinakalkula ang mga bawas-presyo sa Singapore gamit ang pormulang (dating presyo − bagong presyo) / dating presyo:

| Stream ng Realtime Flash | Dati (USD) | Ngayon (USD) | Bawas-presyo |
| --- | --- | --- | --- |
| Text input, kada milyong token | $0.45 | $0.23 | 48.89% |
| Audio input, kada milyong token | $4.50 | $0.93 | 79.33% |
| Text output, kada milyong token | $4.50 | $0.70 | 84.44% |
| Output (teksto + audio), kada milyong token | $15.00 | $1.87 | **87.53%** |

Inilipat din ng parehong abiso ang 3.1 TTS Flash mula sa $0.15 kada 10,000 karakter tungo sa magkahiwalay na presyo para sa input at output token. Gayundin, nakatala sa [kasalukuyang pahina ng presyo](https://www.alibabacloud.com/help/en/model-studio/model-pricing) ang 3.1 ASR na sinisingil batay sa input at output token, samantalang kada segundo ng audio ang singil sa 3.0 ASR at libre ang output. Nakadepende sa teksto, haba ng audio at paghahati nito sa token ang porsiyento ng pagbabago sa alinman sa dalawang pares. Kaya hindi muling nalilikha ng mga pampublikong talaang sinuri rito ang eksaktong 95% na bawas-presyo sa ASR.

## Para pa rin sa Qwen 3.0 ang malayang ebidensiya

Walang malayang pagsubok sa limang modelo ng 3.1 sa mga sangguniang sinuri noong araw ng paglulunsad. Nag-uulat ng mga resulta ng benchmark ang sariling [pahina ng proyekto ng ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) ng Qwen, ngunit sinasabi nitong hindi pa malayang naulit ang mga ito.

Ika-2 ang ranggo ng [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) ng Artificial Analysis sa talaan ng mga boses ng provider (lahat ng accent at kategorya), na may 1,259 Elo, pagitan ng 95% na kumpiyansang plus o minus 17, at 1,447 bulag na paghahambing ng sampol. Sa hiwalay na [arena ng speech agent](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), nakakuha ang Qwen Audio 3.0 Realtime Plus ng 699 preference Elo at 1.54 segundo bago ang unang audio. Naghahambing ang mga kalahok dito ng mga nakatagong modelo sa live na usapan batay sa mga itinakdang sitwasyon.

## Sources

- [Inilunsad ng Alibaba ang limang bagong modelo ng Qwen Audio 3.1](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Ulat ng pagtuklas na nagbubuod sa limang modelong inilabas at iniuugnay sa Qwen ang tinatayang bawas-presyo sa TTS, realtime at ASR. Inihambing ng BIG CHANGE ang mga singil sa sariling talaan ng Alibaba.
- [Post tungkol sa paglulunsad ng Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Beripikadong post mula sa Qwen na naglilista sa limang modelo at nilalayong kakayahan ng mga ito. Pahayag ng vendor ang mga pahayag tungkol sa kakayahan at bilis.
- [Abiso sa pagbabawas ng presyo para sa piling modelo ng audio sa Model Studio](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Opisyal na pagbabago sa presyo noong Setyembre 22 na may eksaktong dating at bagong singil sa Singapore para sa 3.0 Realtime Flash, at pagbabago ng yunit ng pagsingil para sa 3.1 TTS Flash.
- [Presyo ng modelo sa Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Kasalukuyang opisyal na presyo ayon sa modelo, uri ng datos at rehiyon, kabilang ang 3.1 ASR at Realtime Plus.
- [Mga modelo ng speech-to-text sa QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Kasalukuyang ID ng ASR endpoint, paraan ng akses, listahan ng wika, suporta sa paghihiwalay ng tagapagsalita at limitasyon sa tagal.
- [Realtime Audio Chat sa QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Kasalukuyang halimbawa ng WebSocket para sa 3.1 Realtime Plus, suporta sa boses at wika, at mga limitasyon sa naitatagong usapan.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Opisyal na akses sa API na para lamang sa Beijing, mga presyo, wika, haba ng input at mga limitasyon sa tagal ng output.
- [Pahina ng proyekto ng Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Di-nababagong pahina ng proyekto ng Qwen tungkol sa mga kakayahan ng ASR at ASR-Next at mga benchmark na iniulat ng vendor; sinasabi nitong hindi malayang inulit ang mga resulta.
- [Talaan ng mga modelo ng text-to-speech ng Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Resulta ng bulag na pagsukat ng kagustuhan para sa naunang Qwen Audio 3.0 TTS Plus, kasama ang bilang ng sampol at pagitan ng kumpiyansa.
- [Speech Agent Arena ng Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Hiwalay na resulta ng kagustuhan at oras bago ang unang audio para sa Qwen Audio 3.0 Realtime Plus; hindi ito ebalwasyon ng 3.1.
- [Sanggunian ng HTTP API para sa voice cloning](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 3.0 TTS Flash ang nakatala sa mga halimbawa ng kasalukuyang target model. Hindi malayang pinatutunayan ng mga ito ang landas ng integrasyon para sa 3.1 synthesis.