Nagpakilala ang pangkat ng Qwen ng Alibaba ng limang modelo ng Qwen Audio 3.1 para sa transkripsiyon, paglikha ng pananalita at live na interaksiyon gamit ang boses. May dokumentadong hosted endpoint ang ASR, TTS-Next at Realtime Plus. May inilathalang model ID at presyo ang TTS Flash, ngunit hindi gaanong kumpleto ang dokumentasyon ng integrasyon nito; wala namang model ID, rehiyon o presyo ang ASR-Next sa mga pampublikong dokumento para sa developer na sinuri ng BIG CHANGE.
Iniulat ng The Decoder ang ipinahayag ng Qwen na pagbawas sa presyo na humigit-kumulang 70% para sa text-to-speech, 85% para sa realtime audio at hanggang 95% para sa pagkilala ng pananalita. Mahalaga ang mga yunit ng pagsingil sa pagberipika sa mga bilang na ito.
Ang malaking pagbabago
- Ano ang nagbago: Mas marami nang bahagi ng isang produktong boses ang saklaw ng Qwen sa iisang pamilyang naka-host: mula transkripsiyon at nalikhang pananalita hanggang paglikha ng tanawin ng tunog at live na usapan. Hindi pa magkakapantay ang pagkakakumpleto ng akses para sa developer sa limang bahagi nito.
- Bakit ito mahalaga: Para sa mga developer na nagtatakda ng badyet para sa transkripsiyon o serbisyo ng boses, hindi na sapat ang isang minuto ng audio para presyuhan ang bawat endpoint. Kasama sa singil ng ASR na batay sa token ang papasok na audio at ang kalalabasang teksto; apat na magkakahiwalay na stream ang may sariling presyo sa live na usapan.
- Ano ang dapat bantayan: Kasabay ng akses sa ASR-Next, tingnan kung mapatutunayan ng malalayang pagsusuri sa wika at latency ang kapaki-pakinabang na matitipid. Kung gayon, susunod na tanong kung ipapasa ng mga provider ng voice agent, transkripsiyon at dubbing ang matitipid na ito sa mga presyo para sa customer, at kung susunod ang mga karibal na speech API.
Gabay sa limang modelo
Inanunsiyong modelo | Layunin | Akses na dokumentado noong Setyembre 23 | Presyo at praktikal na limitasyon |
|---|---|---|---|
Qwen Audio 3.1 ASR | Streaming, transkripsiyon ng file at maiikling audio; opsyonal ang paghihiwalay ng tagapagsalita sa mga endpoint para sa file at maiikling audio | Mga naka-host na WebSocket o HTTP API sa Singapore at Beijing. Nakatala sa internasyonal na gabay ang 30 wika at 10 baryasyon ng diyalektong Tsino. | Sa Singapore, mula sa $0.15 kada milyong audio-input token + $0.47 kada milyong text-output token ang presyo para sa file/maiikling audio hanggang sa $0.93 + $0.70 para sa streaming/mensahe. Hanggang 12 oras/2 GB ang transkripsiyon ng file; hanggang 5 minuto/2 GB naman ang maiikling audio. |
Qwen Audio 3.1 ASR-Next | Pagtukoy sa tagapagsalita at mga timestamp, pati pagkilala sa emosyon, mga pangyayari sa paligid at tunog ng makina | Inanunsiyo ng Qwen; walang nakitang pampublikong model ID ng API, rehiyon, presyo o limitasyon sa kasalukuyang dokumentasyon ng Model Studio at QwenCloud | Hindi dokumentado sa publiko |
Qwen Audio 3.1 TTS | Pananalita sa iba’t ibang wika, paglilipat ng boses sa ibang wika at kontrol sa paraan ng pagbigkas sa pamamagitan ng prompt | | Singapore: $0.23 kada milyong text-input token + $1.87 kada milyong audio-output token. Hindi tinukoy ang kasalukuyang pampublikong limitasyon sa sinuring materyal tungkol sa 3.1. |
Qwen Audio 3.1 TTS-Next | Pinagsamang paglikha ng pananalita, sound effect at audio sa likuran | Naka-host na HTTPS API na hindi nag-stream sa Beijing, dokumentado para sa Tsino at Ingles | $0.848 kada milyong input token + $1.696 kada milyong output token. Hanggang 3,000 karakter ang input; apat na minuto ang output ng podcast at dalawang minuto naman para sa iba. |
Qwen Audio 3.1 Realtime Plus | Usapang boses na full-duplex, may pagputol sa nagsasalita at pagtawag sa tool | Naka-host na WebSocket API sa Singapore at Beijing. Nakatala sa gabay ang 11 wika. | Singapore: $0.80 kada milyong text input, $6.40 kada milyong audio input, $6.40 kada milyong text output at $24 kada milyong audio output. Nagtatago ito ng hanggang 50 audio turn o 300 segundo ng kasaysayan ng audio. |
Mga naka-host na API product ang mga ito. Walang nadaanang mada-download na timbang ng modelo ng 3.1 o lisensiya para sa timbang ng modelo ang BIG CHANGE. Sumasaklaw sa website ng proyekto ang lisensiyang MIT sa GitHub repository ng QwenAudio, kaya hindi ito dapat ituring na lisensiya para sa mga modelo.
Nag-iiba rin ang bilang ng wika depende sa dokumento. Sinasabi sa beripikadong post tungkol sa paglulunsad ng Qwen na may 30 wika at 16 diyalektong Tsino ang ASR; 30 wika at 10 baryasyon ng diyalekto naman ang nakatala sa internasyonal na gabay ng API. Dapat gamitin ng mga developer ang listahang kaugnay ng endpoint na talagang matatawag nila.
Hindi tumutugma ang pahayag na 95% sa pampublikong talaan ng presyo
Nagkabisa noong Setyembre 22 ang abiso ng Alibaba tungkol sa pagbabago ng presyo. Tumpak na paghahambing nito ang tungkol sa qwen-audio-3.0-realtime-flash, hindi sa bagong 3.1 Realtime Plus. Kinakalkula ang mga bawas-presyo sa Singapore gamit ang pormulang (dating presyo − bagong presyo) / dating presyo:
Stream ng Realtime Flash | Dati (USD) | Ngayon (USD) | Bawas-presyo |
|---|---|---|---|
Text input, kada milyong token | $0.45 | $0.23 | 48.89% |
Audio input, kada milyong token | $4.50 | $0.93 | 79.33% |
Text output, kada milyong token | $4.50 | $0.70 | 84.44% |
Output (teksto + audio), kada milyong token | $15.00 | $1.87 | 87.53% |
Inilipat din ng parehong abiso ang 3.1 TTS Flash mula sa $0.15 kada 10,000 karakter tungo sa magkahiwalay na presyo para sa input at output token. Gayundin, nakatala sa kasalukuyang pahina ng presyo ang 3.1 ASR na sinisingil batay sa input at output token, samantalang kada segundo ng audio ang singil sa 3.0 ASR at libre ang output. Nakadepende sa teksto, haba ng audio at paghahati nito sa token ang porsiyento ng pagbabago sa alinman sa dalawang pares. Kaya hindi muling nalilikha ng mga pampublikong talaang sinuri rito ang eksaktong 95% na bawas-presyo sa ASR.
Para pa rin sa Qwen 3.0 ang malayang ebidensiya
Walang malayang pagsubok sa limang modelo ng 3.1 sa mga sangguniang sinuri noong araw ng paglulunsad. Nag-uulat ng mga resulta ng benchmark ang sariling pahina ng proyekto ng ASR ng Qwen, ngunit sinasabi nitong hindi pa malayang naulit ang mga ito.
Ika-2 ang ranggo ng Qwen Audio 3.0 TTS Plus ng Artificial Analysis sa talaan ng mga boses ng provider (lahat ng accent at kategorya), na may 1,259 Elo, pagitan ng 95% na kumpiyansang plus o minus 17, at 1,447 bulag na paghahambing ng sampol. Sa hiwalay na arena ng speech agent, nakakuha ang Qwen Audio 3.0 Realtime Plus ng 699 preference Elo at 1.54 segundo bago ang unang audio. Naghahambing ang mga kalahok dito ng mga nakatagong modelo sa live na usapan batay sa mga itinakdang sitwasyon.



