AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 proširuje paket govornih modela. Sniženje cene od 95% zahteva kontekst
> Qwen Audio 3.1 dodaje generisanje i razumevanje zvuka. Dokumentacija za API nije ujednačena, a promena obračunskih jedinica otežava proveru najavljenih ušteda od ASR-a.
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Alibabaov tim Qwen predstavio je pet modela Qwen Audio 3.1 za transkripciju, generisanje govora i glasovne razgovore uživo. Za ASR, TTS-Next i Realtime Plus dokumentovani su hostovani API-jevi. TTS Flash ima objavljen ID modela i cenu, ali nepotpuniju dokumentaciju za integraciju; u javnim dokumentima za razvoj koje je pregledao BIG CHANGE, ASR-Next nema ID modela, region ni cenu.
[Sajt The Decoder izvestio je](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) da Qwen najavljuje sniženje cena od oko 70% za pretvaranje teksta u govor, 85% za zvuk u realnom vremenu i do 95% za prepoznavanje govora. Obračunske jedinice su važne pri proveri tih brojki.
## Najvažnija promena
- **Šta se menja:** Qwen sada objedinjuje više funkcija govornog proizvoda u jednu hostovanu porodicu modela: od transkripcije i generisanog govora do stvaranja zvučnih pejzaža i razgovora uživo. Pristup za programere još nije podjednako potpun za svih pet komponenti.
- **Zašto je važno:** Programerima koji planiraju troškove transkripcije ili govornih usluga minut zvuka više nije dovoljan za cenu svakog krajnjeg API-ja. ASR koji se naplaćuje po tokenu obuhvata i ulazni zvuk i dobijeni tekst, a razgovor uživo ima četiri zasebno naplaćena toka.
- **Na šta obratiti pažnju:** Pored dostupnosti ASR-Next-a, pratite da li nezavisni testovi jezika i kašnjenja potvrđuju korisne uštede. Ako ih potvrde, šire pitanje je da li pružaoci glasovnih agenata, transkripcije i sinhronizacije prenose te uštede na cene za korisnike i da li ih prate konkurentski govorni API-ji.
## Pregled pet modela
| Najavljeni model | Namena | Dokumentovani pristup na dan 23. septembra | Cena i praktično ograničenje |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Striming, transkripcija datoteka i kratkih snimaka; opcionalno razdvajanje govornika za datoteke i kratke snimke | Hostovani WebSocket ili HTTP API-ji u Singapuru i Pekingu. [Međunarodni vodič](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) navodi 30 jezika i 10 varijeteta kineskog. | Cene u Singapuru kreću se od **0,15 USD po milionu ulaznih audio-tokena + 0,47 USD po milionu izlaznih tekstualnih tokena** za transkripciju datoteka i kratkih snimaka do **0,93 USD + 0,70 USD** za striming i poruku. Transkripcija datoteka podržava do 12 sati i 2 GB; kratki snimci do 5 minuta i 2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Određivanje govornika i vremenskih oznaka, uz prepoznavanje emocija, zvukova okruženja i mašinskih zvukova | Qwen ga je najavio; u aktuelnoj dokumentaciji za Model Studio i QwenCloud nije pronađen javni ID API modela, region, cena ni ograničenje. | **Nije javno dokumentovano** |
| **Qwen Audio 3.1 TTS** | Višejezični govor, prenos glasa između jezika i upravljanje načinom govora pomoću prompta | `qwen-audio-3.1-tts-flash` se pojavljuje u Alibabinoj objavi o cenama. U pregledanom [API-ju za kloniranje glasa](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) i dalje se navodi 3.0 TTS Flash. | Cene u Singapuru: **0,23 USD po milionu ulaznih tekstualnih tokena + 1,87 USD po milionu izlaznih audio-tokena**. U pregledanim materijalima za 3.1 nisu navedena aktuelna javna ograničenja. |
| **Qwen Audio 3.1 TTS-Next** | Zajedničko generisanje govora, efekata i pozadinskog zvuka | Hostovani HTTPS API bez striminga u Pekingu, dokumentovan za kineski i engleski jezik | **0,848 USD po milionu ulaznih tokena + 1,696 USD po milionu izlaznih tokena**. Do 3.000 ulaznih znakova; podkast do četiri minuta, a ostali sadržaji do dva minuta. |
| **Qwen Audio 3.1 Realtime Plus** | Glasovni razgovor sa dvosmernim prenosom u realnom vremenu, prekidanjem i pozivima alata | Hostovani WebSocket API u Singapuru i Pekingu. [Vodič](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) navodi 11 jezika. | Cene u Singapuru: **0,80 USD po milionu ulaznih tekstualnih tokena, 6,40 USD po milionu ulaznih audio-tokena, 6,40 USD po milionu izlaznih tekstualnih tokena i 24 USD po milionu izlaznih audio-tokena**. Čuva do 50 audio-poteza ili 300 sekundi zvučne istorije. |
Ovo su hostovani API proizvodi. BIG CHANGE nije pronašao preuzimljive težine modela 3.1 ni licencu za njih. MIT licenca u QwenAudio GitHub repozitorijumu odnosi se na veb-sajt projekta, pa je ne treba tumačiti kao licencu za modele.
Broj jezika zavisi i od dokumenta. U Qwenovoj [proverenoj objavi o predstavljanju](https://www.sina.cn/news/detail/5346330620985983.html) navodi se da ASR pokriva 30 jezika i 16 varijeteta kineskog; međunarodni vodič za API navodi 30 jezika i 10 varijeteta. Programeri treba da se oslanjaju na spisak za krajnji API koji zaista mogu da pozovu.
## Tvrdnja o sniženju od 95% ne odgovara javnoj tabeli cena
Alibabina [objava o promeni cena](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) stupila je na snagu 22. septembra. Tačno poređenje odnosi se na `qwen-audio-3.0-realtime-flash`, a ne na novi 3.1 Realtime Plus. Sniženja za Singapur izračunata su ovako: (stara cena − nova cena) / stara cena:
| Realtime Flash, striming | Ranije (USD) | Sada (USD) | Sniženje |
| --- | --- | --- | --- |
| Ulazni tekst, po milionu tokena | $0.45 | $0.23 | 48.89% |
| Ulazni zvuk, po milionu tokena | $4.50 | $0.93 | 79.33% |
| Izlazni tekst, po milionu tokena | $4.50 | $0.70 | 84.44% |
| Izlaz (tekst + zvuk), po milionu tokena | $15.00 | $1.87 | **87.53%** |
Ista objava menja i cenu za 3.1 TTS Flash: sa 0,15 dolara na 10.000 znakova na zasebne cene ulaznih i izlaznih tokena. [Aktuelna stranica sa cenama](https://www.alibabacloud.com/help/en/model-studio/model-pricing) takođe prikazuje naplatu 3.1 ASR-a po ulaznim i izlaznim tokenima, dok se 3.0 ASR naplaćuje po sekundi ulaznog zvuka, a izlaz je besplatan. Procenat uštede pri poređenju bilo kog para zavisi od teksta, trajanja zvuka i tokenizacije. Zato pregledane javne tabele ne omogućavaju da se ponovi tačno sniženje ASR-a od 95%.
## Nezavisni dokazi i dalje se odnose na Qwen 3.0
U izvorima pregledanim na dan predstavljanja nije bilo nezavisnog testa pet modela 3.1. Qwenova [projektna stranica za ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) iznosi rezultate merila, ali navodi da oni nisu nezavisno ponovljeni.
Artificial Analysis rangira model [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) na drugom mestu u svojoj areni za modele u hostovanim govornim servisima (svi akcenti i kategorije), sa 1.259 Elo bodova, intervalom pouzdanosti od plus ili minus 17 i 1.447 uzoraka slepih poređenja. U zasebnoj [areni govornih agenata](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), Qwen Audio 3.0 Realtime Plus ostvario je 699 Elo bodova preferencija uz 1,54 sekunde do prvog zvuka. Učesnici u razgovorima uživo porede skrivene modele u zadatim scenarijima.
## Sources
- [Alibaba predstavlja Qwen Audio 3.1 sa pet novih modela](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Pregled predstavljanja pet modela, u kom se Qwenu pripisuju približna sniženja cena za TTS, razgovor uživo i ASR. BIG CHANGE je uporedio cene sa Alibabinim tabelama.
- [Qwen Audio 3.1: objava o predstavljanju](https://www.sina.cn/news/detail/5346330620985983.html) — Objava sa proverenog Qwen naloga navodi pet modela i njihove predviđene funkcije. Tvrdnje o mogućnostima i brzini ostaju tvrdnje dobavljača.
- [Obaveštenje o sniženju cena odabranih audio modela u Model Studio-u](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Zvanična promena cena od 22. septembra sa tačnim starim i novim cenama za 3.0 Realtime Flash u Singapuru i promenom obračunske jedinice za 3.1 TTS Flash.
- [Cene modela u Model Studio-u](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Aktuelne zvanične cene prema modelu, modalitetu i regionu, uključujući 3.1 ASR i Realtime Plus.
- [Govorni modeli QwenCloud-a za pretvaranje govora u tekst](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Aktuelni ID-jevi ASR krajnjih API-ja, načini pristupa, spiskovi jezika, podrška za razdvajanje govornika i vremenska ograničenja.
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Aktuelni primer WebSocket-a za 3.1 Realtime Plus, podrška za glasove i jezike i ograničenja čuvanja razgovora.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Zvanična dostupnost API-ja samo u Pekingu, cene, jezici, ograničenje ulazne dužine i trajanja izlaza.
- [Projektna stranica Qwen Audio 3.1 ASR-a](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Stalna projektna stranica Qwen-a za mogućnosti ASR-a i ASR-Next-a i rezultate merila koje je objavio dobavljač; navodi da rezultati nisu nezavisno ponovljeni.
- [Rang-lista za pretvaranje teksta u govor sajta Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Rezultati slepog poređenja za prethodni model Qwen Audio 3.0 TTS Plus, uključujući broj uzoraka i interval pouzdanosti.
- [Arena govornih agenata sajta Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Odvojeni rezultati preferencija i vremena do prvog zvuka za Qwen Audio 3.0 Realtime Plus; nisu evaluacija verzije 3.1.
- [HTTP API referenca za kloniranje glasa](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Primeri trenutnog ciljnog modela navode 3.0 TTS Flash. Ne potvrđuju nezavisno put integracije sinteze za verziju 3.1.
Bilten BIG CHANGE
Šira slika. Vašim tempom.
Nedavne priče o veštačkoj inteligenciji i robotici, promene vredne praćenja i praktične ideje za primenu. Izaberite dnevni pregled, nedeljni sažetak ili mesečnu perspektivu.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Vaša privatnost, vaš izbor.
Neophodno skladište doprinosi bezbednosti sajta i pamti vaše izbore. Opcioni Google Analytics ostaje isključen dok ga ne dozvolite. Sve članke možete čitati samo uz neophodno skladištenje podataka. Detalji o privatnosti