AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 проширује понуду гласовних модела. Контекст је важан за снижење цене од 95%
> Qwen Audio 3.1 додаје стварање и препознавање звука. Документација API-ја је неуједначена, а промена јединица наплате отежава проверу најављене уштеде од 95% за препознавање говора.
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Тим Qwen компаније Alibaba представио је пет модела Qwen Audio 3.1 за транскрипцију, генерисање говора и гласовну интеракцију уживо. За ASR, TTS-Next и Realtime Plus документовани су хостовани крајњи сервиси. TTS Flash има објављен ID модела и цену, али непотпунију документацију о интеграцији; у јавним документима за програмере које је прегледао BIG CHANGE нису наведени ID модела, регион ни цена за ASR-Next.
[The Decoder је пренео](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) да Qwen најављује снижења од око 70% за текст у говор, 85% за аудио у реалном времену и до 95% за препознавање говора. При провери тих цифара важне су јединице наплате.
## Велика промена
- **Шта се променило:** Qwen сада обухвата више функција говорног производа у оквиру једне хостоване породице — од транскрипције и генерисаног говора до стварања звучних амбијената и разговора уживо. Документација за приступ програмерима још није подједнако потпуна за свих пет компоненти.
- **Зашто је важно:** Програмерима који планирају трошкове транскрипције или гласовних услуга минут звука више није довољан за одређивање цене сваког API крајњег сервиса. Наплата ASR-а по токенима обухвата и долазни звук и добијени текст; разговор уживо има четири засебно наплаћена тока.
- **Шта треба пратити:** Поред приступа ASR-Next-у, пратите да ли независна тестирања језика и кашњења потврђују стварну уштеду. Ако је потврде, шира питања су да ли ће добављачи гласовних агената, транскрипције и синхронизације пренети уштеде на купце и да ли ће конкуренти у говорним API-јима следити пример.
## Пет модела на једном месту
| Најављени модел | Намењени задатак | Документовани приступ на дан 23. септембра | Цена и практично ограничење |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Стриминг, транскрипција датотека и кратких снимака; опционално означавање говорника за датотеке и кратке снимке | Хостовани WebSocket или HTTP API-ји у Сингапуру и Пекингу. У [међународном водичу](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) наведено је 30 језика и 10 варијанти кинеских дијалеката. | У Сингапуру цена се креће од **$0,15 за милион улазних аудио-токена + $0,47 за милион излазних текстуалних токена** за датотеке и кратке снимке до **$0,93 + $0,70** за стриминг и поруке. Транскрипција датотека подржава највише 12 сати и 2 GB; кратки снимци највише 5 минута и 2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Приписивање говора одређеном говорнику и временске ознаке, уз препознавање емоција, амбијенталних догађаја и звукова машина | Qwen га је најавио; у актуелној документацији Model Studio-а и QwenCloud-а није пронађен јавни ID API модела, регион, цена нити ограничење | **Није јавно документовано** |
| **Qwen Audio 3.1 TTS** | Вишејезични говор, пренос гласа између језика и управљање изговором помоћу упутстава | `qwen-audio-3.1-tts-flash` наведен је у обавештењу Alibaba-е о ценама. У прегледаном [API-ју за клонирање гласа](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) и даље се наводи TTS Flash 3.0. | Сингапур: **$0,23 за милион улазних текстуалних токена + $1,87 за милион излазних аудио-токена**. У прегледаним материјалима за модел 3.1 нису наведена актуелна јавна ограничења. |
| **Qwen Audio 3.1 TTS-Next** | Заједничко генерисање говора, звучних ефеката и позадинског звука | Хостовани HTTPS API без стриминга у Пекингу, документован за кинески и енглески језик | **$0,848 за милион улазних токена + $1,696 за милион излазних токена**. Највише 3.000 улазних знакова; до четири минута за подкаст, два минута за остале излазе. |
| **Qwen Audio 3.1 Realtime Plus** | Гласовни разговор у пуном дуплексу са прекидањем и позивима алата | Хостовани WebSocket API у Сингапуру и Пекингу. У [водичу](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) је наведено 11 језика. | Сингапур: **$0,80 за милион улазних текстуалних, $6,40 за милион улазних аудио, $6,40 за милион излазних текстуалних и $24 за милион излазних аудио-токена**. Чува до 50 аудио-размена или 300 секунди историје звука. |
Ово су производи хостованог API-ја. BIG CHANGE није пронашао тежине модела 3.1 за преузимање нити лиценцу за тежине модела. MIT лиценца у GitHub репозиторијуму QwenAudio-а односи се на веб-сајт пројекта, па је не треба сматрати лиценцом за моделе.
И број језика зависи од документа. У [провереној објави о представљању](https://www.sina.cn/news/detail/5346330620985983.html) тим Qwen наводи да ASR подржава 30 језика и 16 кинеских дијалеката; у међународном водичу за API наведено је 30 језика и 10 варијанти дијалеката. Програмери треба да користе списак који важи за крајњи сервис ком заиста могу да приступе.
## Тврдња о снижењу од 95% не поклапа се са јавном табелом цена
Обавештење Alibaba-е о [промени цена](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) ступило је на снагу 22. септембра. Тачно поређење у њему односи се на `qwen-audio-3.0-realtime-flash`, а не на нови Realtime Plus 3.1. Снижења цена у Сингапуру израчуната су формулом (стара цена − нова цена) / стара цена:
| Стрим Realtime Flash-а | Пре (USD) | После (USD) | Снижење |
| --- | --- | --- | --- |
| Улазни текст, за милион токена | $0,45 | $0,23 | 48,89% |
| Улазни звук, за милион токена | $4,50 | $0,93 | 79,33% |
| Излазни текст, за милион токена | $4,50 | $0,70 | 84,44% |
| Излаз (текст + звук), за милион токена | $15,00 | $1,87 | **87,53%** |
Истим обавештењем TTS Flash 3.1 прелази са цене од $0,15 за 10.000 знакова на засебне цене улазних и излазних токена. На [актуелној страници са ценама](https://www.alibabacloud.com/help/en/model-studio/model-pricing) ASR 3.1 такође се наплаћује по улазним и излазним токенима, док се ASR 3.0 наплаћује по секунди звука, а излаз је бесплатан. Проценат уштеде код било ког поређења зависи од текста, трајања звука и токенизације. Зато се на основу овде прегледаних јавних табела не може поновити тачно снижење од 95% за ASR.
## Независни докази и даље се односе на Qwen 3.0
У изворима прегледаним на дан представљања није било независног теста пет модела 3.1. На [страници Qwen-овог ASR пројекта](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) пријављени су резултати тестирања, али пише да нису независно поновљени.
Artificial Analysis рангира [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) на другом месту у својој ранг-листи гласовних услуга (сви акценти и категорије) са 1.259 Elo, интервалом поузданости од 95% од плус-минус 17 и 1.447 слепих поређења. У засебној [арени говорних агената](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) Qwen Audio 3.0 Realtime Plus остварио је 699 Elo преференција, уз 1,54 секунде до првог звука. Учесници пореде скривене моделе у разговорима уживо према задатим сценаријима.
## Sources
- [Alibaba представља Qwen Audio 3.1 са пет нових модела](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Извештај о представљању сумира пет модела и Qwen-у приписује приближна снижења цена TTS-а, звука у реалном времену и ASR-а. BIG CHANGE је проверио цене према табелама саме Alibaba-е.
- [Објава Qwen Audio 3.1 о представљању](https://www.sina.cn/news/detail/5346330620985983.html) — Проверена објава званичног налога Qwen-а која наводи пет модела и њихове намене. Тврдње о способностима и брзини остају тврдње произвођача.
- [Обавештење Model Studio-а о снижењу цена одабраних аудио-модела](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Званична промена цена од 22. септембра, са тачним ценама Realtime Flash-а 3.0 у Сингапуру пре и после промене и новом јединицом наплате за TTS Flash 3.1.
- [Цене модела Model Studio-а](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Актуелне званичне цене по моделу, начину рада и региону, укључујући ASR 3.1 и Realtime Plus.
- [QwenCloud модели за претварање говора у текст](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Актуелни ID-јеви ASR крајњих сервиса, начини приступа, спискови језика, подршка за означавање говорника и временска ограничења.
- [QwenCloud: аудио-разговор у реалном времену](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Актуелни WebSocket пример за Realtime Plus 3.1, подршка за гласове и језике и ограничења чувања разговора.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Званично описана доступност API-ја само у Пекингу, цене, језици, ограничења улазног текста и трајања излаза.
- [Страница Qwen-овог ASR пројекта за Qwen Audio 3.1](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Непроменљива страница пројекта Qwen-а о могућностима ASR-а и ASR-Next-а и резултатима тестова које наводи произвођач; пише да резултати нису независно поновљени.
- [Ранг-листа Artificial Analysis-а за претварање текста у говор](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Слепо мерење преференција за претходни модел Qwen Audio 3.0 TTS Plus, укључујући број узорака и интервал поузданости.
- [Artificial Analysis: арена говорних агената](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Засебни резултати преференција и времена до првог звука за Qwen Audio 3.0 Realtime Plus; нису оцена верзије 3.1.
- [HTTP API за клонирање гласа: референтна документација](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Примери за тренутни циљни модел наводе TTS Flash 3.0. Они не потврђују независно пут интеграције за синтезу у верзији 3.1.
Билтен BIG CHANGE
Шира слика. Вашим темпом.
Недавне приче о вештачкој интелигенцији и роботици, промене вредне праћења и практичне идеје за примену. Изаберите дневни преглед, недељни сажетак или месечну перспективу.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Ваша приватност, ваш избор.
Неопходно складиште доприноси безбедности сајта и памти ваше изборе. Опционални Google Analytics остаје искључен док га не дозволите. Све чланке можете читати само уз неопходно складиштење података. Детаљи о приватности