Тим Qwen компаније Alibaba представио је пет модела Qwen Audio 3.1 за транскрипцију, генерисање говора и гласовну интеракцију уживо. За ASR, TTS-Next и Realtime Plus документовани су хостовани крајњи сервиси. TTS Flash има објављен ID модела и цену, али непотпунију документацију о интеграцији; у јавним документима за програмере које је прегледао BIG CHANGE нису наведени ID модела, регион ни цена за ASR-Next.
The Decoder је пренео да Qwen најављује снижења од око 70% за текст у говор, 85% за аудио у реалном времену и до 95% за препознавање говора. При провери тих цифара важне су јединице наплате.
Велика промена
- Шта се променило: Qwen сада обухвата више функција говорног производа у оквиру једне хостоване породице — од транскрипције и генерисаног говора до стварања звучних амбијената и разговора уживо. Документација за приступ програмерима још није подједнако потпуна за свих пет компоненти.
- Зашто је важно: Програмерима који планирају трошкове транскрипције или гласовних услуга минут звука више није довољан за одређивање цене сваког API крајњег сервиса. Наплата ASR-а по токенима обухвата и долазни звук и добијени текст; разговор уживо има четири засебно наплаћена тока.
- Шта треба пратити: Поред приступа ASR-Next-у, пратите да ли независна тестирања језика и кашњења потврђују стварну уштеду. Ако је потврде, шира питања су да ли ће добављачи гласовних агената, транскрипције и синхронизације пренети уштеде на купце и да ли ће конкуренти у говорним API-јима следити пример.
Пет модела на једном месту
Најављени модел | Намењени задатак | Документовани приступ на дан 23. септембра | Цена и практично ограничење |
|---|---|---|---|
Qwen Audio 3.1 ASR | Стриминг, транскрипција датотека и кратких снимака; опционално означавање говорника за датотеке и кратке снимке | Хостовани WebSocket или HTTP API-ји у Сингапуру и Пекингу. У међународном водичу наведено је 30 језика и 10 варијанти кинеских дијалеката. | У Сингапуру цена се креће од $0,15 за милион улазних аудио-токена + $0,47 за милион излазних текстуалних токена за датотеке и кратке снимке до $0,93 + $0,70 за стриминг и поруке. Транскрипција датотека подржава највише 12 сати и 2 GB; кратки снимци највише 5 минута и 2 GB. |
Qwen Audio 3.1 ASR-Next | Приписивање говора одређеном говорнику и временске ознаке, уз препознавање емоција, амбијенталних догађаја и звукова машина | Qwen га је најавио; у актуелној документацији Model Studio-а и QwenCloud-а није пронађен јавни ID API модела, регион, цена нити ограничење | Није јавно документовано |
Qwen Audio 3.1 TTS | Вишејезични говор, пренос гласа између језика и управљање изговором помоћу упутстава | | Сингапур: $0,23 за милион улазних текстуалних токена + $1,87 за милион излазних аудио-токена. У прегледаним материјалима за модел 3.1 нису наведена актуелна јавна ограничења. |
Qwen Audio 3.1 TTS-Next | Заједничко генерисање говора, звучних ефеката и позадинског звука | Хостовани HTTPS API без стриминга у Пекингу, документован за кинески и енглески језик | $0,848 за милион улазних токена + $1,696 за милион излазних токена. Највише 3.000 улазних знакова; до четири минута за подкаст, два минута за остале излазе. |
Qwen Audio 3.1 Realtime Plus | Гласовни разговор у пуном дуплексу са прекидањем и позивима алата | Хостовани WebSocket API у Сингапуру и Пекингу. У водичу је наведено 11 језика. | Сингапур: $0,80 за милион улазних текстуалних, $6,40 за милион улазних аудио, $6,40 за милион излазних текстуалних и $24 за милион излазних аудио-токена. Чува до 50 аудио-размена или 300 секунди историје звука. |
Ово су производи хостованог API-ја. BIG CHANGE није пронашао тежине модела 3.1 за преузимање нити лиценцу за тежине модела. MIT лиценца у GitHub репозиторијуму QwenAudio-а односи се на веб-сајт пројекта, па је не треба сматрати лиценцом за моделе.
И број језика зависи од документа. У провереној објави о представљању тим Qwen наводи да ASR подржава 30 језика и 16 кинеских дијалеката; у међународном водичу за API наведено је 30 језика и 10 варијанти дијалеката. Програмери треба да користе списак који важи за крајњи сервис ком заиста могу да приступе.
Тврдња о снижењу од 95% не поклапа се са јавном табелом цена
Обавештење Alibaba-е о промени цена ступило је на снагу 22. септембра. Тачно поређење у њему односи се на qwen-audio-3.0-realtime-flash, а не на нови Realtime Plus 3.1. Снижења цена у Сингапуру израчуната су формулом (стара цена − нова цена) / стара цена:
Стрим Realtime Flash-а | Пре (USD) | После (USD) | Снижење |
|---|---|---|---|
Улазни текст, за милион токена | $0,45 | $0,23 | 48,89% |
Улазни звук, за милион токена | $4,50 | $0,93 | 79,33% |
Излазни текст, за милион токена | $4,50 | $0,70 | 84,44% |
Излаз (текст + звук), за милион токена | $15,00 | $1,87 | 87,53% |
Истим обавештењем TTS Flash 3.1 прелази са цене од $0,15 за 10.000 знакова на засебне цене улазних и излазних токена. На актуелној страници са ценама ASR 3.1 такође се наплаћује по улазним и излазним токенима, док се ASR 3.0 наплаћује по секунди звука, а излаз је бесплатан. Проценат уштеде код било ког поређења зависи од текста, трајања звука и токенизације. Зато се на основу овде прегледаних јавних табела не може поновити тачно снижење од 95% за ASR.
Независни докази и даље се односе на Qwen 3.0
У изворима прегледаним на дан представљања није било независног теста пет модела 3.1. На страници Qwen-овог ASR пројекта пријављени су резултати тестирања, али пише да нису независно поновљени.
Artificial Analysis рангира Qwen Audio 3.0 TTS Plus на другом месту у својој ранг-листи гласовних услуга (сви акценти и категорије) са 1.259 Elo, интервалом поузданости од 95% од плус-минус 17 и 1.447 слепих поређења. У засебној арени говорних агената Qwen Audio 3.0 Realtime Plus остварио је 699 Elo преференција, уз 1,54 секунде до првог звука. Учесници пореде скривене моделе у разговорима уживо према задатим сценаријима.



