Тим Qwen компаније Alibaba представио је пет модела Qwen Audio 3.1 за транскрипцију, генерисање говора и гласовну интеракцију уживо. За ASR, TTS-Next и Realtime Plus документовани су хостовани крајњи сервиси. TTS Flash има објављен ID модела и цену, али непотпунију документацију о интеграцији; у јавним документима за програмере које је прегледао BIG CHANGE нису наведени ID модела, регион ни цена за ASR-Next.

The Decoder је пренео да Qwen најављује снижења од око 70% за текст у говор, 85% за аудио у реалном времену и до 95% за препознавање говора. При провери тих цифара важне су јединице наплате.

Велика промена

  • Шта се променило: Qwen сада обухвата више функција говорног производа у оквиру једне хостоване породице — од транскрипције и генерисаног говора до стварања звучних амбијената и разговора уживо. Документација за приступ програмерима још није подједнако потпуна за свих пет компоненти.
  • Зашто је важно: Програмерима који планирају трошкове транскрипције или гласовних услуга минут звука више није довољан за одређивање цене сваког API крајњег сервиса. Наплата ASR-а по токенима обухвата и долазни звук и добијени текст; разговор уживо има четири засебно наплаћена тока.
  • Шта треба пратити: Поред приступа ASR-Next-у, пратите да ли независна тестирања језика и кашњења потврђују стварну уштеду. Ако је потврде, шира питања су да ли ће добављачи гласовних агената, транскрипције и синхронизације пренети уштеде на купце и да ли ће конкуренти у говорним API-јима следити пример.

Пет модела на једном месту

Најављени модел

Намењени задатак

Документовани приступ на дан 23. септембра

Цена и практично ограничење

Qwen Audio 3.1 ASR

Стриминг, транскрипција датотека и кратких снимака; опционално означавање говорника за датотеке и кратке снимке

Хостовани WebSocket или HTTP API-ји у Сингапуру и Пекингу. У међународном водичу наведено је 30 језика и 10 варијанти кинеских дијалеката.

У Сингапуру цена се креће од $0,15 за милион улазних аудио-токена + $0,47 за милион излазних текстуалних токена за датотеке и кратке снимке до $0,93 + $0,70 за стриминг и поруке. Транскрипција датотека подржава највише 12 сати и 2 GB; кратки снимци највише 5 минута и 2 GB.

Qwen Audio 3.1 ASR-Next

Приписивање говора одређеном говорнику и временске ознаке, уз препознавање емоција, амбијенталних догађаја и звукова машина

Qwen га је најавио; у актуелној документацији Model Studio-а и QwenCloud-а није пронађен јавни ID API модела, регион, цена нити ограничење

Није јавно документовано

Qwen Audio 3.1 TTS

Вишејезични говор, пренос гласа између језика и управљање изговором помоћу упутстава

qwen-audio-3.1-tts-flash наведен је у обавештењу Alibaba-е о ценама. У прегледаном API-ју за клонирање гласа и даље се наводи TTS Flash 3.0.

Сингапур: $0,23 за милион улазних текстуалних токена + $1,87 за милион излазних аудио-токена. У прегледаним материјалима за модел 3.1 нису наведена актуелна јавна ограничења.

Qwen Audio 3.1 TTS-Next

Заједничко генерисање говора, звучних ефеката и позадинског звука

Хостовани HTTPS API без стриминга у Пекингу, документован за кинески и енглески језик

$0,848 за милион улазних токена + $1,696 за милион излазних токена. Највише 3.000 улазних знакова; до четири минута за подкаст, два минута за остале излазе.

Qwen Audio 3.1 Realtime Plus

Гласовни разговор у пуном дуплексу са прекидањем и позивима алата

Хостовани WebSocket API у Сингапуру и Пекингу. У водичу је наведено 11 језика.

Сингапур: $0,80 за милион улазних текстуалних, $6,40 за милион улазних аудио, $6,40 за милион излазних текстуалних и $24 за милион излазних аудио-токена. Чува до 50 аудио-размена или 300 секунди историје звука.

Ово су производи хостованог API-ја. BIG CHANGE није пронашао тежине модела 3.1 за преузимање нити лиценцу за тежине модела. MIT лиценца у GitHub репозиторијуму QwenAudio-а односи се на веб-сајт пројекта, па је не треба сматрати лиценцом за моделе.

И број језика зависи од документа. У провереној објави о представљању тим Qwen наводи да ASR подржава 30 језика и 16 кинеских дијалеката; у међународном водичу за API наведено је 30 језика и 10 варијанти дијалеката. Програмери треба да користе списак који важи за крајњи сервис ком заиста могу да приступе.

Тврдња о снижењу од 95% не поклапа се са јавном табелом цена

Обавештење Alibaba-е о промени цена ступило је на снагу 22. септембра. Тачно поређење у њему односи се на qwen-audio-3.0-realtime-flash, а не на нови Realtime Plus 3.1. Снижења цена у Сингапуру израчуната су формулом (стара цена − нова цена) / стара цена:

Стрим Realtime Flash-а

Пре (USD)

После (USD)

Снижење

Улазни текст, за милион токена

$0,45

$0,23

48,89%

Улазни звук, за милион токена

$4,50

$0,93

79,33%

Излазни текст, за милион токена

$4,50

$0,70

84,44%

Излаз (текст + звук), за милион токена

$15,00

$1,87

87,53%

Истим обавештењем TTS Flash 3.1 прелази са цене од $0,15 за 10.000 знакова на засебне цене улазних и излазних токена. На актуелној страници са ценама ASR 3.1 такође се наплаћује по улазним и излазним токенима, док се ASR 3.0 наплаћује по секунди звука, а излаз је бесплатан. Проценат уштеде код било ког поређења зависи од текста, трајања звука и токенизације. Зато се на основу овде прегледаних јавних табела не може поновити тачно снижење од 95% за ASR.

Независни докази и даље се односе на Qwen 3.0

У изворима прегледаним на дан представљања није било независног теста пет модела 3.1. На страници Qwen-овог ASR пројекта пријављени су резултати тестирања, али пише да нису независно поновљени.

Artificial Analysis рангира Qwen Audio 3.0 TTS Plus на другом месту у својој ранг-листи гласовних услуга (сви акценти и категорије) са 1.259 Elo, интервалом поузданости од 95% од плус-минус 17 и 1.447 слепих поређења. У засебној арени говорних агената Qwen Audio 3.0 Realtime Plus остварио је 699 Elo преференција, уз 1,54 секунде до првог звука. Учесници пореде скривене моделе у разговорима уживо према задатим сценаријима.