Alibabaov tim Qwen predstavio je pet modela Qwen Audio 3.1 za transkripciju, generisanje govora i glasovne razgovore uživo. Za ASR, TTS-Next i Realtime Plus dokumentovani su hostovani API-jevi. TTS Flash ima objavljen ID modela i cenu, ali nepotpuniju dokumentaciju za integraciju; u javnim dokumentima za razvoj koje je pregledao BIG CHANGE, ASR-Next nema ID modela, region ni cenu.
Sajt The Decoder izvestio je da Qwen najavljuje sniženje cena od oko 70% za pretvaranje teksta u govor, 85% za zvuk u realnom vremenu i do 95% za prepoznavanje govora. Obračunske jedinice su važne pri proveri tih brojki.
Najvažnija promena
- Šta se menja: Qwen sada objedinjuje više funkcija govornog proizvoda u jednu hostovanu porodicu modela: od transkripcije i generisanog govora do stvaranja zvučnih pejzaža i razgovora uživo. Pristup za programere još nije podjednako potpun za svih pet komponenti.
- Zašto je važno: Programerima koji planiraju troškove transkripcije ili govornih usluga minut zvuka više nije dovoljan za cenu svakog krajnjeg API-ja. ASR koji se naplaćuje po tokenu obuhvata i ulazni zvuk i dobijeni tekst, a razgovor uživo ima četiri zasebno naplaćena toka.
- Na šta obratiti pažnju: Pored dostupnosti ASR-Next-a, pratite da li nezavisni testovi jezika i kašnjenja potvrđuju korisne uštede. Ako ih potvrde, šire pitanje je da li pružaoci glasovnih agenata, transkripcije i sinhronizacije prenose te uštede na cene za korisnike i da li ih prate konkurentski govorni API-ji.
Pregled pet modela
Najavljeni model | Namena | Dokumentovani pristup na dan 23. septembra | Cena i praktično ograničenje |
|---|---|---|---|
Qwen Audio 3.1 ASR | Striming, transkripcija datoteka i kratkih snimaka; opcionalno razdvajanje govornika za datoteke i kratke snimke | Hostovani WebSocket ili HTTP API-ji u Singapuru i Pekingu. Međunarodni vodič navodi 30 jezika i 10 varijeteta kineskog. | Cene u Singapuru kreću se od 0,15 USD po milionu ulaznih audio-tokena + 0,47 USD po milionu izlaznih tekstualnih tokena za transkripciju datoteka i kratkih snimaka do 0,93 USD + 0,70 USD za striming i poruku. Transkripcija datoteka podržava do 12 sati i 2 GB; kratki snimci do 5 minuta i 2 GB. |
Qwen Audio 3.1 ASR-Next | Određivanje govornika i vremenskih oznaka, uz prepoznavanje emocija, zvukova okruženja i mašinskih zvukova | Qwen ga je najavio; u aktuelnoj dokumentaciji za Model Studio i QwenCloud nije pronađen javni ID API modela, region, cena ni ograničenje. | Nije javno dokumentovano |
Qwen Audio 3.1 TTS | Višejezični govor, prenos glasa između jezika i upravljanje načinom govora pomoću prompta | | Cene u Singapuru: 0,23 USD po milionu ulaznih tekstualnih tokena + 1,87 USD po milionu izlaznih audio-tokena. U pregledanim materijalima za 3.1 nisu navedena aktuelna javna ograničenja. |
Qwen Audio 3.1 TTS-Next | Zajedničko generisanje govora, efekata i pozadinskog zvuka | Hostovani HTTPS API bez striminga u Pekingu, dokumentovan za kineski i engleski jezik | 0,848 USD po milionu ulaznih tokena + 1,696 USD po milionu izlaznih tokena. Do 3.000 ulaznih znakova; podkast do četiri minuta, a ostali sadržaji do dva minuta. |
Qwen Audio 3.1 Realtime Plus | Glasovni razgovor sa dvosmernim prenosom u realnom vremenu, prekidanjem i pozivima alata | Hostovani WebSocket API u Singapuru i Pekingu. Vodič navodi 11 jezika. | Cene u Singapuru: 0,80 USD po milionu ulaznih tekstualnih tokena, 6,40 USD po milionu ulaznih audio-tokena, 6,40 USD po milionu izlaznih tekstualnih tokena i 24 USD po milionu izlaznih audio-tokena. Čuva do 50 audio-poteza ili 300 sekundi zvučne istorije. |
Ovo su hostovani API proizvodi. BIG CHANGE nije pronašao preuzimljive težine modela 3.1 ni licencu za njih. MIT licenca u QwenAudio GitHub repozitorijumu odnosi se na veb-sajt projekta, pa je ne treba tumačiti kao licencu za modele.
Broj jezika zavisi i od dokumenta. U Qwenovoj proverenoj objavi o predstavljanju navodi se da ASR pokriva 30 jezika i 16 varijeteta kineskog; međunarodni vodič za API navodi 30 jezika i 10 varijeteta. Programeri treba da se oslanjaju na spisak za krajnji API koji zaista mogu da pozovu.
Tvrdnja o sniženju od 95% ne odgovara javnoj tabeli cena
Alibabina objava o promeni cena stupila je na snagu 22. septembra. Tačno poređenje odnosi se na qwen-audio-3.0-realtime-flash, a ne na novi 3.1 Realtime Plus. Sniženja za Singapur izračunata su ovako: (stara cena − nova cena) / stara cena:
Realtime Flash, striming | Ranije (USD) | Sada (USD) | Sniženje |
|---|---|---|---|
Ulazni tekst, po milionu tokena | $0.45 | $0.23 | 48.89% |
Ulazni zvuk, po milionu tokena | $4.50 | $0.93 | 79.33% |
Izlazni tekst, po milionu tokena | $4.50 | $0.70 | 84.44% |
Izlaz (tekst + zvuk), po milionu tokena | $15.00 | $1.87 | 87.53% |
Ista objava menja i cenu za 3.1 TTS Flash: sa 0,15 dolara na 10.000 znakova na zasebne cene ulaznih i izlaznih tokena. Aktuelna stranica sa cenama takođe prikazuje naplatu 3.1 ASR-a po ulaznim i izlaznim tokenima, dok se 3.0 ASR naplaćuje po sekundi ulaznog zvuka, a izlaz je besplatan. Procenat uštede pri poređenju bilo kog para zavisi od teksta, trajanja zvuka i tokenizacije. Zato pregledane javne tabele ne omogućavaju da se ponovi tačno sniženje ASR-a od 95%.
Nezavisni dokazi i dalje se odnose na Qwen 3.0
U izvorima pregledanim na dan predstavljanja nije bilo nezavisnog testa pet modela 3.1. Qwenova projektna stranica za ASR iznosi rezultate merila, ali navodi da oni nisu nezavisno ponovljeni.
Artificial Analysis rangira model Qwen Audio 3.0 TTS Plus na drugom mestu u svojoj areni za modele u hostovanim govornim servisima (svi akcenti i kategorije), sa 1.259 Elo bodova, intervalom pouzdanosti od plus ili minus 17 i 1.447 uzoraka slepih poređenja. U zasebnoj areni govornih agenata, Qwen Audio 3.0 Realtime Plus ostvario je 699 Elo bodova preferencija uz 1,54 sekunde do prvog zvuka. Učesnici u razgovorima uživo porede skrivene modele u zadatim scenarijima.



