L’équipe Qwen d’Alibaba a présenté cinq modèles Qwen Audio 3.1 couvrant la transcription, la génération de parole et les échanges vocaux en direct. Les points d’accès hébergés d’ASR, TTS-Next et Realtime Plus sont documentés. TTS Flash a un identifiant de modèle et un prix publiés, mais sa documentation d’intégration est moins complète ; les documents de développement publics consultés par BIG CHANGE ne donnent ni identifiant de modèle, ni région, ni tarif pour ASR-Next.

The Decoder a rapporté les baisses annoncées par Qwen : environ 70 % pour la synthèse vocale, 85 % pour l’audio en temps réel et jusqu’à 95 % pour la reconnaissance vocale. Les unités de facturation sont essentielles pour vérifier ces chiffres.

Le grand changement

  • Ce qui a changé : Qwen propose désormais une gamme hébergée plus complète pour les produits vocaux, de la transcription et de la parole générée à la production de scènes sonores et aux conversations en direct. L’accès pour les développeurs n’est toutefois pas aussi complet pour chacun des cinq composants.
  • Pourquoi c’est important : Pour établir le budget des services de transcription ou de voix, le prix à la minute ne suffit plus à comparer chaque point d’accès. La facturation d’ASR par jetons inclut à la fois l’audio reçu et le texte obtenu ; les conversations en direct comportent quatre flux tarifés séparément.
  • À suivre : En plus de l’accès à ASR-Next, il faudra voir si des tests indépendants des langues et de la latence confirment des économies utiles. Le cas échéant, la question sera de savoir si les services d’agents vocaux, de transcription et de doublage répercutent ces économies sur leurs clients, et si les API vocales concurrentes suivent la même voie.

Les cinq modèles en un coup d’œil

Modèle annoncé

Fonction prévue

Accès documenté au 23 septembre

Prix et limite pratique

Qwen Audio 3.1 ASR

Transcription en flux, à partir de fichiers et de courts extraits ; diarisation facultative des locuteurs pour les points d’accès fichier et court format

API WebSocket ou HTTP hébergées à Singapour et à Pékin. Le guide international répertorie 30 langues et 10 variétés dialectales du chinois.

À Singapour, les tarifs vont de 0,15 $/M de jetons audio en entrée + 0,47 $/M de jetons texte en sortie pour les fichiers et les courts extraits, à 0,93 $/M de jetons audio en entrée + 0,70 $/M de jetons texte en sortie pour la diffusion en flux et les messages. La transcription de fichiers accepte jusqu’à 12 heures et 2 Go ; le court format, jusqu’à 5 minutes et 2 Go.

Qwen Audio 3.1 ASR-Next

Attribution du locuteur et horodatages, ainsi que reconnaissance des émotions, des événements ambiants et des sons de machines

Modèle annoncé par Qwen ; aucun identifiant de modèle API, région, tarif ou limite n’a été trouvé dans la documentation actuelle de Model Studio et de QwenCloud

Non documenté publiquement

Qwen Audio 3.1 TTS

Parole multilingue, transfert de voix entre langues et contrôle du débit et de l’intonation par consigne

qwen-audio-3.1-tts-flash apparaît dans l’avis tarifaire d’Alibaba. L’API de clonage vocal consultée mentionne encore le modèle 3.0 TTS Flash.

À Singapour : 0,23 $/M de jetons texte en entrée + 1,87 $/M de jetons audio en sortie. Les documents publics consultés sur la version 3.1 ne précisaient pas les limites actuelles.

Qwen Audio 3.1 TTS-Next

Génération conjointe de parole, d’effets et d’ambiance sonore

API HTTPS hébergée à Pékin, sans diffusion en flux, documentée pour le chinois et l’anglais

0,848 $/M de jetons en entrée + 1,696 $/M de jetons en sortie. Jusqu’à 3 000 caractères en entrée ; quatre minutes de sortie pour un podcast, deux minutes dans les autres cas.

Qwen Audio 3.1 Realtime Plus

Conversation vocale en duplex intégral, avec interruptions et appels d’outils

API WebSocket hébergée à Singapour et à Pékin. Le guide répertorie 11 langues.

À Singapour : 0,80 $/M de jetons texte en entrée, 6,40 $/M de jetons audio en entrée, 6,40 $/M de jetons texte en sortie et 24 $/M de jetons audio en sortie. L’historique peut contenir jusqu’à 50 tours audio ou 300 secondes d’audio.

Il s’agit de produits API hébergés. BIG CHANGE n’a trouvé ni poids de modèle 3.1 téléchargeables ni licence correspondante. La licence MIT du dépôt GitHub de QwenAudio couvre le site du projet ; il ne faut donc pas l’interpréter comme une licence des modèles.

Le nombre de langues varie aussi selon le document. La publication de lancement vérifiée de Qwen indique qu’ASR couvre 30 langues et 16 dialectes chinois ; le guide international de l’API mentionne 30 langues et 10 variétés dialectales. Les développeurs doivent se référer à la liste correspondant au point d’accès qu’ils peuvent réellement appeler.

La baisse de 95 % ne correspond pas directement au tableau des tarifs publics

L’avis de modification tarifaire d’Alibaba est entré en vigueur le 22 septembre. La comparaison détaillée porte sur qwen-audio-3.0-realtime-flash, et non le nouveau modèle Realtime Plus 3.1. Les baisses de tarifs à Singapour se calculent ainsi : (ancien tarif − nouveau tarif) / ancien tarif :

Realtime Flash en flux

Avant (USD)

Après (USD)

Baisse

Entrée texte, par million de jetons

0,45 $

0,23 $

48,89 %

Entrée audio, par million de jetons

4,50 $

0,93 $

79,33 %

Sortie texte, par million de jetons

4,50 $

0,70 $

84,44 %

Sortie (texte + audio), par million de jetons

15,00 $

1,87 $

87,53 %

Le même avis fait passer 3.1 TTS Flash d’un tarif de 0,15 $ par 10 000 caractères à des tarifs distincts par jeton d’entrée et de sortie. La page tarifaire actuelle répertorie également ASR 3.1 avec une facturation par jetons d’entrée et de sortie, tandis qu’ASR 3.0 facture à la seconde audio et offre la sortie gratuitement. Le pourcentage de baisse entre ces deux structures dépend du texte, de la durée audio et de la tokenisation. Les tableaux publics examinés ne permettent donc pas de reproduire exactement une baisse de 95 % pour ASR.

Les résultats indépendants concernent encore Qwen 3.0

Aucun test indépendant des cinq modèles 3.1 n’était disponible parmi les sources examinées le jour du lancement. La page du projet ASR de Qwen publie des résultats de benchmark, mais précise qu’ils n’ont pas été reproduits de façon indépendante.

Artificial Analysis classe le Qwen Audio 3.0 TTS Plus au deuxième rang de son classement de voix proposées par des fournisseurs (tous accents et catégories confondus), avec un score Arena Elo de 1 259, un intervalle de confiance à 95 % de plus ou moins 17 et 1 447 comparaisons à l’aveugle. Dans un classement distinct des agents vocaux, Qwen Audio 3.0 Realtime Plus a obtenu un score de préférence Elo de 699 et un délai de 1,54 seconde avant le premier son. Les participants y comparent des modèles masqués dans des conversations en direct suivant des scénarios attribués.