AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 étoffe son offre vocale. La baisse de prix de 95 % doit être nuancée
> Qwen Audio 3.1 ajoute la création et la compréhension audio. La documentation de son API est inégale, et le changement d’unité de facturation complique la vérification des économies annoncées pour la reconnaissance vocale.
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
L’équipe Qwen d’Alibaba a présenté cinq modèles Qwen Audio 3.1 couvrant la transcription, la génération de parole et les échanges vocaux en direct. Les points d’accès hébergés d’ASR, TTS-Next et Realtime Plus sont documentés. TTS Flash a un identifiant de modèle et un prix publiés, mais sa documentation d’intégration est moins complète ; les documents de développement publics consultés par BIG CHANGE ne donnent ni identifiant de modèle, ni région, ni tarif pour ASR-Next.
[The Decoder a rapporté](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) les baisses annoncées par Qwen : environ 70 % pour la synthèse vocale, 85 % pour l’audio en temps réel et jusqu’à 95 % pour la reconnaissance vocale. Les unités de facturation sont essentielles pour vérifier ces chiffres.
## Le grand changement
- **Ce qui a changé :** Qwen propose désormais une gamme hébergée plus complète pour les produits vocaux, de la transcription et de la parole générée à la production de scènes sonores et aux conversations en direct. L’accès pour les développeurs n’est toutefois pas aussi complet pour chacun des cinq composants.
- **Pourquoi c’est important :** Pour établir le budget des services de transcription ou de voix, le prix à la minute ne suffit plus à comparer chaque point d’accès. La facturation d’ASR par jetons inclut à la fois l’audio reçu et le texte obtenu ; les conversations en direct comportent quatre flux tarifés séparément.
- **À suivre :** En plus de l’accès à ASR-Next, il faudra voir si des tests indépendants des langues et de la latence confirment des économies utiles. Le cas échéant, la question sera de savoir si les services d’agents vocaux, de transcription et de doublage répercutent ces économies sur leurs clients, et si les API vocales concurrentes suivent la même voie.
## Les cinq modèles en un coup d’œil
| Modèle annoncé | Fonction prévue | Accès documenté au 23 septembre | Prix et limite pratique |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Transcription en flux, à partir de fichiers et de courts extraits ; diarisation facultative des locuteurs pour les points d’accès fichier et court format | API WebSocket ou HTTP hébergées à Singapour et à Pékin. Le [guide international](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) répertorie 30 langues et 10 variétés dialectales du chinois. | À Singapour, les tarifs vont de **0,15 $/M de jetons audio en entrée + 0,47 $/M de jetons texte en sortie** pour les fichiers et les courts extraits, à **0,93 $/M de jetons audio en entrée + 0,70 $/M de jetons texte en sortie** pour la diffusion en flux et les messages. La transcription de fichiers accepte jusqu’à 12 heures et 2 Go ; le court format, jusqu’à 5 minutes et 2 Go. |
| **Qwen Audio 3.1 ASR-Next** | Attribution du locuteur et horodatages, ainsi que reconnaissance des émotions, des événements ambiants et des sons de machines | Modèle annoncé par Qwen ; aucun identifiant de modèle API, région, tarif ou limite n’a été trouvé dans la documentation actuelle de Model Studio et de QwenCloud | **Non documenté publiquement** |
| **Qwen Audio 3.1 TTS** | Parole multilingue, transfert de voix entre langues et contrôle du débit et de l’intonation par consigne | `qwen-audio-3.1-tts-flash` apparaît dans l’avis tarifaire d’Alibaba. L’[API de clonage vocal](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) consultée mentionne encore le modèle 3.0 TTS Flash. | À Singapour : **0,23 $/M de jetons texte en entrée + 1,87 $/M de jetons audio en sortie**. Les documents publics consultés sur la version 3.1 ne précisaient pas les limites actuelles. |
| **Qwen Audio 3.1 TTS-Next** | Génération conjointe de parole, d’effets et d’ambiance sonore | API HTTPS hébergée à Pékin, sans diffusion en flux, documentée pour le chinois et l’anglais | **0,848 $/M de jetons en entrée + 1,696 $/M de jetons en sortie**. Jusqu’à 3 000 caractères en entrée ; quatre minutes de sortie pour un podcast, deux minutes dans les autres cas. |
| **Qwen Audio 3.1 Realtime Plus** | Conversation vocale en duplex intégral, avec interruptions et appels d’outils | API WebSocket hébergée à Singapour et à Pékin. Le [guide](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) répertorie 11 langues. | À Singapour : **0,80 $/M de jetons texte en entrée, 6,40 $/M de jetons audio en entrée, 6,40 $/M de jetons texte en sortie et 24 $/M de jetons audio en sortie**. L’historique peut contenir jusqu’à 50 tours audio ou 300 secondes d’audio. |
Il s’agit de produits API hébergés. BIG CHANGE n’a trouvé ni poids de modèle 3.1 téléchargeables ni licence correspondante. La licence MIT du dépôt GitHub de QwenAudio couvre le site du projet ; il ne faut donc pas l’interpréter comme une licence des modèles.
Le nombre de langues varie aussi selon le document. La [publication de lancement vérifiée de Qwen](https://www.sina.cn/news/detail/5346330620985983.html) indique qu’ASR couvre 30 langues et 16 dialectes chinois ; le guide international de l’API mentionne 30 langues et 10 variétés dialectales. Les développeurs doivent se référer à la liste correspondant au point d’accès qu’ils peuvent réellement appeler.
## La baisse de 95 % ne correspond pas directement au tableau des tarifs publics
L’[avis de modification tarifaire d’Alibaba](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) est entré en vigueur le 22 septembre. La comparaison détaillée porte sur `qwen-audio-3.0-realtime-flash`, et non le nouveau modèle Realtime Plus 3.1. Les baisses de tarifs à Singapour se calculent ainsi : (ancien tarif − nouveau tarif) / ancien tarif :
| Realtime Flash en flux | Avant (USD) | Après (USD) | Baisse |
| --- | --- | --- | --- |
| Entrée texte, par million de jetons | 0,45 $ | 0,23 $ | 48,89 % |
| Entrée audio, par million de jetons | 4,50 $ | 0,93 $ | 79,33 % |
| Sortie texte, par million de jetons | 4,50 $ | 0,70 $ | 84,44 % |
| Sortie (texte + audio), par million de jetons | 15,00 $ | 1,87 $ | **87,53 %** |
Le même avis fait passer 3.1 TTS Flash d’un tarif de 0,15 $ par 10 000 caractères à des tarifs distincts par jeton d’entrée et de sortie. La [page tarifaire actuelle](https://www.alibabacloud.com/help/en/model-studio/model-pricing) répertorie également ASR 3.1 avec une facturation par jetons d’entrée et de sortie, tandis qu’ASR 3.0 facture à la seconde audio et offre la sortie gratuitement. Le pourcentage de baisse entre ces deux structures dépend du texte, de la durée audio et de la tokenisation. Les tableaux publics examinés ne permettent donc pas de reproduire exactement une baisse de 95 % pour ASR.
## Les résultats indépendants concernent encore Qwen 3.0
Aucun test indépendant des cinq modèles 3.1 n’était disponible parmi les sources examinées le jour du lancement. La [page du projet ASR de Qwen](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) publie des résultats de benchmark, mais précise qu’ils n’ont pas été reproduits de façon indépendante.
Artificial Analysis classe le [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) au deuxième rang de son classement de voix proposées par des fournisseurs (tous accents et catégories confondus), avec un score Arena Elo de 1 259, un intervalle de confiance à 95 % de plus ou moins 17 et 1 447 comparaisons à l’aveugle. Dans un [classement distinct des agents vocaux](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), Qwen Audio 3.0 Realtime Plus a obtenu un score de préférence Elo de 699 et un délai de 1,54 seconde avant le premier son. Les participants y comparent des modèles masqués dans des conversations en direct suivant des scénarios attribués.
## Sources
- [Alibaba lance Qwen Audio 3.1 avec cinq nouveaux modèles](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Article de présentation résumant le lancement des cinq modèles et attribuant à Qwen les réductions approximatives de tarifs pour la synthèse vocale, l’audio en temps réel et la reconnaissance vocale. BIG CHANGE a vérifié les tarifs à l’aide des tableaux d’Alibaba.
- [Annonce de lancement de Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Publication vérifiée du compte Qwen nommant les cinq modèles et leurs fonctions prévues. Les affirmations sur les capacités et la vitesse restent celles du fournisseur.
- [Avis de réduction des tarifs Model Studio pour certains modèles audio](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Modification officielle des tarifs du 22 septembre, avec les tarifs exacts à Singapour avant et après pour 3.0 Realtime Flash, ainsi qu’un changement d’unité de facturation pour 3.1 TTS Flash.
- [Tarifs des modèles Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Tarification officielle actuelle par modèle, modalité et région, notamment pour ASR 3.1 et Realtime Plus.
- [Modèles de reconnaissance vocale QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Identifiants actuels des points d’accès ASR, modes d’accès, listes de langues, prise en charge de la diarisation et limites de durée.
- [Discussion audio en temps réel dans QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Exemple WebSocket actuel de Realtime Plus 3.1, prise en charge des voix et des langues, et limites de conservation des conversations.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Disponibilité officielle de l’API à Pékin uniquement, tarifs, langues, longueur maximale en entrée et limites de durée en sortie.
- [Page du projet Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Page figée du projet Qwen décrivant les capacités d’ASR et d’ASR-Next ainsi que les benchmarks du fournisseur ; elle précise que les résultats n’ont pas été reproduits de façon indépendante.
- [Classement Text to Speech d’Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Résultat de préférence à l’aveugle pour le modèle précédent Qwen Audio 3.0 TTS Plus, avec le nombre d’échantillons et l’intervalle de confiance.
- [Speech Agent Arena d’Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Résultats distincts de préférence et de délai avant le premier son pour Qwen Audio 3.0 Realtime Plus ; ils ne constituent pas une évaluation de la version 3.1.
- [Référence API HTTP de clonage vocal](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Les exemples actuels de modèle cible mentionnent 3.0 TTS Flash. Ils ne confirment pas de manière indépendante l’existence d’un parcours d’intégration pour la synthèse 3.1.
La newsletter BIG CHANGE
Prendre du recul, à votre rythme.
Articles récents sur l’IA et la robotique, évolutions à surveiller et idées pratiques à utiliser. Choisissez un briefing quotidien, une synthèse hebdomadaire ou une analyse mensuelle.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Votre vie privée, votre choix.
Le stockage nécessaire contribue à la sécurité du site et mémorise vos choix. Google Analytics facultatif reste désactivé tant que vous ne l’autorisez pas. Vous pouvez lire tous les articles avec le seul stockage nécessaire. Détails sur la confidentialité