EL MUNDO NO SE DETIENE.RSS
BIG CHANGE.

Edición en Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 amplía su oferta de voz. La rebaja del 95 % requiere contexto

> Qwen Audio 3.1 añade creación y comprensión de audio. La documentación de su API es desigual y el cambio de unidades de facturación complica el ahorro anunciado para ASR.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

El equipo de Qwen, de Alibaba, ha presentado cinco modelos Qwen Audio 3.1 para transcripción, generación de voz e interacción de voz en directo. ASR, TTS-Next y Realtime Plus tienen endpoints alojados documentados. TTS Flash tiene un ID de modelo y un precio publicados, pero su documentación de integración es menos completa; en los documentos públicos para desarrolladores revisados por BIG CHANGE, ASR-Next no tiene ID de modelo, región ni precio.

[The Decoder informó de](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) las rebajas anunciadas por Qwen: alrededor del 70 % para texto a voz, el 85 % para audio en tiempo real y hasta el 95 % para reconocimiento del habla. Las unidades de facturación importan al comprobar esas cifras.

## El gran cambio

- **Qué cambió:** Qwen cubre ahora una mayor parte de un producto de voz dentro de una misma familia alojada: desde la transcripción y la generación de voz hasta la producción de escenas sonoras y la conversación en directo. Sin embargo, los cinco componentes aún no tienen el mismo nivel de acceso para desarrolladores.
- **Por qué importa:** Para los desarrolladores que presupuestan servicios de transcripción o de voz, ya no basta con conocer los minutos de audio para calcular el precio de cada endpoint. La facturación de ASR por tokens incluye tanto el audio entrante como el texto resultante; la conversación en directo tiene cuatro flujos con precios separados.
- **Qué observar:** Además del acceso a ASR-Next, habrá que ver si pruebas independientes de idiomas y latencia confirman ahorros útiles. Si es así, la pregunta más amplia será si los proveedores de agentes de voz, transcripción y doblaje trasladan esos ahorros a los precios para clientes y si las API de voz competidoras los siguen.

## Mapa de los cinco modelos

| Modelo anunciado | Función prevista | Acceso documentado al 23 de septiembre | Precio y límite práctico |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Transcripción en streaming, de archivos y de formato corto; diarización opcional de hablantes en los endpoints de archivo y formato corto | API alojadas HTTP o WebSocket en Singapur y Pekín. La [guía internacional](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) enumera 30 idiomas y 10 variedades dialectales del chino. | En Singapur, el precio va de **$0.15 por millón de tokens de audio de entrada + $0.47 por millón de tokens de texto de salida** para archivos y transcripciones de formato corto a **$0.93 + $0.70** para streaming y mensajes. La transcripción de archivos permite hasta 12 horas/2 GB; la de formato corto, hasta 5 minutos/2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Atribución de hablantes y marcas de tiempo, además del reconocimiento de emociones, eventos ambientales y sonidos de máquinas | Anunciado por Qwen; no se encontró ningún ID de modelo de API público, región, tarifa ni límite en la documentación actual de Model Studio y QwenCloud | **No documentado públicamente** |
| **Qwen Audio 3.1 TTS** | Voz multilingüe, transferencia de voz entre idiomas y control de la interpretación mediante indicaciones | `qwen-audio-3.1-tts-flash` aparece en el aviso de precios de Alibaba. La [API de clonación de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) revisada todavía identifica TTS Flash 3.0. | Singapur: **$0.23 por millón de tokens de texto de entrada + $1.87 por millón de tokens de audio de salida**. Los materiales de 3.1 revisados no especifican los límites públicos actuales. |
| **Qwen Audio 3.1 TTS-Next** | Generación conjunta de voz, efectos y audio de fondo | API HTTPS alojada sin streaming en Pekín, documentada para chino e inglés | **$0.848 por millón de tokens de entrada + $1.696 por millón de tokens de salida**. Hasta 3.000 caracteres de entrada; cuatro minutos para generar pódcast y dos minutos en los demás casos. |
| **Qwen Audio 3.1 Realtime Plus** | Conversación de voz bidireccional simultánea (full-duplex), con interrupciones y llamadas a herramientas | API WebSocket alojada en Singapur y Pekín. La [guía](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) enumera 11 idiomas. | Singapur: **$0.80 por millón de tokens de texto de entrada, $6.40 por millón de tokens de audio de entrada, $6.40 por millón de tokens de texto de salida y $24 por millón de tokens de audio de salida**. Conserva hasta 50 turnos de audio o 300 segundos de historial de audio. |

Estos son productos de API alojados. BIG CHANGE no encontró pesos de modelos 3.1 disponibles para descarga ni una licencia para esos pesos. La licencia MIT del repositorio de QwenAudio en GitHub cubre el sitio web del proyecto, por lo que no debe interpretarse como una licencia de los modelos.

El recuento de idiomas también depende del documento. La [publicación de lanzamiento verificada de Qwen](https://www.sina.cn/news/detail/5346330620985983.html) dice que ASR cubre 30 idiomas y 16 dialectos del chino; la guía internacional de la API enumera 30 idiomas y 10 variedades dialectales. Los desarrolladores deberían consultar la lista correspondiente al endpoint que realmente pueden utilizar.

## La afirmación del 95 % no coincide con la tabla pública de tarifas

El [aviso de cambio de precios de Alibaba](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) entró en vigor el 22 de septiembre. La comparación exacta abarca `qwen-audio-3.0-realtime-flash`, no el nuevo Realtime Plus 3.1. Las rebajas para Singapur se calculan así: (tarifa anterior − tarifa nueva) / tarifa anterior:

| Flujo de Realtime Flash | Antes (USD) | Después (USD) | Rebaja |
| --- | --- | --- | --- |
| Entrada de texto, por millón de tokens | $0.45 | $0.23 | 48.89% |
| Entrada de audio, por millón de tokens | $4.50 | $0.93 | 79.33% |
| Salida de texto, por millón de tokens | $4.50 | $0.70 | 84.44% |
| Salida (texto + audio), por millón de tokens | $15.00 | $1.87 | **87.53%** |

El mismo aviso cambia TTS Flash 3.1 de una tarifa de $0.15 por 10.000 caracteres a tarifas separadas por tokens de entrada y salida. La [página actual de precios](https://www.alibabacloud.com/help/en/model-studio/model-pricing) también presenta ASR 3.1 con tarifas por tokens de entrada y salida, mientras que ASR 3.0 cobra por segundo de audio y no cobra la salida. El porcentaje de rebaja entre cualquiera de los dos pares depende del texto, la duración del audio y la tokenización. Por eso, las tablas públicas revisadas no permiten reproducir una reducción exacta del 95 % en ASR.

## Las pruebas independientes siguen siendo de Qwen 3.0

En las fuentes consultadas el día del lanzamiento no había pruebas independientes de los cinco modelos 3.1. La página del proyecto de [ASR de Qwen](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) comunica resultados de pruebas comparativas, pero indica que no se han reproducido de manera independiente.

Artificial Analysis sitúa en segundo lugar a [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) en su arena de voces de proveedores —todos los acentos y categorías—, con 1.259 puntos Elo, un intervalo de confianza del 95 % de más o menos 17 y 1.447 muestras de comparaciones a ciegas. En una arena distinta de [agentes de voz](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), Qwen Audio 3.0 Realtime Plus obtuvo 699 puntos Elo de preferencia y 1,54 segundos hasta el primer audio. Los participantes comparan modelos ocultos en conversaciones en directo dentro de situaciones asignadas.

## Sources

- [Alibaba lanza Qwen Audio 3.1 con cinco modelos nuevos](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Informe del lanzamiento que resume los cinco modelos y atribuye a Qwen las rebajas aproximadas de precios para TTS, audio en tiempo real y ASR. BIG CHANGE contrastó las tarifas con las tablas de Alibaba.
- [Publicación de lanzamiento de Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Publicación verificada de la cuenta de Qwen que enumera los cinco modelos y sus funciones previstas. Las afirmaciones sobre funciones y velocidad siguen siendo declaraciones del proveedor.
- [Aviso de reducción de precios de Model Studio para modelos de audio seleccionados](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Cambio oficial de precios del 22 de septiembre, con tarifas exactas anteriores y nuevas para Realtime Flash 3.0 en Singapur y un cambio de unidad de facturación para TTS Flash 3.1.
- [Precios de modelos en Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Tarifas oficiales actuales por modelo, modalidad y región, incluidas ASR 3.1 y Realtime Plus.
- [Modelos de voz a texto de QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — IDs actuales de los endpoints de ASR, métodos de acceso, listas de idiomas, compatibilidad con diarización y límites de duración.
- [Chat de audio en tiempo real de QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Ejemplo actual de WebSocket para Realtime Plus 3.1, compatibilidad con voces e idiomas y límites de la conversación conservada.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Disponibilidad oficial de la API solo en Pekín, precios, idiomas, longitud de entrada y límites de duración de salida.
- [Página del proyecto ASR de Qwen Audio 3.1](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Página inmutable del proyecto de Qwen sobre las funciones de ASR y ASR-Next y las pruebas comparativas comunicadas por el proveedor; indica que los resultados no se reprodujeron de forma independiente.
- [Clasificación de texto a voz de Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Resultado de preferencias a ciegas del modelo anterior Qwen Audio 3.0 TTS Plus, incluidos el número de muestras y el intervalo de confianza.
- [Arena de agentes de voz de Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Resultado separado de preferencia y tiempo hasta el primer audio para Qwen Audio 3.0 Realtime Plus; no es una evaluación de la versión 3.1.
- [Referencia de la API HTTP de clonación de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Los ejemplos actuales identifican como modelo objetivo TTS Flash 3.0. No confirman de manera independiente una vía de integración para sintetizar con 3.1.