O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição em Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 amplia sua linha de voz. O corte de 95% no preço exige contexto

> O Qwen Audio 3.1 adiciona criação e compreensão de áudio. A documentação da API é desigual, e a mudança nas unidades de cobrança complica a economia anunciada para ASR.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

A equipe Qwen da Alibaba lançou cinco modelos Qwen Audio 3.1 para transcrição, geração de fala e interação por voz ao vivo. ASR, TTS-Next e Realtime Plus têm endpoints hospedados documentados. O TTS Flash tem um ID de modelo e preço publicados, mas documentação de integração menos completa; nos documentos públicos para desenvolvedores analisados pela BIG CHANGE, o ASR-Next não tem ID de modelo, região nem preço.

[O The Decoder informou](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) que o Qwen anuncia cortes de aproximadamente 70% em texto para fala, 85% em áudio em tempo real e até 95% em reconhecimento de fala. As unidades de cobrança são importantes para conferir esses números.

## A grande mudança

- **O que mudou:** O Qwen agora reúne mais componentes de um produto de voz em uma única família hospedada, da transcrição e fala gerada à criação de paisagens sonoras e conversas ao vivo. O acesso para desenvolvedores ainda não é igualmente completo nos cinco componentes.
- **Por que isso importa:** Para desenvolvedores que calculam custos de transcrição ou serviços de voz, o minuto de áudio já não basta para precificar todos os endpoints. A cobrança de ASR por tokens inclui tanto o áudio recebido quanto o texto resultante; conversas ao vivo têm quatro fluxos com preços separados.
- **O que observar:** Além do acesso ao ASR-Next, acompanhe se testes independentes de idioma e latência confirmam economias úteis. Se confirmarem, a questão mais ampla será se os provedores de agentes de voz, transcrição e dublagem repassarão essa economia aos clientes e se APIs de fala concorrentes farão o mesmo.

## Os cinco modelos

| Modelo anunciado | Função pretendida | Acesso documentado em 23 de setembro | Preço e limite prático |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Transcrição em streaming, de arquivos e de fala curta; diarização opcional de locutores nos endpoints de arquivos e fala curta | APIs hospedadas via WebSocket ou HTTP em Singapura e Pequim. O [guia internacional](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) lista 30 idiomas e dez variedades de dialetos chineses. | Em Singapura, o preço varia de **US$ 0,15 por milhão de tokens de áudio de entrada mais US$ 0,47 por milhão de tokens de texto de saída** para arquivos e fala curta a **US$ 0,93 mais US$ 0,70** para streaming e mensagens. A transcrição de arquivos aceita até 12 horas e 2 GB; a fala curta, até cinco minutos e 2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Atribuição de falantes e marcação de tempo, além do reconhecimento de emoções, sons ambientes e ruídos de máquinas | Anunciado pelo Qwen; a documentação atual do Model Studio e do QwenCloud não informa ID público de API, região, tarifa ou limite | **Sem documentação pública de preços** |
| **Qwen Audio 3.1 TTS** | Fala multilíngue, transferência de voz entre idiomas e controle da interpretação por instruções | `qwen-audio-3.1-tts-flash` aparece no aviso de preços da Alibaba. A API de [clonagem de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) analisada ainda cita o TTS Flash 3.0. | Em Singapura: **US$ 0,23 por milhão de tokens de texto de entrada mais US$ 1,87 por milhão de tokens de áudio de saída**. O material público analisado não especifica os limites atuais da versão 3.1. |
| **Qwen Audio 3.1 TTS-Next** | Geração conjunta de fala, efeitos e áudio de fundo | API HTTPS hospedada, sem streaming, em Pequim; documentação indica suporte a chinês e inglês | **US$ 0,848 por milhão de tokens de entrada mais US$ 1,696 por milhão de tokens de saída**. Aceita até 3.000 caracteres de entrada; gera podcasts de até quatro minutos e outros áudios de até dois minutos. |
| **Qwen Audio 3.1 Realtime Plus** | Conversa por voz full-duplex, com interrupções e chamadas de ferramentas | API WebSocket hospedada em Singapura e Pequim. O [guia](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) lista 11 idiomas. | Em Singapura: **US$ 0,80 por milhão de tokens de texto de entrada, US$ 6,40 por milhão de tokens de áudio de entrada, US$ 6,40 por milhão de tokens de texto de saída e US$ 24 por milhão de tokens de áudio de saída**. Mantém até 50 turnos de áudio ou 300 segundos de histórico de áudio. |

Esses são produtos de API hospedados. A BIG CHANGE não encontrou pesos de modelo 3.1 disponíveis para download nem uma licença para os pesos. A licença MIT no repositório do QwenAudio cobre o site do projeto; não deve ser interpretada como licença dos modelos.

A quantidade de idiomas também varia conforme o documento. A [publicação oficial verificada do Qwen](https://www.sina.cn/news/detail/5346330620985983.html) diz que o ASR cobre 30 idiomas e 16 dialetos chineses; o guia internacional da API cita 30 idiomas e dez variedades de dialetos. Os desenvolvedores devem consultar a lista do endpoint que de fato podem chamar.

## A alegação de corte de 95% não corresponde à tabela pública de preços

O [aviso de alteração de preços](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) da Alibaba entrou em vigor em 22 de setembro. A comparação exata abrange `qwen-audio-3.0-realtime-flash`, e não o novo Realtime Plus 3.1. As reduções para Singapura são calculadas como (tarifa antiga − tarifa nova) ÷ tarifa antiga:

| Realtime Flash em streaming | Antes (US$) | Depois (US$) | Redução |
| --- | --- | --- | --- |
| Entrada de texto, por milhão de tokens | US$ 0,45 | US$ 0,23 | 48,89% |
| Entrada de áudio, por milhão de tokens | US$ 4,50 | US$ 0,93 | 79,33% |
| Saída de texto, por milhão de tokens | US$ 4,50 | US$ 0,70 | 84,44% |
| Saída (texto + áudio), por milhão de tokens | US$ 15,00 | US$ 1,87 | **87,53%** |

O mesmo aviso muda o TTS Flash 3.1 de US$ 0,15 por 10 mil caracteres para tarifas separadas por tokens de entrada e saída. A [página atual de preços](https://www.alibabacloud.com/help/en/model-studio/model-pricing) também lista o ASR 3.1 com cobrança por tokens de entrada e saída, enquanto o ASR 3.0 é cobrado por segundo de áudio, com saída gratuita. O percentual de redução entre cada par depende do texto, da duração do áudio e da tokenização. Portanto, as tabelas públicas analisadas não permitem reproduzir um corte exato de 95% no ASR.

## As evidências independentes ainda são do Qwen 3.0

As fontes analisadas no dia do lançamento não continham testes independentes dos cinco modelos 3.1. A própria [página do projeto ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) do Qwen apresenta resultados de benchmark, mas informa que eles não foram reproduzidos de forma independente.

A Artificial Analysis classifica o [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) em segundo lugar na arena de vozes de provedores (todas as categorias e sotaques), com Elo de 1.259, intervalo de confiança de 95% de mais ou menos 17 e 1.447 comparações cegas. Em uma arena separada de [agentes de fala](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), o Qwen Audio 3.0 Realtime Plus obteve Elo de preferência de 699 e levou 1,54 segundo até o primeiro áudio. Os participantes comparam modelos ocultos em conversas ao vivo, com cenários definidos.

## Sources

- [Alibaba lança o Qwen Audio 3.1 com cinco novos modelos](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Reportagem de descoberta que resume o lançamento dos cinco modelos e atribui ao Qwen reduções aproximadas de preço em TTS, áudio em tempo real e ASR. A BIG CHANGE conferiu as tarifas nas tabelas da própria Alibaba.
- [Publicação de lançamento do Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Publicação verificada da conta oficial do Qwen que identifica os cinco modelos e suas funções pretendidas. Afirmações sobre recursos e velocidade continuam sendo alegações do fornecedor.
- [Aviso de redução de preços no Model Studio para modelos de áudio selecionados](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Alteração oficial de preços de 22 de setembro, com tarifas exatas antes e depois em Singapura para o Realtime Flash 3.0 e mudança na unidade de cobrança do TTS Flash 3.1.
- [Preços dos modelos do Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Preços oficiais atuais por modelo, modalidade e região, incluindo o ASR 3.1 e o Realtime Plus.
- [Modelos de conversão de fala em texto do QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — IDs atuais de endpoints de ASR, métodos de acesso, idiomas, suporte à diarização e limites de duração.
- [Chat de áudio em tempo real do QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Exemplo atual de WebSocket para o Realtime Plus 3.1, suporte a vozes e idiomas e limites para manter o histórico da conversa.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Disponibilidade oficial da API apenas em Pequim, preços, idiomas e limites de entrada e duração da saída.
- [Página do projeto Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Página imutável do projeto Qwen sobre os recursos do ASR e ASR-Next e benchmarks informados pelo fornecedor; afirma que os resultados não foram reproduzidos de forma independente.
- [Ranking de conversão de texto em fala da Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Resultado de preferência cega para o modelo anterior Qwen Audio 3.0 TTS Plus, com número de amostras e intervalo de confiança.
- [Arena de agentes de fala da Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Resultado separado de preferência e tempo até o primeiro áudio para o Qwen Audio 3.0 Realtime Plus; não é uma avaliação da versão 3.1.
- [Referência da API HTTP de clonagem de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Os exemplos atuais para modelos de destino citam o TTS Flash 3.0. Eles não confirmam de forma independente uma via de integração de síntese para a versão 3.1.