O MUNDO NÃO ESTÁ PARADO.RSS
BIG CHANGE.

Edição Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# O Qwen Audio 3.1 alarga a oferta de voz. A redução de 95% no preço exige contexto

> O Qwen Audio 3.1 acrescenta criação e compreensão de som. A documentação da API é desigual e a alteração das unidades de faturação complica a alegada poupança de 95% no reconhecimento de fala.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

A equipa Qwen, da Alibaba, lançou cinco modelos Qwen Audio 3.1 para transcrição, geração de fala e interação por voz em tempo real. O ASR, o TTS-Next e o Realtime Plus dispõem de endpoints alojados documentados. O TTS Flash tem um identificador de modelo e um preço publicados, mas a documentação de integração é menos completa; nos documentos públicos para programadores analisados pela BIG CHANGE, o ASR-Next não tem identificador de modelo, região nem preço.

[O The Decoder comunicou](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) reduções anunciadas pelo Qwen de cerca de 70% na conversão de texto em fala, 85% no áudio em tempo real e até 95% no reconhecimento de fala. As unidades de faturação são importantes para verificar esses valores.

## A grande mudança

- **O que mudou:** O Qwen abrange agora mais funções de um produto de voz dentro de uma única família alojada: transcrição, fala gerada, criação de ambientes sonoros e conversação em tempo real. A documentação do acesso para programadores continua a ser desigual entre os cinco componentes.
- **Porque é importante:** Para os programadores que orçamentam serviços de transcrição ou de voz, a duração do áudio já não basta para calcular o preço de todos os endpoints. A faturação do ASR baseada em tokens inclui tanto o áudio recebido como o texto resultante; a conversação em tempo real tem quatro fluxos com preços separados.
- **O que acompanhar:** Além do acesso ao ASR-Next, importa perceber se testes independentes de idioma e latência confirmam poupanças relevantes. Se confirmarem, a questão mais ampla será saber se os fornecedores de agentes de voz, transcrição e dobragem transferem essas poupanças para os preços cobrados aos clientes e se as APIs de voz concorrentes fazem o mesmo.

## Os cinco modelos

| Modelo anunciado | Função prevista | Acesso documentado a 23 de setembro | Preço e limite prático |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Transcrição em fluxo, de ficheiros e de excertos curtos; diarização opcional de interlocutores nos endpoints de ficheiro e de excertos curtos | APIs alojadas via WebSocket ou HTTP em Singapura e Pequim. O guia [internacional](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) enumera 30 idiomas e 10 variedades de dialetos chineses. | Em Singapura, o preço varia entre **$0,15/M tokens de entrada de áudio + $0,47/M tokens de saída de texto** para ficheiros e excertos curtos, e **$0,93 + $0,70** para fluxos e mensagens. A transcrição de ficheiros aceita até 12 horas e 2 GB; a de excertos curtos, até 5 minutos e 2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Atribuição de interlocutores e marcas temporais, além do reconhecimento de emoções, sons ambiente e sons de máquinas | Anunciado pelo Qwen; não foi encontrado qualquer identificador de modelo para a API, região, tarifa ou limite na documentação atual do Model Studio e do QwenCloud | **Não documentado publicamente** |
| **Qwen Audio 3.1 TTS** | Fala multilingue, transferência de voz entre idiomas e controlo da entoação através de instruções | `qwen-audio-3.1-tts-flash` consta do aviso de preços da Alibaba. A API de [clonagem de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) analisada ainda indica o TTS Flash 3.0. | Singapura: **$0,23/M tokens de entrada de texto + $1,87/M tokens de saída de áudio**. O material 3.1 analisado não especifica os limites públicos atuais. |
| **Qwen Audio 3.1 TTS-Next** | Geração conjunta de fala, efeitos e som de fundo | API HTTPS alojada, sem transmissão em fluxo, em Pequim; documentada para chinês e inglês | **$0,848/M tokens de entrada + $1,696/M tokens de saída**. Até 3 000 caracteres de entrada; quatro minutos de saída para podcasts e dois minutos nos restantes casos. |
| **Qwen Audio 3.1 Realtime Plus** | Conversação por voz em duplex completo, com interrupções e chamadas a ferramentas | API WebSocket alojada em Singapura e Pequim. O [guia](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) enumera 11 idiomas. | Singapura: **$0,80/M tokens de entrada de texto, $6,40/M de entrada de áudio, $6,40/M de saída de texto e $24/M de saída de áudio**. Conserva até 50 turnos de áudio ou 300 segundos de histórico áudio. |

Estes são produtos de API alojados. A BIG CHANGE não encontrou pesos dos modelos 3.1 disponíveis para transferência nem uma licença para esses pesos. A licença MIT do repositório QwenAudio no GitHub abrange o site do projeto e não deve ser interpretada como uma licença dos modelos.

A contagem de idiomas também depende do documento consultado. A [publicação de lançamento verificada](https://www.sina.cn/news/detail/5346330620985983.html) do Qwen diz que o ASR abrange 30 idiomas e 16 dialetos chineses; o guia internacional da API enumera 30 idiomas e 10 variedades de dialetos. Os programadores devem consultar a lista associada ao endpoint a que conseguem realmente aceder.

## A alegação de uma redução de 95% não corresponde à tabela pública de preços

O [aviso de alteração de preços](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) da Alibaba entrou em vigor a 22 de setembro. A comparação exata abrange `qwen-audio-3.0-realtime-flash`, não o novo Realtime Plus 3.1. As reduções para Singapura são calculadas como (preço anterior − novo preço) / preço anterior:

| Fluxo Realtime Flash | Antes (USD) | Depois (USD) | Redução |
| --- | --- | --- | --- |
| Entrada de texto, por milhão de tokens | $0,45 | $0,23 | 48,89% |
| Entrada de áudio, por milhão de tokens | $4,50 | $0,93 | 79,33% |
| Saída de texto, por milhão de tokens | $4,50 | $0,70 | 84,44% |
| Saída (texto + áudio), por milhão de tokens | $15,00 | $1,87 | **87,53%** |

O mesmo aviso passa o preço do TTS Flash 3.1 de 0,15 dólares por 10 000 caracteres para tarifas separadas por tokens de entrada e de saída. A [página de preços atual](https://www.alibabacloud.com/help/en/model-studio/model-pricing) também apresenta o ASR 3.1 com preços por tokens de entrada e de saída, ao passo que o ASR 3.0 cobra por segundo de áudio e não cobra o texto de saída. A percentagem da redução em qualquer uma destas comparações depende do texto, da duração do áudio e da tokenização. Por isso, as tabelas públicas aqui analisadas não reproduzem uma redução exata de 95% no ASR.

## As provas independentes continuam a dizer respeito ao Qwen 3.0

No dia do lançamento, as fontes analisadas não incluíam testes independentes dos cinco modelos 3.1. A própria [página do projeto ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) do Qwen apresenta resultados de benchmark, mas afirma que não foram reproduzidos de forma independente.

A Artificial Analysis coloca o [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) em segundo lugar na sua arena de vozes de fornecedores (todos os sotaques e categorias), com 1 259 pontos Elo, um intervalo de confiança de 95% de mais ou menos 17 e 1 447 comparações cegas. Numa [arena separada de agentes de fala](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), o Qwen Audio 3.0 Realtime Plus obteve 699 pontos Elo de preferência e demorou 1,54 segundos até emitir o primeiro áudio. Os participantes comparam modelos ocultos em conversas em tempo real, de acordo com cenários definidos.

## Sources

- [Alibaba lança o Qwen Audio 3.1 com cinco novos modelos](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Reportagem sobre o lançamento dos cinco modelos que atribui ao Qwen reduções aproximadas de preços no TTS, áudio em tempo real e ASR. A BIG CHANGE confirmou as tarifas nas tabelas da própria Alibaba.
- [Publicação de lançamento do Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Publicação verificada da conta do Qwen que identifica os cinco modelos e as capacidades previstas. As declarações sobre capacidades e velocidade continuam a ser alegações do fornecedor.
- [Aviso de redução de preços do Model Studio para determinados modelos de áudio](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Alteração oficial de preços, datada de 22 de setembro, com tarifas exatas antes e depois para o Realtime Flash 3.0 em Singapura e alteração da unidade de faturação para o TTS Flash 3.1.
- [Preços dos modelos do Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Preços oficiais atuais por modelo, modalidade e região, incluindo o ASR 3.1 e o Realtime Plus.
- [Modelos de conversão de voz em texto do QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Identificadores atuais dos endpoints ASR, métodos de acesso, listas de idiomas, suporte à diarização e limites de duração.
- [Conversa de áudio em tempo real do QwenCloud](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Exemplo WebSocket atual do Realtime Plus 3.1, com suporte a vozes e idiomas e limites de retenção do histórico da conversa.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Disponibilidade oficial da API apenas em Pequim, preços, idiomas, comprimento de entrada e limites de duração da saída.
- [Página do projeto Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Página imutável do projeto Qwen que descreve as capacidades do ASR e do ASR-Next e apresenta benchmarks comunicados pelo fornecedor; indica que os resultados não foram reproduzidos de forma independente.
- [Tabela classificativa de conversão de texto em fala da Artificial Analysis](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Resultado de preferência cega do modelo anterior Qwen Audio 3.0 TTS Plus, incluindo o número de amostras e o intervalo de confiança.
- [Arena de agentes de fala da Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Resultado separado de preferência e tempo até ao primeiro áudio para o Qwen Audio 3.0 Realtime Plus; não é uma avaliação da versão 3.1.
- [Referência da API HTTP de clonagem de voz](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — Os exemplos atuais identificam o TTS Flash 3.0 como modelo de destino. Não confirmam de forma independente um percurso de integração de síntese na versão 3.1.