A equipe Qwen da Alibaba lançou cinco modelos Qwen Audio 3.1 para transcrição, geração de fala e interação por voz ao vivo. ASR, TTS-Next e Realtime Plus têm endpoints hospedados documentados. O TTS Flash tem um ID de modelo e preço publicados, mas documentação de integração menos completa; nos documentos públicos para desenvolvedores analisados pela BIG CHANGE, o ASR-Next não tem ID de modelo, região nem preço.
O The Decoder informou que o Qwen anuncia cortes de aproximadamente 70% em texto para fala, 85% em áudio em tempo real e até 95% em reconhecimento de fala. As unidades de cobrança são importantes para conferir esses números.
A grande mudança
- O que mudou: O Qwen agora reúne mais componentes de um produto de voz em uma única família hospedada, da transcrição e fala gerada à criação de paisagens sonoras e conversas ao vivo. O acesso para desenvolvedores ainda não é igualmente completo nos cinco componentes.
- Por que isso importa: Para desenvolvedores que calculam custos de transcrição ou serviços de voz, o minuto de áudio já não basta para precificar todos os endpoints. A cobrança de ASR por tokens inclui tanto o áudio recebido quanto o texto resultante; conversas ao vivo têm quatro fluxos com preços separados.
- O que observar: Além do acesso ao ASR-Next, acompanhe se testes independentes de idioma e latência confirmam economias úteis. Se confirmarem, a questão mais ampla será se os provedores de agentes de voz, transcrição e dublagem repassarão essa economia aos clientes e se APIs de fala concorrentes farão o mesmo.
Os cinco modelos
Modelo anunciado | Função pretendida | Acesso documentado em 23 de setembro | Preço e limite prático |
|---|---|---|---|
Qwen Audio 3.1 ASR | Transcrição em streaming, de arquivos e de fala curta; diarização opcional de locutores nos endpoints de arquivos e fala curta | APIs hospedadas via WebSocket ou HTTP em Singapura e Pequim. O guia internacional lista 30 idiomas e dez variedades de dialetos chineses. | Em Singapura, o preço varia de US$ 0,15 por milhão de tokens de áudio de entrada mais US$ 0,47 por milhão de tokens de texto de saída para arquivos e fala curta a US$ 0,93 mais US$ 0,70 para streaming e mensagens. A transcrição de arquivos aceita até 12 horas e 2 GB; a fala curta, até cinco minutos e 2 GB. |
Qwen Audio 3.1 ASR-Next | Atribuição de falantes e marcação de tempo, além do reconhecimento de emoções, sons ambientes e ruídos de máquinas | Anunciado pelo Qwen; a documentação atual do Model Studio e do QwenCloud não informa ID público de API, região, tarifa ou limite | Sem documentação pública de preços |
Qwen Audio 3.1 TTS | Fala multilíngue, transferência de voz entre idiomas e controle da interpretação por instruções | | Em Singapura: US$ 0,23 por milhão de tokens de texto de entrada mais US$ 1,87 por milhão de tokens de áudio de saída. O material público analisado não especifica os limites atuais da versão 3.1. |
Qwen Audio 3.1 TTS-Next | Geração conjunta de fala, efeitos e áudio de fundo | API HTTPS hospedada, sem streaming, em Pequim; documentação indica suporte a chinês e inglês | US$ 0,848 por milhão de tokens de entrada mais US$ 1,696 por milhão de tokens de saída. Aceita até 3.000 caracteres de entrada; gera podcasts de até quatro minutos e outros áudios de até dois minutos. |
Qwen Audio 3.1 Realtime Plus | Conversa por voz full-duplex, com interrupções e chamadas de ferramentas | API WebSocket hospedada em Singapura e Pequim. O guia lista 11 idiomas. | Em Singapura: US$ 0,80 por milhão de tokens de texto de entrada, US$ 6,40 por milhão de tokens de áudio de entrada, US$ 6,40 por milhão de tokens de texto de saída e US$ 24 por milhão de tokens de áudio de saída. Mantém até 50 turnos de áudio ou 300 segundos de histórico de áudio. |
Esses são produtos de API hospedados. A BIG CHANGE não encontrou pesos de modelo 3.1 disponíveis para download nem uma licença para os pesos. A licença MIT no repositório do QwenAudio cobre o site do projeto; não deve ser interpretada como licença dos modelos.
A quantidade de idiomas também varia conforme o documento. A publicação oficial verificada do Qwen diz que o ASR cobre 30 idiomas e 16 dialetos chineses; o guia internacional da API cita 30 idiomas e dez variedades de dialetos. Os desenvolvedores devem consultar a lista do endpoint que de fato podem chamar.
A alegação de corte de 95% não corresponde à tabela pública de preços
O aviso de alteração de preços da Alibaba entrou em vigor em 22 de setembro. A comparação exata abrange qwen-audio-3.0-realtime-flash, e não o novo Realtime Plus 3.1. As reduções para Singapura são calculadas como (tarifa antiga − tarifa nova) ÷ tarifa antiga:
Realtime Flash em streaming | Antes (US$) | Depois (US$) | Redução |
|---|---|---|---|
Entrada de texto, por milhão de tokens | US$ 0,45 | US$ 0,23 | 48,89% |
Entrada de áudio, por milhão de tokens | US$ 4,50 | US$ 0,93 | 79,33% |
Saída de texto, por milhão de tokens | US$ 4,50 | US$ 0,70 | 84,44% |
Saída (texto + áudio), por milhão de tokens | US$ 15,00 | US$ 1,87 | 87,53% |
O mesmo aviso muda o TTS Flash 3.1 de US$ 0,15 por 10 mil caracteres para tarifas separadas por tokens de entrada e saída. A página atual de preços também lista o ASR 3.1 com cobrança por tokens de entrada e saída, enquanto o ASR 3.0 é cobrado por segundo de áudio, com saída gratuita. O percentual de redução entre cada par depende do texto, da duração do áudio e da tokenização. Portanto, as tabelas públicas analisadas não permitem reproduzir um corte exato de 95% no ASR.
As evidências independentes ainda são do Qwen 3.0
As fontes analisadas no dia do lançamento não continham testes independentes dos cinco modelos 3.1. A própria página do projeto ASR do Qwen apresenta resultados de benchmark, mas informa que eles não foram reproduzidos de forma independente.
A Artificial Analysis classifica o Qwen Audio 3.0 TTS Plus em segundo lugar na arena de vozes de provedores (todas as categorias e sotaques), com Elo de 1.259, intervalo de confiança de 95% de mais ou menos 17 e 1.447 comparações cegas. Em uma arena separada de agentes de fala, o Qwen Audio 3.0 Realtime Plus obteve Elo de preferência de 699 e levou 1,54 segundo até o primeiro áudio. Os participantes comparam modelos ocultos em conversas ao vivo, com cenários definidos.



