A equipa Qwen, da Alibaba, lançou cinco modelos Qwen Audio 3.1 para transcrição, geração de fala e interação por voz em tempo real. O ASR, o TTS-Next e o Realtime Plus dispõem de endpoints alojados documentados. O TTS Flash tem um identificador de modelo e um preço publicados, mas a documentação de integração é menos completa; nos documentos públicos para programadores analisados pela BIG CHANGE, o ASR-Next não tem identificador de modelo, região nem preço.
O The Decoder comunicou reduções anunciadas pelo Qwen de cerca de 70% na conversão de texto em fala, 85% no áudio em tempo real e até 95% no reconhecimento de fala. As unidades de faturação são importantes para verificar esses valores.
A grande mudança
- O que mudou: O Qwen abrange agora mais funções de um produto de voz dentro de uma única família alojada: transcrição, fala gerada, criação de ambientes sonoros e conversação em tempo real. A documentação do acesso para programadores continua a ser desigual entre os cinco componentes.
- Porque é importante: Para os programadores que orçamentam serviços de transcrição ou de voz, a duração do áudio já não basta para calcular o preço de todos os endpoints. A faturação do ASR baseada em tokens inclui tanto o áudio recebido como o texto resultante; a conversação em tempo real tem quatro fluxos com preços separados.
- O que acompanhar: Além do acesso ao ASR-Next, importa perceber se testes independentes de idioma e latência confirmam poupanças relevantes. Se confirmarem, a questão mais ampla será saber se os fornecedores de agentes de voz, transcrição e dobragem transferem essas poupanças para os preços cobrados aos clientes e se as APIs de voz concorrentes fazem o mesmo.
Os cinco modelos
Modelo anunciado | Função prevista | Acesso documentado a 23 de setembro | Preço e limite prático |
|---|---|---|---|
Qwen Audio 3.1 ASR | Transcrição em fluxo, de ficheiros e de excertos curtos; diarização opcional de interlocutores nos endpoints de ficheiro e de excertos curtos | APIs alojadas via WebSocket ou HTTP em Singapura e Pequim. O guia internacional enumera 30 idiomas e 10 variedades de dialetos chineses. | Em Singapura, o preço varia entre $0,15/M tokens de entrada de áudio + $0,47/M tokens de saída de texto para ficheiros e excertos curtos, e $0,93 + $0,70 para fluxos e mensagens. A transcrição de ficheiros aceita até 12 horas e 2 GB; a de excertos curtos, até 5 minutos e 2 GB. |
Qwen Audio 3.1 ASR-Next | Atribuição de interlocutores e marcas temporais, além do reconhecimento de emoções, sons ambiente e sons de máquinas | Anunciado pelo Qwen; não foi encontrado qualquer identificador de modelo para a API, região, tarifa ou limite na documentação atual do Model Studio e do QwenCloud | Não documentado publicamente |
Qwen Audio 3.1 TTS | Fala multilingue, transferência de voz entre idiomas e controlo da entoação através de instruções | | Singapura: $0,23/M tokens de entrada de texto + $1,87/M tokens de saída de áudio. O material 3.1 analisado não especifica os limites públicos atuais. |
Qwen Audio 3.1 TTS-Next | Geração conjunta de fala, efeitos e som de fundo | API HTTPS alojada, sem transmissão em fluxo, em Pequim; documentada para chinês e inglês | $0,848/M tokens de entrada + $1,696/M tokens de saída. Até 3 000 caracteres de entrada; quatro minutos de saída para podcasts e dois minutos nos restantes casos. |
Qwen Audio 3.1 Realtime Plus | Conversação por voz em duplex completo, com interrupções e chamadas a ferramentas | API WebSocket alojada em Singapura e Pequim. O guia enumera 11 idiomas. | Singapura: $0,80/M tokens de entrada de texto, $6,40/M de entrada de áudio, $6,40/M de saída de texto e $24/M de saída de áudio. Conserva até 50 turnos de áudio ou 300 segundos de histórico áudio. |
Estes são produtos de API alojados. A BIG CHANGE não encontrou pesos dos modelos 3.1 disponíveis para transferência nem uma licença para esses pesos. A licença MIT do repositório QwenAudio no GitHub abrange o site do projeto e não deve ser interpretada como uma licença dos modelos.
A contagem de idiomas também depende do documento consultado. A publicação de lançamento verificada do Qwen diz que o ASR abrange 30 idiomas e 16 dialetos chineses; o guia internacional da API enumera 30 idiomas e 10 variedades de dialetos. Os programadores devem consultar a lista associada ao endpoint a que conseguem realmente aceder.
A alegação de uma redução de 95% não corresponde à tabela pública de preços
O aviso de alteração de preços da Alibaba entrou em vigor a 22 de setembro. A comparação exata abrange qwen-audio-3.0-realtime-flash, não o novo Realtime Plus 3.1. As reduções para Singapura são calculadas como (preço anterior − novo preço) / preço anterior:
Fluxo Realtime Flash | Antes (USD) | Depois (USD) | Redução |
|---|---|---|---|
Entrada de texto, por milhão de tokens | $0,45 | $0,23 | 48,89% |
Entrada de áudio, por milhão de tokens | $4,50 | $0,93 | 79,33% |
Saída de texto, por milhão de tokens | $4,50 | $0,70 | 84,44% |
Saída (texto + áudio), por milhão de tokens | $15,00 | $1,87 | 87,53% |
O mesmo aviso passa o preço do TTS Flash 3.1 de 0,15 dólares por 10 000 caracteres para tarifas separadas por tokens de entrada e de saída. A página de preços atual também apresenta o ASR 3.1 com preços por tokens de entrada e de saída, ao passo que o ASR 3.0 cobra por segundo de áudio e não cobra o texto de saída. A percentagem da redução em qualquer uma destas comparações depende do texto, da duração do áudio e da tokenização. Por isso, as tabelas públicas aqui analisadas não reproduzem uma redução exata de 95% no ASR.
As provas independentes continuam a dizer respeito ao Qwen 3.0
No dia do lançamento, as fontes analisadas não incluíam testes independentes dos cinco modelos 3.1. A própria página do projeto ASR do Qwen apresenta resultados de benchmark, mas afirma que não foram reproduzidos de forma independente.
A Artificial Analysis coloca o Qwen Audio 3.0 TTS Plus em segundo lugar na sua arena de vozes de fornecedores (todos os sotaques e categorias), com 1 259 pontos Elo, um intervalo de confiança de 95% de mais ou menos 17 e 1 447 comparações cegas. Numa arena separada de agentes de fala, o Qwen Audio 3.0 Realtime Plus obteve 699 pontos Elo de preferência e demorou 1,54 segundos até emitir o primeiro áudio. Os participantes comparam modelos ocultos em conversas em tempo real, de acordo com cenários definidos.



