A equipa Qwen, da Alibaba, lançou cinco modelos Qwen Audio 3.1 para transcrição, geração de fala e interação por voz em tempo real. O ASR, o TTS-Next e o Realtime Plus dispõem de endpoints alojados documentados. O TTS Flash tem um identificador de modelo e um preço publicados, mas a documentação de integração é menos completa; nos documentos públicos para programadores analisados pela BIG CHANGE, o ASR-Next não tem identificador de modelo, região nem preço.

O The Decoder comunicou reduções anunciadas pelo Qwen de cerca de 70% na conversão de texto em fala, 85% no áudio em tempo real e até 95% no reconhecimento de fala. As unidades de faturação são importantes para verificar esses valores.

A grande mudança

  • O que mudou: O Qwen abrange agora mais funções de um produto de voz dentro de uma única família alojada: transcrição, fala gerada, criação de ambientes sonoros e conversação em tempo real. A documentação do acesso para programadores continua a ser desigual entre os cinco componentes.
  • Porque é importante: Para os programadores que orçamentam serviços de transcrição ou de voz, a duração do áudio já não basta para calcular o preço de todos os endpoints. A faturação do ASR baseada em tokens inclui tanto o áudio recebido como o texto resultante; a conversação em tempo real tem quatro fluxos com preços separados.
  • O que acompanhar: Além do acesso ao ASR-Next, importa perceber se testes independentes de idioma e latência confirmam poupanças relevantes. Se confirmarem, a questão mais ampla será saber se os fornecedores de agentes de voz, transcrição e dobragem transferem essas poupanças para os preços cobrados aos clientes e se as APIs de voz concorrentes fazem o mesmo.

Os cinco modelos

Modelo anunciado

Função prevista

Acesso documentado a 23 de setembro

Preço e limite prático

Qwen Audio 3.1 ASR

Transcrição em fluxo, de ficheiros e de excertos curtos; diarização opcional de interlocutores nos endpoints de ficheiro e de excertos curtos

APIs alojadas via WebSocket ou HTTP em Singapura e Pequim. O guia internacional enumera 30 idiomas e 10 variedades de dialetos chineses.

Em Singapura, o preço varia entre $0,15/M tokens de entrada de áudio + $0,47/M tokens de saída de texto para ficheiros e excertos curtos, e $0,93 + $0,70 para fluxos e mensagens. A transcrição de ficheiros aceita até 12 horas e 2 GB; a de excertos curtos, até 5 minutos e 2 GB.

Qwen Audio 3.1 ASR-Next

Atribuição de interlocutores e marcas temporais, além do reconhecimento de emoções, sons ambiente e sons de máquinas

Anunciado pelo Qwen; não foi encontrado qualquer identificador de modelo para a API, região, tarifa ou limite na documentação atual do Model Studio e do QwenCloud

Não documentado publicamente

Qwen Audio 3.1 TTS

Fala multilingue, transferência de voz entre idiomas e controlo da entoação através de instruções

qwen-audio-3.1-tts-flash consta do aviso de preços da Alibaba. A API de clonagem de voz analisada ainda indica o TTS Flash 3.0.

Singapura: $0,23/M tokens de entrada de texto + $1,87/M tokens de saída de áudio. O material 3.1 analisado não especifica os limites públicos atuais.

Qwen Audio 3.1 TTS-Next

Geração conjunta de fala, efeitos e som de fundo

API HTTPS alojada, sem transmissão em fluxo, em Pequim; documentada para chinês e inglês

$0,848/M tokens de entrada + $1,696/M tokens de saída. Até 3 000 caracteres de entrada; quatro minutos de saída para podcasts e dois minutos nos restantes casos.

Qwen Audio 3.1 Realtime Plus

Conversação por voz em duplex completo, com interrupções e chamadas a ferramentas

API WebSocket alojada em Singapura e Pequim. O guia enumera 11 idiomas.

Singapura: $0,80/M tokens de entrada de texto, $6,40/M de entrada de áudio, $6,40/M de saída de texto e $24/M de saída de áudio. Conserva até 50 turnos de áudio ou 300 segundos de histórico áudio.

Estes são produtos de API alojados. A BIG CHANGE não encontrou pesos dos modelos 3.1 disponíveis para transferência nem uma licença para esses pesos. A licença MIT do repositório QwenAudio no GitHub abrange o site do projeto e não deve ser interpretada como uma licença dos modelos.

A contagem de idiomas também depende do documento consultado. A publicação de lançamento verificada do Qwen diz que o ASR abrange 30 idiomas e 16 dialetos chineses; o guia internacional da API enumera 30 idiomas e 10 variedades de dialetos. Os programadores devem consultar a lista associada ao endpoint a que conseguem realmente aceder.

A alegação de uma redução de 95% não corresponde à tabela pública de preços

O aviso de alteração de preços da Alibaba entrou em vigor a 22 de setembro. A comparação exata abrange qwen-audio-3.0-realtime-flash, não o novo Realtime Plus 3.1. As reduções para Singapura são calculadas como (preço anterior − novo preço) / preço anterior:

Fluxo Realtime Flash

Antes (USD)

Depois (USD)

Redução

Entrada de texto, por milhão de tokens

$0,45

$0,23

48,89%

Entrada de áudio, por milhão de tokens

$4,50

$0,93

79,33%

Saída de texto, por milhão de tokens

$4,50

$0,70

84,44%

Saída (texto + áudio), por milhão de tokens

$15,00

$1,87

87,53%

O mesmo aviso passa o preço do TTS Flash 3.1 de 0,15 dólares por 10 000 caracteres para tarifas separadas por tokens de entrada e de saída. A página de preços atual também apresenta o ASR 3.1 com preços por tokens de entrada e de saída, ao passo que o ASR 3.0 cobra por segundo de áudio e não cobra o texto de saída. A percentagem da redução em qualquer uma destas comparações depende do texto, da duração do áudio e da tokenização. Por isso, as tabelas públicas aqui analisadas não reproduzem uma redução exata de 95% no ASR.

As provas independentes continuam a dizer respeito ao Qwen 3.0

No dia do lançamento, as fontes analisadas não incluíam testes independentes dos cinco modelos 3.1. A própria página do projeto ASR do Qwen apresenta resultados de benchmark, mas afirma que não foram reproduzidos de forma independente.

A Artificial Analysis coloca o Qwen Audio 3.0 TTS Plus em segundo lugar na sua arena de vozes de fornecedores (todos os sotaques e categorias), com 1 259 pontos Elo, um intervalo de confiança de 95% de mais ou menos 17 e 1 447 comparações cegas. Numa arena separada de agentes de fala, o Qwen Audio 3.0 Realtime Plus obteve 699 pontos Elo de preferência e demorou 1,54 segundos até emitir o primeiro áudio. Os participantes comparam modelos ocultos em conversas em tempo real, de acordo com cenários definidos.