阿里巴巴 Qwen 团队推出五款 Qwen Audio 3.1 模型,涵盖转录、语音生成和实时语音交互。ASR、TTS-Next 和 Realtime Plus 均有公开的托管端点文档。TTS Flash 已公布模型 ID 和价格,但集成文档较不完整;在 BIG CHANGE 查阅的公开开发者文档中,ASR-Next 没有模型 ID、地区或价格信息。

The Decoder 报道称,Qwen 宣称文本转语音降价约 70%、实时音频降价约 85%、语音识别最高降价约 95%。核对这些数据时,计费单位也很重要。

重大变化

  • 变化内容:Qwen 现在在一个托管模型系列中涵盖了更多语音产品功能,从转录和语音生成,到音效场景创作和实时对话都有涉及。不过,五个组件目前尚未全部向开发者开放,也没有同等完整的文档。
  • 为何重要:为转录或语音服务编制预算的开发者不能再只按音频分钟数计算所有端点的价格。按 token 计费的 ASR 费用包括输入音频和生成文本;实时对话则有四种单独计价的数据流。
  • 关注事项:除了等待 ASR-Next 开放接入,还应关注独立的语言和延迟测试能否证实确有实用的成本节省。如果测试证实了这一点,更广泛的问题是:语音智能体、转录和配音服务是否会把节省传递给客户,以及其他语音 API 是否跟进。

五款模型一览

已公布型号

预期用途

截至 9 月 23 日公布的接入方式

价格和实际限制

Qwen Audio 3.1 ASR

流式、文件和短音频转录;文件及短音频端点可选说话人分离。

在新加坡和北京提供托管 WebSocket 或 HTTP API。国际版指南列出 30 种语言和 10 种汉语方言。

新加坡价格区间如下:每百万音频输入 token 0.15 美元 + 每百万文本输出 token 0.47 美元(文件和短音频),至每百万 token 0.93 美元 + 0.70 美元(流式/消息)。文件转录支持最长 12 小时、最大 2 GB;短音频最长 5 分钟、最大 2 GB。

Qwen Audio 3.1 ASR-Next

说话人归属和时间戳,以及情绪、环境事件和机器声的识别。

Qwen 已宣布此型号,但当前 Model Studio 和 QwenCloud 文档没有公开 API 模型 ID、地区、价格或限制。

尚未公开文档说明

Qwen Audio 3.1 TTS

多语言语音、跨语言声音迁移,以及通过提示词控制表达方式。

qwen-audio-3.1-tts-flash出现在阿里巴巴的价格通知中。本文查阅的声音克隆 API仍列出 3.0 TTS Flash。

新加坡价格:每百万文本输入 token 0.23 美元 + 每百万音频输出 token 1.87 美元。本文查阅的 3.1 资料未说明当前公开使用限制。

Qwen Audio 3.1 TTS-Next

联合生成语音、音效和背景音频。

在北京提供托管式非流式 HTTPS API,文档支持中文和英文。

每百万输入 token 0.848 美元 + 每百万输出 token 1.696 美元。输入最多 3,000 个字符;播客输出最长四分钟,其他输出最长两分钟。

Qwen Audio 3.1 Realtime Plus

支持打断和工具调用的全双工语音对话。

在新加坡和北京提供托管 WebSocket API。指南列出 11 种语言。

新加坡价格:每百万文本输入 token 0.80 美元、音频输入 token 6.40 美元、文本输出 token 6.40 美元、音频输出 token 24 美元。最多保留 50 轮音频对话,或 300 秒音频历史。

这些都是托管 API 产品。BIG CHANGE 未找到可下载的 3.1 模型权重或模型权重许可。QwenAudio GitHub 仓库中的 MIT 许可证适用于项目网站,不应被解读为模型的许可证。

语言数量也因文档而异。Qwen 的认证公告称 ASR 支持 30 种语言和 16 种汉语方言;国际版 API 指南则列出 30 种语言和 10 种方言。开发者应采用其实际可调用端点对应的语言列表。

95% 的说法无法直接对应公开价格表

阿里巴巴的调价通知于 9 月 22 日生效。其精确对比针对qwen-audio-3.0-realtime-flash,而不是新款 3.1 Realtime Plus。新加坡的降价幅度按(旧价格 − 新价格)/ 旧价格计算:

Realtime Flash 数据流

调价前(美元)

调价后(美元)

降幅

文本输入,每百万 token

0.45 美元

0.23 美元

48.89%

音频输入,每百万 token

4.50 美元

0.93 美元

79.33%

文本输出,每百万 token

4.50 美元

0.70 美元

84.44%

输出(文本 + 音频),每百万 token

15.00 美元

1.87 美元

87.53%

同一通知将 3.1 TTS Flash 的价格从每 10,000 个字符 0.15 美元,改为分别按输入和输出 token 计价。当前价格页面同样将 3.1 ASR 列为按输入和输出 token 计费,而 3.0 ASR 则按音频秒数收费,输出免费。因此,这两种计价方式之间的百分比差异取决于文本内容、音频时长和 token 切分方式。本文查阅的公开价格表无法据此还原确切的 ASR 降价 95%。

独立证据仍来自 Qwen 3.0

在发布当天查阅的来源中,没有针对五款 3.1 模型的独立测试。Qwen 自己的ASR 项目页面报告了基准测试结果,但也表示尚未经过独立复测。

Artificial Analysis 将Qwen Audio 3.0 TTS Plus列为其语音服务商竞技场排名第二(涵盖所有口音和类别),Elo 评分为 1,259,95% 置信区间为正负 17,包含 1,447 个盲测比较样本。在单独的语音智能体竞技场中,Qwen Audio 3.0 Realtime Plus 的偏好 Elo 得分为 699,首次音频生成时间为 1.54 秒。参与者会在分配的情境中与隐藏身份的模型进行实时对话并作出比较。