AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 扩展语音模型阵容，但解读 95% 降价需结合背景

> Qwen Audio 3.1 新增了声音生成和理解能力。其 API 文档并不完整，计费单位的变化也使宣传中的 ASR 节省幅度更难解读。

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

阿里巴巴 Qwen 团队推出五款 Qwen Audio 3.1 模型，涵盖转录、语音生成和实时语音交互。ASR、TTS-Next 和 Realtime Plus 均有公开的托管端点文档。TTS Flash 已公布模型 ID 和价格，但集成文档较不完整；在 BIG CHANGE 查阅的公开开发者文档中，ASR-Next 没有模型 ID、地区或价格信息。

[The Decoder 报道称](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent)，Qwen 宣称文本转语音降价约 70%、实时音频降价约 85%、语音识别最高降价约 95%。核对这些数据时，计费单位也很重要。

## 重大变化

- **变化内容：**Qwen 现在在一个托管模型系列中涵盖了更多语音产品功能，从转录和语音生成，到音效场景创作和实时对话都有涉及。不过，五个组件目前尚未全部向开发者开放，也没有同等完整的文档。
- **为何重要：**为转录或语音服务编制预算的开发者不能再只按音频分钟数计算所有端点的价格。按 token 计费的 ASR 费用包括输入音频和生成文本；实时对话则有四种单独计价的数据流。
- **关注事项：**除了等待 ASR-Next 开放接入，还应关注独立的语言和延迟测试能否证实确有实用的成本节省。如果测试证实了这一点，更广泛的问题是：语音智能体、转录和配音服务是否会把节省传递给客户，以及其他语音 API 是否跟进。

## 五款模型一览

| 已公布型号 | 预期用途 | 截至 9 月 23 日公布的接入方式 | 价格和实际限制 |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | 流式、文件和短音频转录；文件及短音频端点可选说话人分离。 | 在新加坡和北京提供托管 WebSocket 或 HTTP API。[国际版指南](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)列出 30 种语言和 10 种汉语方言。 | 新加坡价格区间如下：**每百万音频输入 token 0.15 美元 + 每百万文本输出 token 0.47 美元**（文件和短音频），至**每百万 token 0.93 美元 + 0.70 美元**（流式/消息）。文件转录支持最长 12 小时、最大 2 GB；短音频最长 5 分钟、最大 2 GB。 |
| **Qwen Audio 3.1 ASR-Next** | 说话人归属和时间戳，以及情绪、环境事件和机器声的识别。 | Qwen 已宣布此型号，但当前 Model Studio 和 QwenCloud 文档没有公开 API 模型 ID、地区、价格或限制。 | **尚未公开文档说明** |
| **Qwen Audio 3.1 TTS** | 多语言语音、跨语言声音迁移，以及通过提示词控制表达方式。 | `qwen-audio-3.1-tts-flash`出现在阿里巴巴的价格通知中。本文查阅的[声音克隆 API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)仍列出 3.0 TTS Flash。 | 新加坡价格：**每百万文本输入 token 0.23 美元 + 每百万音频输出 token 1.87 美元**。本文查阅的 3.1 资料未说明当前公开使用限制。 |
| **Qwen Audio 3.1 TTS-Next** | 联合生成语音、音效和背景音频。 | 在北京提供托管式非流式 HTTPS API，文档支持中文和英文。 | **每百万输入 token 0.848 美元 + 每百万输出 token 1.696 美元**。输入最多 3,000 个字符；播客输出最长四分钟，其他输出最长两分钟。 |
| **Qwen Audio 3.1 Realtime Plus** | 支持打断和工具调用的全双工语音对话。 | 在新加坡和北京提供托管 WebSocket API。[指南](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)列出 11 种语言。 | 新加坡价格：**每百万文本输入 token 0.80 美元、音频输入 token 6.40 美元、文本输出 token 6.40 美元、音频输出 token 24 美元**。最多保留 50 轮音频对话，或 300 秒音频历史。 |

这些都是托管 API 产品。BIG CHANGE 未找到可下载的 3.1 模型权重或模型权重许可。QwenAudio GitHub 仓库中的 MIT 许可证适用于项目网站，不应被解读为模型的许可证。

语言数量也因文档而异。Qwen 的[认证公告](https://www.sina.cn/news/detail/5346330620985983.html)称 ASR 支持 30 种语言和 16 种汉语方言；国际版 API 指南则列出 30 种语言和 10 种方言。开发者应采用其实际可调用端点对应的语言列表。

## 95% 的说法无法直接对应公开价格表

阿里巴巴的[调价通知](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1)于 9 月 22 日生效。其精确对比针对`qwen-audio-3.0-realtime-flash`，而不是新款 3.1 Realtime Plus。新加坡的降价幅度按（旧价格 − 新价格）/ 旧价格计算：

| Realtime Flash 数据流 | 调价前（美元） | 调价后（美元） | 降幅 |
| --- | --- | --- | --- |
| 文本输入，每百万 token | 0.45 美元 | 0.23 美元 | 48.89% |
| 音频输入，每百万 token | 4.50 美元 | 0.93 美元 | 79.33% |
| 文本输出，每百万 token | 4.50 美元 | 0.70 美元 | 84.44% |
| 输出（文本 + 音频），每百万 token | 15.00 美元 | 1.87 美元 | **87.53%** |

同一通知将 3.1 TTS Flash 的价格从每 10,000 个字符 0.15 美元，改为分别按输入和输出 token 计价。[当前价格页面](https://www.alibabacloud.com/help/en/model-studio/model-pricing)同样将 3.1 ASR 列为按输入和输出 token 计费，而 3.0 ASR 则按音频秒数收费，输出免费。因此，这两种计价方式之间的百分比差异取决于文本内容、音频时长和 token 切分方式。本文查阅的公开价格表无法据此还原确切的 ASR 降价 95%。

## 独立证据仍来自 Qwen 3.0

在发布当天查阅的来源中，没有针对五款 3.1 模型的独立测试。Qwen 自己的[ASR 项目页面](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md)报告了基准测试结果，但也表示尚未经过独立复测。

Artificial Analysis 将[Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice)列为其语音服务商竞技场排名第二（涵盖所有口音和类别），Elo 评分为 1,259，95% 置信区间为正负 17，包含 1,447 个盲测比较样本。在单独的[语音智能体竞技场](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)中，Qwen Audio 3.0 Realtime Plus 的偏好 Elo 得分为 699，首次音频生成时间为 1.54 秒。参与者会在分配的情境中与隐藏身份的模型进行实时对话并作出比较。

## Sources

- [阿里巴巴推出 Qwen Audio 3.1，带来五款新模型](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — 用于发现新闻的报道，总结了五款模型的发布，并将 TTS、实时音频和 ASR 的大致降价幅度归于 Qwen。BIG CHANGE 根据阿里巴巴自己的价格表核对了价格。
- [Qwen Audio 3.1 发布公告](https://www.sina.cn/news/detail/5346330620985983.html) — 经认证的 Qwen 账号帖文，列出五款型号及其目标功能。能力和速度说法仍属于厂商声明。
- [Model Studio 部分音频模型降价通知](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 阿里巴巴于 9 月 22 日发布的官方调价通知，列出 3.0 Realtime Flash 在新加坡的精确调价前后价格，并说明 3.1 TTS Flash 的计费单位发生变化。
- [Model Studio 模型定价](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 当前官方价格按型号、模态和地区列出，其中包括 3.1 ASR 和 Realtime Plus。
- [QwenCloud 语音转文本模型](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — 当前 ASR 端点 ID、接入方式、语言列表、说话人分离支持和时长限制。
- [QwenCloud 实时音频聊天](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — 当前 3.1 Realtime Plus WebSocket 示例、声音和语言支持，以及对话内容保留限制。
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — 官方说明该 API 仅在北京提供，并列出价格、语言、输入长度和输出时长限制。
- [Qwen Audio 3.1 ASR 项目页面](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — 不可变的 Qwen 项目页面，列出 ASR 和 ASR-Next 功能及厂商公布的基准测试；页面注明这些结果未经过独立复现。
- [Artificial Analysis 文本转语音排行榜](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — 对上一代 Qwen Audio 3.0 TTS Plus 的盲测偏好结果，包括样本数量和置信区间。
- [Artificial Analysis 语音智能体竞技场](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — 对 Qwen Audio 3.0 Realtime Plus 的偏好结果和首次音频生成时间；并非 3.1 评测。
- [语音克隆 HTTP API 参考文档](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 当前目标模型示例列出 3.0 TTS Flash，不能独立证实 3.1 合成语音的集成路径。
