Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 擴充語音產品線;降價 95% 的說法仍需脈絡
> Qwen Audio 3.1 新增聲音生成與理解功能,但 API 文件完整度不一;計價單位變動也讓宣稱的 ASR 節省幅度更難比較。
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
阿里巴巴 Qwen 團隊推出五款 Qwen Audio 3.1 模型,涵蓋轉錄、語音生成與即時語音互動。ASR、TTS-Next 與 Realtime Plus 都有文件記載的託管端點。TTS Flash 公布了模型 ID 與價格,但整合文件較不完整;BIG CHANGE 檢視的公開開發者文件中,ASR-Next 尚無模型 ID、區域或價格資訊。
[The Decoder 報導](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent)Qwen 宣稱文字轉語音降價約 70%、即時音訊降價 85%,語音辨識最高降價 95%。核對這些數字時,計價單位也很重要。
## 重大變化
- **有哪些改變:**Qwen 現在以同一個託管模型系列涵蓋更多語音產品功能,從轉錄、語音生成到聲景製作與即時對話都有;但五項產品的開發者存取文件完整度不一。
- **為何重要:**開發者若要編列轉錄或語音服務的預算,現在光知道音訊分鐘數已不足以估算每個端點的費用。以 token 計費的 ASR 同時計入輸入音訊與輸出文字;即時對話則有四種分開計價的資料流。
- **後續觀察重點:**除了 ASR-Next 的開放情況,也要留意獨立的語言與延遲測試是否證實確有成本節省。若結果屬實,接下來要看語音代理、轉錄與配音服務商是否將節省轉化為客戶優惠,以及競爭對手的語音 API 是否跟進。
## 五款模型一覽
| 已公布模型 | 預定用途 | 截至 9 月 23 日有文件記載的存取方式 | 價格與實際限制 |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | 串流、檔案與短音訊轉錄;檔案及短音訊端點可選擇說話者分離。 | 新加坡與北京提供託管 WebSocket 或 HTTP API。[國際版指南](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)列出 30 種語言及 10 種中文方言。 | 新加坡費率從**每百萬音訊輸入 token 0.15 美元,加上每百萬文字輸出 token 0.47 美元**適用於檔案或短音訊轉錄;串流/訊息則為**0.93 美元加 0.70 美元**。檔案轉錄上限為 12 小時/2 GB;短音訊上限為 5 分鐘/2 GB。 |
| **Qwen Audio 3.1 ASR-Next** | 說話者歸屬與時間戳記,並可辨識情緒、環境事件及機械聲。 | Qwen 已公布此模型;但在目前的 Model Studio 與 QwenCloud 文件中,找不到公開 API 模型 ID、開放區域、費率或使用上限。 | **尚無公開文件說明** |
| **Qwen Audio 3.1 TTS** | 支援多語言語音、跨語言聲音轉換,以及以提示詞控制表達方式。 | `qwen-audio-3.1-tts-flash`列於阿里巴巴的價格公告中。本文檢視的[語音複製 API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)仍只列出 3.0 TTS Flash。 | 新加坡:**每百萬文字輸入 token 0.23 美元,加上每百萬音訊輸出 token 1.87 美元**。本文檢視的 3.1 資料未說明目前公開使用上限。 |
| **Qwen Audio 3.1 TTS-Next** | 共同生成語音、音效與背景音訊。 | 北京提供有文件記載的非串流 HTTPS 託管 API,支援中文與英文。 | **每百萬輸入 token 0.848 美元,加上每百萬輸出 token 1.696 美元**。輸入上限為 3,000 字元;Podcast 音訊最長 4 分鐘,其他內容最長 2 分鐘。 |
| **Qwen Audio 3.1 Realtime Plus** | 具備插話及工具呼叫功能的全雙工語音對話。 | 新加坡與北京提供託管 WebSocket API。[指南](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)列出 11 種語言。 | 新加坡:**每百萬文字輸入 token 0.80 美元、音訊輸入 token 6.40 美元、文字輸出 token 6.40 美元,以及音訊輸出 token 24 美元**。對話紀錄最多保留 50 個音訊輪次或 300 秒音訊。 |
以上都是託管 API 產品。BIG CHANGE 找不到可下載的 3.1 模型權重或權重授權條款。QwenAudio GitHub 儲存庫採用的 MIT 授權適用於專案網站,不應視為模型的授權。
語言數量也因文件而異。Qwen 的[已驗證發布貼文](https://www.sina.cn/news/detail/5346330620985983.html)稱 ASR 支援 30 種語言與 16 種中文方言;國際版 API 指南則列出 30 種語言與 10 種中文方言。開發者應以實際可呼叫端點所附的清單為準。
## 降價 95% 的說法無法從公開費率表直接得證
阿里巴巴的[價格調整公告](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1)於 9 月 22 日生效;其精確比較的是舊版 Realtime Flash 串流費率`qwen-audio-3.0-realtime-flash`,而非新版 3.1 Realtime Plus。新加坡費率降幅按(舊費率 − 新費率)/舊費率計算:
| Realtime Flash 串流服務 | 調降前(美元) | 調降後(美元) | 降幅 |
| --- | --- | --- | --- |
| 每百萬 token 的文字輸入 | 0.45 美元 | 0.23 美元 | 48.89% |
| 每百萬 token 的音訊輸入 | 4.50 美元 | 0.93 美元 | 79.33% |
| 每百萬 token 的文字輸出 | 4.50 美元 | 0.70 美元 | 84.44% |
| 每百萬 token 的輸出(文字+音訊) | 15.00 美元 | 1.87 美元 | **87.53%** |
同一份公告將 3.1 TTS Flash 的計價方式,從每 10,000 字元 0.15 美元改為輸入與輸出分開按 token 計費。[目前的價格頁](https://www.alibabacloud.com/help/en/model-studio/model-pricing)同樣列出 3.1 ASR 的輸入與輸出 token 費率,而 3.0 ASR 則按音訊秒數計費、輸出免費。兩種計價方式的降幅會因文字內容、音訊長度與 tokenization 而異。因此,本文檢視的公開價格表無法重現 ASR 精確降價 95% 的說法。
## 獨立證據仍屬於 Qwen 3.0
發布當日檢視的來源中,沒有 Qwen Audio 3.1 五款模型的獨立測試。Qwen 自行維護的[ASR 專案頁](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md)公布了基準測試結果,但也表示尚未經獨立重測。
Artificial Analysis 將[Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice)列為語音供應商排行榜(涵蓋所有口音與類別)第二名,Elo 分數為 1,259;95% 信賴區間為正負 17,並依據 1,447 個盲測比較樣本。另一項[語音代理排行榜](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)中,Qwen Audio 3.0 Realtime Plus 的偏好 Elo 分數為 699,首次輸出音訊需時 1.54 秒。參與者會在指定情境的即時對話中,盲測比較隱藏身分的模型。
## Sources
- [阿里巴巴推出 Qwen Audio 3.1,新增五款模型](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — 介紹五款新模型的報導,並將文字轉語音、即時音訊及 ASR 的約略降價歸因於 Qwen。BIG CHANGE 另以阿里巴巴官方費率表核對價格。
- [Qwen Audio 3.1 發布貼文](https://www.sina.cn/news/detail/5346330620985983.html) — 經驗證的 Qwen 官方帳號貼文,列出五款模型及其預定功能。能力與速度的說法仍屬供應商主張。
- [Model Studio 部分音訊模型降價公告](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 9 月 22 日生效的官方價格調整,列出 3.0 Realtime Flash 新加坡地區調整前後的確切費率,以及 3.1 TTS Flash 計價單位的變更。
- [Model Studio 模型價格](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 官方現行價格依模型、模態與地區列示,包含 3.1 ASR 與 Realtime Plus。
- [QwenCloud 語音轉文字模型](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — 目前 ASR 端點 ID、存取方式、語言清單、說話者分離支援與時長限制。
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — 現行 3.1 Realtime Plus WebSocket 範例、語音與語言支援,以及對話記錄保留限制。
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — 官方文件列出的 API 僅在北京提供,並說明價格、語言、輸入長度與輸出時長限制。
- [Qwen Audio 3.1 ASR 專案頁](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — 不可變更的 Qwen 專案頁,說明 ASR 與 ASR-Next 功能及供應商公布的基準測試;頁面指出結果未經獨立重現。
- [Artificial Analysis 文字轉語音排行榜](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — 前一代 Qwen Audio 3.0 TTS Plus 的盲測偏好結果,包含樣本數及信賴區間。
- [Artificial Analysis 語音代理排行榜](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — 前一代 Qwen Audio 3.0 Realtime Plus 的另一項偏好與首次輸出音訊時間結果,並非 3.1 評估。
- [語音複製 HTTP API 參考文件](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 目前目標模型範例列出 3.0 TTS Flash,無法獨立確認 3.1 的語音合成整合方式。
BIG CHANGE 電子報
掌握全貌,按照自己的步調。
關於人工智慧和機器人技術的近期報導、值得關注的轉變,以及可運用的實用想法。選擇每日快訊、每週摘要或每月觀點。
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.