阿里巴巴 Qwen 團隊推出五款 Qwen Audio 3.1 模型,涵蓋轉錄、語音生成與即時語音互動。ASR、TTS-Next 與 Realtime Plus 都有文件記載的託管端點。TTS Flash 公布了模型 ID 與價格,但整合文件較不完整;BIG CHANGE 檢視的公開開發者文件中,ASR-Next 尚無模型 ID、區域或價格資訊。
The Decoder 報導Qwen 宣稱文字轉語音降價約 70%、即時音訊降價 85%,語音辨識最高降價 95%。核對這些數字時,計價單位也很重要。
重大變化
- 有哪些改變:Qwen 現在以同一個託管模型系列涵蓋更多語音產品功能,從轉錄、語音生成到聲景製作與即時對話都有;但五項產品的開發者存取文件完整度不一。
- 為何重要:開發者若要編列轉錄或語音服務的預算,現在光知道音訊分鐘數已不足以估算每個端點的費用。以 token 計費的 ASR 同時計入輸入音訊與輸出文字;即時對話則有四種分開計價的資料流。
- 後續觀察重點:除了 ASR-Next 的開放情況,也要留意獨立的語言與延遲測試是否證實確有成本節省。若結果屬實,接下來要看語音代理、轉錄與配音服務商是否將節省轉化為客戶優惠,以及競爭對手的語音 API 是否跟進。
五款模型一覽
已公布模型 | 預定用途 | 截至 9 月 23 日有文件記載的存取方式 | 價格與實際限制 |
|---|---|---|---|
Qwen Audio 3.1 ASR | 串流、檔案與短音訊轉錄;檔案及短音訊端點可選擇說話者分離。 | 新加坡與北京提供託管 WebSocket 或 HTTP API。國際版指南列出 30 種語言及 10 種中文方言。 | 新加坡費率從每百萬音訊輸入 token 0.15 美元,加上每百萬文字輸出 token 0.47 美元適用於檔案或短音訊轉錄;串流/訊息則為0.93 美元加 0.70 美元。檔案轉錄上限為 12 小時/2 GB;短音訊上限為 5 分鐘/2 GB。 |
Qwen Audio 3.1 ASR-Next | 說話者歸屬與時間戳記,並可辨識情緒、環境事件及機械聲。 | Qwen 已公布此模型;但在目前的 Model Studio 與 QwenCloud 文件中,找不到公開 API 模型 ID、開放區域、費率或使用上限。 | 尚無公開文件說明 |
Qwen Audio 3.1 TTS | 支援多語言語音、跨語言聲音轉換,以及以提示詞控制表達方式。 | | 新加坡:每百萬文字輸入 token 0.23 美元,加上每百萬音訊輸出 token 1.87 美元。本文檢視的 3.1 資料未說明目前公開使用上限。 |
Qwen Audio 3.1 TTS-Next | 共同生成語音、音效與背景音訊。 | 北京提供有文件記載的非串流 HTTPS 託管 API,支援中文與英文。 | 每百萬輸入 token 0.848 美元,加上每百萬輸出 token 1.696 美元。輸入上限為 3,000 字元;Podcast 音訊最長 4 分鐘,其他內容最長 2 分鐘。 |
Qwen Audio 3.1 Realtime Plus | 具備插話及工具呼叫功能的全雙工語音對話。 | 新加坡與北京提供託管 WebSocket API。指南列出 11 種語言。 | 新加坡:每百萬文字輸入 token 0.80 美元、音訊輸入 token 6.40 美元、文字輸出 token 6.40 美元,以及音訊輸出 token 24 美元。對話紀錄最多保留 50 個音訊輪次或 300 秒音訊。 |
以上都是託管 API 產品。BIG CHANGE 找不到可下載的 3.1 模型權重或權重授權條款。QwenAudio GitHub 儲存庫採用的 MIT 授權適用於專案網站,不應視為模型的授權。
語言數量也因文件而異。Qwen 的已驗證發布貼文稱 ASR 支援 30 種語言與 16 種中文方言;國際版 API 指南則列出 30 種語言與 10 種中文方言。開發者應以實際可呼叫端點所附的清單為準。
降價 95% 的說法無法從公開費率表直接得證
阿里巴巴的價格調整公告於 9 月 22 日生效;其精確比較的是舊版 Realtime Flash 串流費率qwen-audio-3.0-realtime-flash,而非新版 3.1 Realtime Plus。新加坡費率降幅按(舊費率 − 新費率)/舊費率計算:
Realtime Flash 串流服務 | 調降前(美元) | 調降後(美元) | 降幅 |
|---|---|---|---|
每百萬 token 的文字輸入 | 0.45 美元 | 0.23 美元 | 48.89% |
每百萬 token 的音訊輸入 | 4.50 美元 | 0.93 美元 | 79.33% |
每百萬 token 的文字輸出 | 4.50 美元 | 0.70 美元 | 84.44% |
每百萬 token 的輸出(文字+音訊) | 15.00 美元 | 1.87 美元 | 87.53% |
同一份公告將 3.1 TTS Flash 的計價方式,從每 10,000 字元 0.15 美元改為輸入與輸出分開按 token 計費。目前的價格頁同樣列出 3.1 ASR 的輸入與輸出 token 費率,而 3.0 ASR 則按音訊秒數計費、輸出免費。兩種計價方式的降幅會因文字內容、音訊長度與 tokenization 而異。因此,本文檢視的公開價格表無法重現 ASR 精確降價 95% 的說法。
獨立證據仍屬於 Qwen 3.0
發布當日檢視的來源中,沒有 Qwen Audio 3.1 五款模型的獨立測試。Qwen 自行維護的ASR 專案頁公布了基準測試結果,但也表示尚未經獨立重測。
Artificial Analysis 將Qwen Audio 3.0 TTS Plus列為語音供應商排行榜(涵蓋所有口音與類別)第二名,Elo 分數為 1,259;95% 信賴區間為正負 17,並依據 1,447 個盲測比較樣本。另一項語音代理排行榜中,Qwen Audio 3.0 Realtime Plus 的偏好 Elo 分數為 699,首次輸出音訊需時 1.54 秒。參與者會在指定情境的即時對話中,盲測比較隱藏身分的模型。



