阿里巴巴 Qwen 團隊推出五款 Qwen Audio 3.1 模型,涵蓋轉錄、語音生成與即時語音互動。ASR、TTS-Next 與 Realtime Plus 都有文件記載的託管端點。TTS Flash 公布了模型 ID 與價格,但整合文件較不完整;BIG CHANGE 檢視的公開開發者文件中,ASR-Next 尚無模型 ID、區域或價格資訊。

The Decoder 報導Qwen 宣稱文字轉語音降價約 70%、即時音訊降價 85%,語音辨識最高降價 95%。核對這些數字時,計價單位也很重要。

重大變化

  • 有哪些改變:Qwen 現在以同一個託管模型系列涵蓋更多語音產品功能,從轉錄、語音生成到聲景製作與即時對話都有;但五項產品的開發者存取文件完整度不一。
  • 為何重要:開發者若要編列轉錄或語音服務的預算,現在光知道音訊分鐘數已不足以估算每個端點的費用。以 token 計費的 ASR 同時計入輸入音訊與輸出文字;即時對話則有四種分開計價的資料流。
  • 後續觀察重點:除了 ASR-Next 的開放情況,也要留意獨立的語言與延遲測試是否證實確有成本節省。若結果屬實,接下來要看語音代理、轉錄與配音服務商是否將節省轉化為客戶優惠,以及競爭對手的語音 API 是否跟進。

五款模型一覽

已公布模型

預定用途

截至 9 月 23 日有文件記載的存取方式

價格與實際限制

Qwen Audio 3.1 ASR

串流、檔案與短音訊轉錄;檔案及短音訊端點可選擇說話者分離。

新加坡與北京提供託管 WebSocket 或 HTTP API。國際版指南列出 30 種語言及 10 種中文方言。

新加坡費率從每百萬音訊輸入 token 0.15 美元,加上每百萬文字輸出 token 0.47 美元適用於檔案或短音訊轉錄;串流/訊息則為0.93 美元加 0.70 美元。檔案轉錄上限為 12 小時/2 GB;短音訊上限為 5 分鐘/2 GB。

Qwen Audio 3.1 ASR-Next

說話者歸屬與時間戳記,並可辨識情緒、環境事件及機械聲。

Qwen 已公布此模型;但在目前的 Model Studio 與 QwenCloud 文件中,找不到公開 API 模型 ID、開放區域、費率或使用上限。

尚無公開文件說明

Qwen Audio 3.1 TTS

支援多語言語音、跨語言聲音轉換,以及以提示詞控制表達方式。

qwen-audio-3.1-tts-flash列於阿里巴巴的價格公告中。本文檢視的語音複製 API仍只列出 3.0 TTS Flash。

新加坡:每百萬文字輸入 token 0.23 美元,加上每百萬音訊輸出 token 1.87 美元。本文檢視的 3.1 資料未說明目前公開使用上限。

Qwen Audio 3.1 TTS-Next

共同生成語音、音效與背景音訊。

北京提供有文件記載的非串流 HTTPS 託管 API,支援中文與英文。

每百萬輸入 token 0.848 美元,加上每百萬輸出 token 1.696 美元。輸入上限為 3,000 字元;Podcast 音訊最長 4 分鐘,其他內容最長 2 分鐘。

Qwen Audio 3.1 Realtime Plus

具備插話及工具呼叫功能的全雙工語音對話。

新加坡與北京提供託管 WebSocket API。指南列出 11 種語言。

新加坡:每百萬文字輸入 token 0.80 美元、音訊輸入 token 6.40 美元、文字輸出 token 6.40 美元,以及音訊輸出 token 24 美元。對話紀錄最多保留 50 個音訊輪次或 300 秒音訊。

以上都是託管 API 產品。BIG CHANGE 找不到可下載的 3.1 模型權重或權重授權條款。QwenAudio GitHub 儲存庫採用的 MIT 授權適用於專案網站,不應視為模型的授權。

語言數量也因文件而異。Qwen 的已驗證發布貼文稱 ASR 支援 30 種語言與 16 種中文方言;國際版 API 指南則列出 30 種語言與 10 種中文方言。開發者應以實際可呼叫端點所附的清單為準。

降價 95% 的說法無法從公開費率表直接得證

阿里巴巴的價格調整公告於 9 月 22 日生效;其精確比較的是舊版 Realtime Flash 串流費率qwen-audio-3.0-realtime-flash,而非新版 3.1 Realtime Plus。新加坡費率降幅按(舊費率 − 新費率)/舊費率計算:

Realtime Flash 串流服務

調降前(美元)

調降後(美元)

降幅

每百萬 token 的文字輸入

0.45 美元

0.23 美元

48.89%

每百萬 token 的音訊輸入

4.50 美元

0.93 美元

79.33%

每百萬 token 的文字輸出

4.50 美元

0.70 美元

84.44%

每百萬 token 的輸出(文字+音訊)

15.00 美元

1.87 美元

87.53%

同一份公告將 3.1 TTS Flash 的計價方式,從每 10,000 字元 0.15 美元改為輸入與輸出分開按 token 計費。目前的價格頁同樣列出 3.1 ASR 的輸入與輸出 token 費率,而 3.0 ASR 則按音訊秒數計費、輸出免費。兩種計價方式的降幅會因文字內容、音訊長度與 tokenization 而異。因此,本文檢視的公開價格表無法重現 ASR 精確降價 95% 的說法。

獨立證據仍屬於 Qwen 3.0

發布當日檢視的來源中,沒有 Qwen Audio 3.1 五款模型的獨立測試。Qwen 自行維護的ASR 專案頁公布了基準測試結果,但也表示尚未經獨立重測。

Artificial Analysis 將Qwen Audio 3.0 TTS Plus列為語音供應商排行榜(涵蓋所有口音與類別)第二名,Elo 分數為 1,259;95% 信賴區間為正負 17,並依據 1,447 個盲測比較樣本。另一項語音代理排行榜中,Qwen Audio 3.0 Realtime Plus 的偏好 Elo 分數為 699,首次輸出音訊需時 1.54 秒。參與者會在指定情境的即時對話中,盲測比較隱藏身分的模型。