AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1で音声機能を拡充。95%値下げの主張には前提がある

> Qwen Audio 3.1は音声の生成と理解を追加した。APIの説明にはばらつきがあり、課金単位の変更によって、うたわれる音声認識（ASR）の節約額は比較しにくい。

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

AlibabaのQwenチームは、文字起こし、音声生成、リアルタイム音声対話をカバーする5種類のQwen Audio 3.1モデルを発表した。ASR、TTS-Next、Realtime Plusには、仕様が公開されたホステッドAPIがある。TTS FlashはモデルIDと料金が公表されているものの、統合方法の説明は十分でない。BIG CHANGEが確認した公開開発者向け資料には、ASR-NextのモデルID、提供地域、料金が見当たらなかった。

[The Decoderの報道](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent)によると、Qwenは音声合成で約70%、リアルタイム音声で85%、音声認識で最大95%の値下げをうたっている。これらの数字を検証する際は課金単位が重要だ。

## 大きな変化

- **何が変わったか：**Qwenは文字起こしや音声生成から音響環境の生成、リアルタイム会話まで、音声製品の機能を一つのホステッドモデル群で広げた。ただし、5つの構成要素すべてで開発者向けアクセスが同じ程度に整っているわけではない。
- **なぜ重要か：**文字起こしや音声サービスの予算を組む開発者にとって、音声1分当たりの料金だけでは各APIの費用を比較できなくなった。トークン課金のASRでは、入力音声と出力テキストの両方が課金対象となる。ライブ会話では4つのストリームに別々の料金が設定されている。
- **今後の注目点：**ASR-Nextへのアクセスに加え、独立した言語別・遅延テストで実用的な節約が確認されるかを見る必要がある。確認されれば次の問いは、音声エージェント、文字起こし、吹き替えの各サービスが節約分を顧客価格に反映するか、競合する音声APIも追随するかだ。

## 5モデルの構成

| 発表されたモデル | 想定用途 | 9月23日時点で確認できたアクセス方法 | 料金と実用上の制限 |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | ストリーミング、ファイル、短尺音声の文字起こし。ファイルおよび短尺の各エンドポイントでは話者ダイアライゼーションも利用可能。 | シンガポールと北京で、ホステッドWebSocketまたはHTTP APIを提供。[国際APIガイド](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)には30言語と中国語の10方言が記載されている。 | シンガポール料金は、ファイル・短尺音声では**音声入力100万トークン当たり0.15ドル＋テキスト出力100万トークン当たり0.47ドル**から、ストリーミング／メッセージでは**0.93ドル＋0.70ドル**まで。ファイル文字起こしは最長12時間・2GB、短尺音声は最長5分・2GB。 |
| **Qwen Audio 3.1 ASR-Next** | 話者の識別とタイムスタンプに加え、感情、周囲の出来事、機械音を認識。 | Qwenが発表。現在のModel StudioおよびQwenCloudの資料では、公開APIのモデルID、提供地域、料金、利用上限は確認できない。 | **公開資料なし** |
| **Qwen Audio 3.1 TTS** | 多言語音声、言語をまたいだ音声変換、プロンプトによる話し方の制御。 | `qwen-audio-3.1-tts-flash`はAlibabaの料金告知に掲載されている。確認した[音声クローンAPI](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)の記載は、引き続き3.0 TTS Flashを対象としている。 | シンガポール：**テキスト入力100万トークン当たり0.23ドル＋音声出力100万トークン当たり1.87ドル**。確認した3.1関連資料には、現在の公開利用上限が明記されていない。 |
| **Qwen Audio 3.1 TTS-Next** | 音声、効果音、背景音を同時に生成。 | 北京でホステッドHTTPS APIを提供。中国語と英語に対応すると説明されている。 | **入力100万トークン当たり0.848ドル＋出力100万トークン当たり1.696ドル**。入力は最大3,000文字。ポッドキャスト音声は4分、その他は2分まで。 |
| **Qwen Audio 3.1 Realtime Plus** | 割り込みとツール呼び出しに対応する全二重音声会話。 | シンガポールと北京でホステッドWebSocket APIを提供。[ガイド](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)には11言語が記載されている。 | シンガポール：**テキスト入力100万トークン当たり0.80ドル、音声入力6.40ドル、テキスト出力6.40ドル、音声出力24ドル（いずれも100万トークン当たり）**。音声履歴は最大50ターン、または300秒まで保持される。 |

これらはホステッドAPI製品だ。BIG CHANGEはダウンロード可能な3.1モデルの重みや、その利用ライセンスを確認できなかった。QwenAudioのGitHubリポジトリにあるMITライセンスが適用されるのはプロジェクトのウェブサイトであり、モデルのライセンスを示すものとして解釈すべきではない。

対応言語数は資料によっても異なる。Qwenの[認証済みのローンチ投稿](https://www.sina.cn/news/detail/5346330620985983.html)ではASRは30言語と中国語16方言に対応するとしている。一方、国際APIガイドに記載されているのは30言語と10方言だ。開発者は実際に呼び出せるエンドポイントに付属する一覧を使うべきだ。

## 95%の主張は公開料金表から再現できない

Alibabaの[料金改定告知](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1)は9月22日に発効した。正確な比較対象は`qwen-audio-3.0-realtime-flash`であり、新しい3.1 Realtime Plusではない。シンガポールの値下げ率は（旧料金－新料金）÷旧料金で計算した：

| シンガポールでのRealtime Flashストリーム | 改定前（米ドル） | 改定後（米ドル） | 値下げ率 |
| --- | --- | --- | --- |
| テキスト入力、100万トークン当たり | 0.45ドル | 0.23ドル | 48.89% |
| 音声入力、100万トークン当たり | 4.50ドル | 0.93ドル | 79.33% |
| テキスト出力、100万トークン当たり | 4.50ドル | 0.70ドル | 84.44% |
| 出力（テキスト＋音声）、100万トークン当たり | 15.00ドル | 1.87ドル | **87.53%** |

同じ告知により、3.1 TTS Flashの課金単位は、文字数1万字当たり0.15ドルから、入力・出力トークン別の料金に変わった。[現在の料金ページ](https://www.alibabacloud.com/help/en/model-studio/model-pricing)にも、3.1 ASRは入力・出力トークン単位と記載されている。一方、3.0 ASRは音声秒単位で課金され、出力は無料だ。どちらの組み合わせでも値下げ率を算出するには、テキスト量、音声の長さ、トークン化方式が関わる。したがって、ここで確認した公開料金表から正確なASRの95%値下げを再現することはできない。

## 独立した評価は、現時点ではQwen 3.0が対象

ローンチ日に確認した資料には、3.1の5モデルを対象とする独立試験はなかった。Qwen独自の[ASRプロジェクトページ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md)にはベンチマーク結果が掲載されているが、独立に再実施されていないと明記されている。

Artificial Analysisでは、[Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice)が提供元音声アリーナ（全アクセント・全カテゴリー）でElo 1,259、2位にランクインしている。95%信頼区間はプラスマイナス17、ブラインド比較のサンプル数は1,447件だった。別の[音声エージェントアリーナ](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)では、Qwen Audio 3.0 Realtime Plusは選好Elo 699、初回音声まで1.54秒を記録した。参加者は、シナリオを割り当てられたライブ会話で、モデル名を伏せたシステムを比較する。

## Sources

- [Alibaba、5モデルを含むQwen Audio 3.1を発表](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — 5モデルの発表をまとめ、TTS、リアルタイム音声、ASRの値下げをQwenの説明として紹介する。BIG CHANGEは料金をAlibabaの公式表と照合した。
- [Qwen Audio 3.1ローンチ投稿](https://www.sina.cn/news/detail/5346330620985983.html) — Qwenの認証済みアカウントによる投稿。5モデルの名称と想定機能を掲載。機能や速度に関する説明はベンダーの主張として扱う。
- [Model Studio：一部音声モデルの値下げ告知](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 9月22日の公式料金改定。3.0 Realtime Flashのシンガポールでの変更前後の正確な料金と、3.1 TTS Flashの課金単位変更を掲載。
- [Model Studioのモデル料金](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — モデル、モダリティ、地域ごとの現在の公式料金を掲載。3.1 ASRとRealtime Plusを含む。
- [QwenCloudの音声テキスト化モデル](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — 現在のASRエンドポイントID、接続方法、言語一覧、話者ダイアライゼーション対応、長さの上限を掲載。
- [QwenCloudリアルタイム音声チャット](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — 現行の3.1 Realtime PlusのWebSocket例、音声と言語の対応、保持可能な会話量を掲載。
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — 北京限定のAPI提供、料金、対応言語、入力長、出力時間の上限に関する公式説明。
- [Qwen Audio 3.1 ASRプロジェクトページ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASRおよびASR-Nextの機能とベンダー報告のベンチマークを掲載した、改変されていないQwenプロジェクトページ。結果は独立に再現されていないと明記されている。
- [Artificial Analysis：テキスト読み上げランキング](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — 旧モデルQwen Audio 3.0 TTS Plusのブラインド選好評価。サンプル数と信頼区間を含む。
- [Artificial Analysis：Speech Agent Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plusの別個の選好評価および初回音声までの時間。3.1の評価ではない。
- [音声クローンHTTP APIリファレンス](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 現行の対象モデル例は3.0 TTS Flashを指定している。3.1の音声合成を統合する経路があることを、独立に確認する資料ではない。
