AlibabaのQwenチームは、文字起こし、音声生成、リアルタイム音声対話をカバーする5種類のQwen Audio 3.1モデルを発表した。ASR、TTS-Next、Realtime Plusには、仕様が公開されたホステッドAPIがある。TTS FlashはモデルIDと料金が公表されているものの、統合方法の説明は十分でない。BIG CHANGEが確認した公開開発者向け資料には、ASR-NextのモデルID、提供地域、料金が見当たらなかった。

The Decoderの報道によると、Qwenは音声合成で約70%、リアルタイム音声で85%、音声認識で最大95%の値下げをうたっている。これらの数字を検証する際は課金単位が重要だ。

大きな変化

  • 何が変わったか:Qwenは文字起こしや音声生成から音響環境の生成、リアルタイム会話まで、音声製品の機能を一つのホステッドモデル群で広げた。ただし、5つの構成要素すべてで開発者向けアクセスが同じ程度に整っているわけではない。
  • なぜ重要か:文字起こしや音声サービスの予算を組む開発者にとって、音声1分当たりの料金だけでは各APIの費用を比較できなくなった。トークン課金のASRでは、入力音声と出力テキストの両方が課金対象となる。ライブ会話では4つのストリームに別々の料金が設定されている。
  • 今後の注目点:ASR-Nextへのアクセスに加え、独立した言語別・遅延テストで実用的な節約が確認されるかを見る必要がある。確認されれば次の問いは、音声エージェント、文字起こし、吹き替えの各サービスが節約分を顧客価格に反映するか、競合する音声APIも追随するかだ。

5モデルの構成

発表されたモデル

想定用途

9月23日時点で確認できたアクセス方法

料金と実用上の制限

Qwen Audio 3.1 ASR

ストリーミング、ファイル、短尺音声の文字起こし。ファイルおよび短尺の各エンドポイントでは話者ダイアライゼーションも利用可能。

シンガポールと北京で、ホステッドWebSocketまたはHTTP APIを提供。国際APIガイドには30言語と中国語の10方言が記載されている。

シンガポール料金は、ファイル・短尺音声では音声入力100万トークン当たり0.15ドル+テキスト出力100万トークン当たり0.47ドルから、ストリーミング/メッセージでは0.93ドル+0.70ドルまで。ファイル文字起こしは最長12時間・2GB、短尺音声は最長5分・2GB。

Qwen Audio 3.1 ASR-Next

話者の識別とタイムスタンプに加え、感情、周囲の出来事、機械音を認識。

Qwenが発表。現在のModel StudioおよびQwenCloudの資料では、公開APIのモデルID、提供地域、料金、利用上限は確認できない。

公開資料なし

Qwen Audio 3.1 TTS

多言語音声、言語をまたいだ音声変換、プロンプトによる話し方の制御。

qwen-audio-3.1-tts-flashはAlibabaの料金告知に掲載されている。確認した音声クローンAPIの記載は、引き続き3.0 TTS Flashを対象としている。

シンガポール:テキスト入力100万トークン当たり0.23ドル+音声出力100万トークン当たり1.87ドル。確認した3.1関連資料には、現在の公開利用上限が明記されていない。

Qwen Audio 3.1 TTS-Next

音声、効果音、背景音を同時に生成。

北京でホステッドHTTPS APIを提供。中国語と英語に対応すると説明されている。

入力100万トークン当たり0.848ドル+出力100万トークン当たり1.696ドル。入力は最大3,000文字。ポッドキャスト音声は4分、その他は2分まで。

Qwen Audio 3.1 Realtime Plus

割り込みとツール呼び出しに対応する全二重音声会話。

シンガポールと北京でホステッドWebSocket APIを提供。ガイドには11言語が記載されている。

シンガポール:テキスト入力100万トークン当たり0.80ドル、音声入力6.40ドル、テキスト出力6.40ドル、音声出力24ドル(いずれも100万トークン当たり)。音声履歴は最大50ターン、または300秒まで保持される。

これらはホステッドAPI製品だ。BIG CHANGEはダウンロード可能な3.1モデルの重みや、その利用ライセンスを確認できなかった。QwenAudioのGitHubリポジトリにあるMITライセンスが適用されるのはプロジェクトのウェブサイトであり、モデルのライセンスを示すものとして解釈すべきではない。

対応言語数は資料によっても異なる。Qwenの認証済みのローンチ投稿ではASRは30言語と中国語16方言に対応するとしている。一方、国際APIガイドに記載されているのは30言語と10方言だ。開発者は実際に呼び出せるエンドポイントに付属する一覧を使うべきだ。

95%の主張は公開料金表から再現できない

Alibabaの料金改定告知は9月22日に発効した。正確な比較対象はqwen-audio-3.0-realtime-flashであり、新しい3.1 Realtime Plusではない。シンガポールの値下げ率は(旧料金-新料金)÷旧料金で計算した:

シンガポールでのRealtime Flashストリーム

改定前(米ドル)

改定後(米ドル)

値下げ率

テキスト入力、100万トークン当たり

0.45ドル

0.23ドル

48.89%

音声入力、100万トークン当たり

4.50ドル

0.93ドル

79.33%

テキスト出力、100万トークン当たり

4.50ドル

0.70ドル

84.44%

出力(テキスト+音声)、100万トークン当たり

15.00ドル

1.87ドル

87.53%

同じ告知により、3.1 TTS Flashの課金単位は、文字数1万字当たり0.15ドルから、入力・出力トークン別の料金に変わった。現在の料金ページにも、3.1 ASRは入力・出力トークン単位と記載されている。一方、3.0 ASRは音声秒単位で課金され、出力は無料だ。どちらの組み合わせでも値下げ率を算出するには、テキスト量、音声の長さ、トークン化方式が関わる。したがって、ここで確認した公開料金表から正確なASRの95%値下げを再現することはできない。

独立した評価は、現時点ではQwen 3.0が対象

ローンチ日に確認した資料には、3.1の5モデルを対象とする独立試験はなかった。Qwen独自のASRプロジェクトページにはベンチマーク結果が掲載されているが、独立に再実施されていないと明記されている。

Artificial Analysisでは、Qwen Audio 3.0 TTS Plusが提供元音声アリーナ(全アクセント・全カテゴリー)でElo 1,259、2位にランクインしている。95%信頼区間はプラスマイナス17、ブラインド比較のサンプル数は1,447件だった。別の音声エージェントアリーナでは、Qwen Audio 3.0 Realtime Plusは選好Elo 699、初回音声まで1.54秒を記録した。参加者は、シナリオを割り当てられたライブ会話で、モデル名を伏せたシステムを比較する。