Alibabas Qwen-Team hat fünf Qwen-Audio-3.1-Modelle für Transkription, Sprachgenerierung und Sprachdialog in Echtzeit vorgestellt. Für ASR, TTS-Next und Realtime Plus sind gehostete Endpunkte dokumentiert. TTS Flash hat eine veröffentlichte Modell-ID und einen Preis, aber weniger vollständige Integrationshinweise. In den geprüften öffentlichen Entwicklerdokumenten gibt es für ASR-Next weder eine Modell-ID noch eine Region oder einen Preis.

The Decoder berichtete, Qwen habe Preissenkungen von etwa 70 Prozent für Text-to-Speech, 85 Prozent für Echtzeit-Audio und bis zu 95 Prozent für Spracherkennung angekündigt. Für die Überprüfung dieser Angaben kommt es auf die Abrechnungseinheiten an.

Die große Veränderung

  • Was sich geändert hat: Qwen deckt innerhalb einer gehosteten Modellfamilie nun mehr Bereiche eines Sprachprodukts ab – von Transkription und Sprachgenerierung bis zur Erzeugung von Klangkulissen und Live-Gesprächen. Die fünf Komponenten bieten Entwicklerzugang jedoch noch nicht im gleichen Umfang.
  • Warum das wichtig ist: Für Entwickler, die Transkriptions- oder Sprachdienste budgetieren, reicht eine Audiominute nicht mehr aus, um jeden Endpunkt zu bepreisen. Bei tokenbasierter ASR werden sowohl das eingehende Audio als auch der resultierende Text berechnet; ein Live-Gespräch umfasst vier getrennt bepreiste Datenströme.
  • Worauf zu achten ist: Neben dem Zugang zu ASR-Next ist zu beobachten, ob unabhängige Sprach- und Latenztests nützliche Einsparungen bestätigen. Falls ja, stellt sich als Nächstes die Frage, ob Anbieter von Sprachagenten, Transkriptions- und Synchronisationsdiensten diese Einsparungen an ihre Kunden weitergeben und ob konkurrierende Sprach-APIs nachziehen.

Die fünf Modelle im Überblick

Angekündigtes Modell

Vorgesehener Einsatz

Dokumentierter Zugang am 23. September

Preis und praktische Grenze

Qwen Audio 3.1 ASR

Streaming-, Datei- und Kurzform-Transkription; optionale Sprechererkennung bei Datei- und Kurzform-Endpunkten

Gehostete WebSocket- oder HTTP-APIs in Singapur und Peking. Der internationale Leitfaden führt 30 Sprachen und 10 chinesische Dialektvarianten auf.

In Singapur liegen die Preise zwischen 0,15 USD je Million Audio-Eingabetoken + 0,47 USD je Million Text-Ausgabetoken bei Datei- und Kurzform-Transkription und 0,93 + 0,70 USD bei Streaming und Nachrichten. Datei-Transkription unterstützt bis zu 12 Stunden und 2 GB; Kurzform-Transkription bis zu 5 Minuten und 2 GB.

Qwen Audio 3.1 ASR-Next

Sprecherzuordnung und Zeitstempel sowie Erkennung von Emotionen, Umgebungsereignissen und Maschinengeräuschen

Von Qwen angekündigt; in der aktuellen Dokumentation zu Model Studio und QwenCloud wurde keine öffentliche API-Modell-ID, Region, Rate oder Begrenzung gefunden.

Öffentlich nicht dokumentiert

Qwen Audio 3.1 TTS

Mehrsprachige Sprachausgabe, sprachübergreifende Stimmübertragung und per Prompt steuerbare Vortragsweise

qwen-audio-3.1-tts-flash wird in Alibabas Preisankündigung aufgeführt. Die geprüfte API zum Stimmenklonen nennt weiterhin TTS Flash 3.0.

Singapur: 0,23 USD je Million Text-Eingabetoken + 1,87 USD je Million Audio-Ausgabetoken. In den geprüften Unterlagen zu Version 3.1 waren keine aktuellen öffentlichen Limits angegeben.

Qwen Audio 3.1 TTS-Next

Gemeinsame Erzeugung von Sprache, Effekten und Hintergrund-Audio

Gehostete HTTPS-API ohne Streaming in Peking; laut Dokumentation für Chinesisch und Englisch verfügbar

0,848 USD je Million Eingabetoken + 1,696 USD je Million Ausgabetoken. Höchstens 3.000 Eingabezeichen; Podcast-Ausgabe bis zu vier Minuten, sonst bis zu zwei Minuten.

Qwen Audio 3.1 Realtime Plus

Vollduplex-Sprachdialog mit Unterbrechungen und Werkzeugaufrufen

Gehostete WebSocket-API in Singapur und Peking. Der Leitfaden führt 11 Sprachen auf.

Singapur: 0,80 USD je Million Text-Eingabetoken, 6,40 USD je Million Audio-Eingabetoken, 6,40 USD je Million Text-Ausgabetoken und 24 USD je Million Audio-Ausgabetoken. Im Gesprächsverlauf bleiben bis zu 50 Audio-Turns oder 300 Sekunden Audio erhalten.

Dies sind gehostete API-Produkte. BIG CHANGE fand weder herunterladbare Modellgewichte für Version 3.1 noch eine Lizenz für solche Gewichte. Die MIT-Lizenz im GitHub-Repository von QwenAudio gilt für die Projektwebsite und sollte nicht als Lizenz für die Modelle verstanden werden.

Auch die Sprachenzahl hängt von der Dokumentation ab. Im verifizierten Launch-Beitrag von Qwen steht, ASR unterstütze 30 Sprachen und 16 chinesische Dialekte; der internationale API-Leitfaden nennt 30 Sprachen und 10 Dialektvarianten. Entwickler sollten die Liste des Endpunkts verwenden, den sie tatsächlich aufrufen können.

Die 95-Prozent-Angabe lässt sich nicht direkt aus der öffentlichen Preistabelle ableiten

Alibabas Mitteilung zur Preisänderung trat am 22. September in Kraft. Der genaue Vergleich bezieht sich auf qwen-audio-3.0-realtime-flash, nicht auf das neue Realtime Plus 3.1. Die Rückgänge für Singapur werden so berechnet: (alter Tarif − neuer Tarif) / alter Tarif.

Realtime-Flash-Stream

Vorher (USD)

Nachher (USD)

Rückgang

Texteingabe, je Million Token

0,45 $

0,23 $

48,89 %

Audioeingabe, je Million Token

4,50 $

0,93 $

79,33 %

Textausgabe, je Million Token

4,50 $

0,70 $

84,44 %

Ausgabe (Text + Audio), je Million Token

15,00 $

1,87 $

87,53 %

Dieselbe Mitteilung stellt TTS Flash 3.1 von 0,15 US-Dollar je 10.000 Zeichen auf getrennte Tarife für Ein- und Ausgabetoken um. Die aktuelle Preisseite führt ASR 3.1 ebenfalls mit Preisen je Ein- und Ausgabetoken auf; ASR 3.0 wird dagegen pro Audiosekunde berechnet, die Ausgabe ist kostenlos. Der prozentuale Vergleich zwischen den beiden Abrechnungsarten hängt von Text, Audiodauer und Tokenisierung ab. Mit den hier geprüften öffentlichen Tabellen lässt sich daher keine genaue ASR-Preissenkung von 95 Prozent nachvollziehen.

Unabhängige Belege gibt es weiterhin nur für Qwen 3.0

Am Veröffentlichungstag gab es in den geprüften Quellen keinen unabhängigen Test der fünf 3.1-Modelle. Qwens eigene ASR-Projektseite berichtet Benchmark-Ergebnisse, weist aber darauf hin, dass sie nicht unabhängig wiederholt wurden.

Artificial Analysis führt Qwen Audio 3.0 TTS Plus in seiner Anbieter-Spracharena (alle Akzente und Kategorien) mit 1.259 Elo-Punkten auf Rang zwei; das 95-Prozent-Konfidenzintervall beträgt plus/minus 17 bei 1.447 verblindeten Vergleichsproben. In einer separaten Sprachagenten-Arena erzielte Qwen Audio 3.0 Realtime Plus eine Präferenzwertung von 699 Elo und gab den ersten Audioton nach 1,54 Sekunden aus. In den Live-Gesprächen vergleichen die Teilnehmenden verborgene Modelle anhand vorgegebener Szenarien.