AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1 erweitert das Sprachmodellangebot. Die Preissenkung um 95 Prozent muss eingeordnet werden
> Qwen Audio 3.1 ergänzt Audioerzeugung und -verständnis. Die API-Dokumentation ist uneinheitlich, und geänderte Abrechnungseinheiten erschweren den Vergleich der angekündigten ASR-Ersparnis.
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Alibabas Qwen-Team hat fünf Qwen-Audio-3.1-Modelle für Transkription, Sprachgenerierung und Sprachdialog in Echtzeit vorgestellt. Für ASR, TTS-Next und Realtime Plus sind gehostete Endpunkte dokumentiert. TTS Flash hat eine veröffentlichte Modell-ID und einen Preis, aber weniger vollständige Integrationshinweise. In den geprüften öffentlichen Entwicklerdokumenten gibt es für ASR-Next weder eine Modell-ID noch eine Region oder einen Preis.
[The Decoder](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) berichtete, Qwen habe Preissenkungen von etwa 70 Prozent für Text-to-Speech, 85 Prozent für Echtzeit-Audio und bis zu 95 Prozent für Spracherkennung angekündigt. Für die Überprüfung dieser Angaben kommt es auf die Abrechnungseinheiten an.
## Die große Veränderung
- **Was sich geändert hat:** Qwen deckt innerhalb einer gehosteten Modellfamilie nun mehr Bereiche eines Sprachprodukts ab – von Transkription und Sprachgenerierung bis zur Erzeugung von Klangkulissen und Live-Gesprächen. Die fünf Komponenten bieten Entwicklerzugang jedoch noch nicht im gleichen Umfang.
- **Warum das wichtig ist:** Für Entwickler, die Transkriptions- oder Sprachdienste budgetieren, reicht eine Audiominute nicht mehr aus, um jeden Endpunkt zu bepreisen. Bei tokenbasierter ASR werden sowohl das eingehende Audio als auch der resultierende Text berechnet; ein Live-Gespräch umfasst vier getrennt bepreiste Datenströme.
- **Worauf zu achten ist:** Neben dem Zugang zu ASR-Next ist zu beobachten, ob unabhängige Sprach- und Latenztests nützliche Einsparungen bestätigen. Falls ja, stellt sich als Nächstes die Frage, ob Anbieter von Sprachagenten, Transkriptions- und Synchronisationsdiensten diese Einsparungen an ihre Kunden weitergeben und ob konkurrierende Sprach-APIs nachziehen.
## Die fünf Modelle im Überblick
| Angekündigtes Modell | Vorgesehener Einsatz | Dokumentierter Zugang am 23. September | Preis und praktische Grenze |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Streaming-, Datei- und Kurzform-Transkription; optionale Sprechererkennung bei Datei- und Kurzform-Endpunkten | Gehostete WebSocket- oder HTTP-APIs in Singapur und Peking. Der [internationale Leitfaden](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) führt 30 Sprachen und 10 chinesische Dialektvarianten auf. | In Singapur liegen die Preise zwischen **0,15 USD je Million Audio-Eingabetoken + 0,47 USD je Million Text-Ausgabetoken** bei Datei- und Kurzform-Transkription und **0,93 + 0,70 USD** bei Streaming und Nachrichten. Datei-Transkription unterstützt bis zu 12 Stunden und 2 GB; Kurzform-Transkription bis zu 5 Minuten und 2 GB. |
| **Qwen Audio 3.1 ASR-Next** | Sprecherzuordnung und Zeitstempel sowie Erkennung von Emotionen, Umgebungsereignissen und Maschinengeräuschen | Von Qwen angekündigt; in der aktuellen Dokumentation zu Model Studio und QwenCloud wurde keine öffentliche API-Modell-ID, Region, Rate oder Begrenzung gefunden. | **Öffentlich nicht dokumentiert** |
| **Qwen Audio 3.1 TTS** | Mehrsprachige Sprachausgabe, sprachübergreifende Stimmübertragung und per Prompt steuerbare Vortragsweise | `qwen-audio-3.1-tts-flash` wird in Alibabas Preisankündigung aufgeführt. Die geprüfte [API zum Stimmenklonen](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) nennt weiterhin TTS Flash 3.0. | Singapur: **0,23 USD je Million Text-Eingabetoken + 1,87 USD je Million Audio-Ausgabetoken**. In den geprüften Unterlagen zu Version 3.1 waren keine aktuellen öffentlichen Limits angegeben. |
| **Qwen Audio 3.1 TTS-Next** | Gemeinsame Erzeugung von Sprache, Effekten und Hintergrund-Audio | Gehostete HTTPS-API ohne Streaming in Peking; laut Dokumentation für Chinesisch und Englisch verfügbar | **0,848 USD je Million Eingabetoken + 1,696 USD je Million Ausgabetoken**. Höchstens 3.000 Eingabezeichen; Podcast-Ausgabe bis zu vier Minuten, sonst bis zu zwei Minuten. |
| **Qwen Audio 3.1 Realtime Plus** | Vollduplex-Sprachdialog mit Unterbrechungen und Werkzeugaufrufen | Gehostete WebSocket-API in Singapur und Peking. Der [Leitfaden](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) führt 11 Sprachen auf. | Singapur: **0,80 USD je Million Text-Eingabetoken, 6,40 USD je Million Audio-Eingabetoken, 6,40 USD je Million Text-Ausgabetoken und 24 USD je Million Audio-Ausgabetoken**. Im Gesprächsverlauf bleiben bis zu 50 Audio-Turns oder 300 Sekunden Audio erhalten. |
Dies sind gehostete API-Produkte. BIG CHANGE fand weder herunterladbare Modellgewichte für Version 3.1 noch eine Lizenz für solche Gewichte. Die MIT-Lizenz im GitHub-Repository von QwenAudio gilt für die Projektwebsite und sollte nicht als Lizenz für die Modelle verstanden werden.
Auch die Sprachenzahl hängt von der Dokumentation ab. Im [verifizierten Launch-Beitrag von Qwen](https://www.sina.cn/news/detail/5346330620985983.html) steht, ASR unterstütze 30 Sprachen und 16 chinesische Dialekte; der internationale API-Leitfaden nennt 30 Sprachen und 10 Dialektvarianten. Entwickler sollten die Liste des Endpunkts verwenden, den sie tatsächlich aufrufen können.
## Die 95-Prozent-Angabe lässt sich nicht direkt aus der öffentlichen Preistabelle ableiten
Alibabas[ Mitteilung zur Preisänderung](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) trat am 22. September in Kraft. Der genaue Vergleich bezieht sich auf `qwen-audio-3.0-realtime-flash`, nicht auf das neue Realtime Plus 3.1. Die Rückgänge für Singapur werden so berechnet: (alter Tarif − neuer Tarif) / alter Tarif.
| Realtime-Flash-Stream | Vorher (USD) | Nachher (USD) | Rückgang |
| --- | --- | --- | --- |
| Texteingabe, je Million Token | 0,45 $ | 0,23 $ | 48,89 % |
| Audioeingabe, je Million Token | 4,50 $ | 0,93 $ | 79,33 % |
| Textausgabe, je Million Token | 4,50 $ | 0,70 $ | 84,44 % |
| Ausgabe (Text + Audio), je Million Token | 15,00 $ | 1,87 $ | **87,53 %** |
Dieselbe Mitteilung stellt TTS Flash 3.1 von 0,15 US-Dollar je 10.000 Zeichen auf getrennte Tarife für Ein- und Ausgabetoken um. Die [aktuelle Preisseite](https://www.alibabacloud.com/help/en/model-studio/model-pricing) führt ASR 3.1 ebenfalls mit Preisen je Ein- und Ausgabetoken auf; ASR 3.0 wird dagegen pro Audiosekunde berechnet, die Ausgabe ist kostenlos. Der prozentuale Vergleich zwischen den beiden Abrechnungsarten hängt von Text, Audiodauer und Tokenisierung ab. Mit den hier geprüften öffentlichen Tabellen lässt sich daher keine genaue ASR-Preissenkung von 95 Prozent nachvollziehen.
## Unabhängige Belege gibt es weiterhin nur für Qwen 3.0
Am Veröffentlichungstag gab es in den geprüften Quellen keinen unabhängigen Test der fünf 3.1-Modelle. Qwens eigene[ ASR-Projektseite](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) berichtet Benchmark-Ergebnisse, weist aber darauf hin, dass sie nicht unabhängig wiederholt wurden.
Artificial Analysis führt[ Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) in seiner Anbieter-Spracharena (alle Akzente und Kategorien) mit 1.259 Elo-Punkten auf Rang zwei; das 95-Prozent-Konfidenzintervall beträgt plus/minus 17 bei 1.447 verblindeten Vergleichsproben. In einer separaten[ Sprachagenten-Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) erzielte Qwen Audio 3.0 Realtime Plus eine Präferenzwertung von 699 Elo und gab den ersten Audioton nach 1,54 Sekunden aus. In den Live-Gesprächen vergleichen die Teilnehmenden verborgene Modelle anhand vorgegebener Szenarien.
## Sources
- [Alibaba bringt Qwen Audio 3.1 mit fünf neuen Modellen auf den Markt](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Bericht zur Einführung der fünf Modelle, der Qwen ungefähre Preissenkungen bei TTS, Echtzeit-Audio und ASR zuschreibt. BIG CHANGE prüfte die Preise anhand der Tabellen Alibabas.
- [Qwen Audio 3.1: Ankündigung zur Markteinführung](https://www.sina.cn/news/detail/5346330620985983.html) — Beitrag des verifizierten Qwen-Kontos, in dem die fünf Modelle und ihre vorgesehenen Fähigkeiten aufgeführt werden. Angaben zu Fähigkeiten und Geschwindigkeit bleiben Anbieteraussagen.
- [Model Studio: Mitteilung zu Preissenkungen für ausgewählte Audiomodelle](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Offizielle Preisänderung vom 22. September mit genauen Vorher-nachher-Tarifen für Realtime Flash 3.0 in Singapur und einer geänderten Abrechnungseinheit für TTS Flash 3.1.
- [Model Studio: Modellpreise](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Aktuelle offizielle Preise nach Modell, Modalität und Region, einschließlich ASR und Realtime Plus 3.1.
- [QwenCloud: Spracherkennungsmodelle](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Aktuelle ASR-Endpunkt-IDs, Zugriffsmethoden, Sprachlisten, Sprechererkennung und Dauergrenzen.
- [QwenCloud: Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Aktuelles WebSocket-Beispiel für Realtime Plus 3.1, unterstützte Stimmen und Sprachen sowie Limits für den gespeicherten Gesprächsverlauf.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Offizieller API-Zugang nur in Peking, Preise, Sprachen, Eingabelänge und Grenzen der Ausgabedauer.
- [Qwen Audio 3.1: ASR-Projektseite](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Unveränderliche Projektseite von Qwen zu ASR- und ASR-Next-Funktionen und vom Anbieter gemeldeten Benchmarks; laut Seite wurden die Ergebnisse nicht unabhängig reproduziert.
- [Artificial Analysis: Text-to-Speech-Rangliste](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Ergebnis eines verblindeten Präferenzvergleichs für das Vorgängermodell Qwen Audio 3.0 TTS Plus, mit Stichprobengröße und Konfidenzintervall.
- [Artificial Analysis: Sprachagenten-Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Separates Ergebnis zu Präferenz und Zeit bis zur ersten Audioausgabe für Qwen Audio 3.0 Realtime Plus; keine Bewertung von Version 3.1.
- [Referenz zur HTTP-API für Stimmenklonen](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — In den aktuellen Beispielen für Zielmodelle wird TTS Flash 3.0 genannt. Sie bestätigen keinen eigenständigen Integrationspfad für die Sprachsynthese mit Version 3.1.
Der Newsletter von BIG CHANGE
Das große Ganze. In Ihrem Tempo.
Aktuelle Storys über KI und Robotik, beobachtenswerte Veränderungen und praktische Ideen zur Anwendung. Wählen Sie ein tägliches Briefing, eine wöchentliche Zusammenfassung oder eine monatliche Perspektive.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Ihr Datenschutz, Ihre Entscheidung.
Notwendiger Speicher schützt die Website und merkt sich Ihre Einstellungen. Optionales Google Analytics bleibt deaktiviert, bis Sie es erlauben. Sie können alle Geschichten auch nur mit notwendigem Speicher lesen. Datenschutzdetails