AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 తన వాయిస్ సేవలను విస్తరించింది; 95% ధర తగ్గింపు వెనుక సందర్భం ఉంది

> Qwen Audio 3.1 ధ్వని సృష్టి, అవగాహన సామర్థ్యాలను జోడించింది. దాని API పత్రాలు అసమగ్రంగా ఉన్నాయి; బిల్లింగ్ యూనిట్లు మారడంతో ప్రకటించిన ASR పొదుపును అంచనా వేయడం క్లిష్టమవుతుంది.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Alibabaకు చెందిన Qwen బృందం మాటలను లిఖితంగా మార్చడం, ప్రసంగం రూపొందించడం, ప్రత్యక్ష వాయిస్ సంభాషణ వంటి పనుల కోసం Qwen Audio 3.1 నమూనాలు ఐదింటిని విడుదల చేసింది. ASR, TTS-Next, Realtime Plusలకు హోస్ట్ చేసిన సేవల API వివరాలున్నాయి. TTS Flashకు ప్రచురించిన మోడల్ ID, ధర ఉన్నా, అనుసంధాన పత్రాలు అంత పూర్తి స్థాయిలో లేవు. BIG CHANGE పరిశీలించిన పబ్లిక్ డెవలపర్ పత్రాల్లో ASR-Nextకు మోడల్ ID, ప్రాంతం లేదా ధర లేదు.

[The Decoder నివేదించిన ప్రకారం](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) Qwen ప్రకటించిన ధర తగ్గింపులు టెక్స్ట్-టు-స్పీచ్‌కు సుమారు 70%, రియల్‌టైమ్ ఆడియోకు 85%, స్పీచ్ రికగ్నిషన్‌కు 95% వరకు ఉన్నాయి. ఈ గణాంకాలను తనిఖీ చేసేటప్పుడు బిల్లింగ్ యూనిట్లూ ముఖ్యం.

## పెద్ద మార్పు

- **ఏం మారింది:** లిఖిత మార్పిడి, రూపొందించిన ప్రసంగం నుంచి ధ్వని దృశ్యాల సృష్టి, ప్రత్యక్ష సంభాషణ వరకు వాయిస్ ఉత్పత్తిలో మరిన్ని పనులను Qwen ఇప్పుడు ఒకే హోస్ట్ చేసిన నమూనా కుటుంబంలో అందిస్తోంది. అయితే ఈ ఐదు భాగాలకూ డెవలపర్ ప్రాప్యత పత్రాలు ఒకే స్థాయిలో పూర్తి కాలేదు.
- **ఇది ఎందుకు ముఖ్యం:** లిఖిత మార్పిడి లేదా వాయిస్ సేవల బడ్జెట్ కట్టే డెవలపర్లకు, ప్రతి API ధరను నిర్ణయించడానికి ఆడియో నిమిషాల లెక్క ఒక్కటే సరిపోదు. టోకెన్ ఆధారిత ASR బిల్లులో వచ్చిన ఆడియోతో పాటు దాని నుంచి వచ్చిన పాఠ్యమూ లెక్కలోకి వస్తాయి; ప్రత్యక్ష సంభాషణకు విడివిడిగా ధర నిర్ణయించిన నాలుగు స్ట్రీమ్‌లు ఉన్నాయి.
- **ఏం గమనించాలి:** ASR-Next ప్రాప్యతతో పాటు, స్వతంత్ర భాషా, ప్రతిస్పందన ఆలస్య పరీక్షలు ఉపయోగకరమైన పొదుపును నిర్ధారిస్తాయా చూడాలి. నిర్ధారిస్తే, వాయిస్ ఏజెంట్, లిఖిత మార్పిడి, డబ్బింగ్ సేవలు ఆ పొదుపును వినియోగదారుల ధరల్లోకి అందిస్తాయా, పోటీ స్పీచ్ APIలూ ధరలను మార్చుతాయా అనేది తదుపరి ప్రశ్న.

## ఐదు నమూనాల సంక్షిప్త పటం

| ప్రకటించిన నమూనా | ఉద్దేశించిన పని | సెప్టెంబరు 23 నాటికి పత్రబద్ధమైన ప్రాప్యత | ధర, ఆచరణాత్మక పరిమితి |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | స్ట్రీమింగ్, ఫైల్, చిన్న ఆడియోల లిఖిత మార్పిడి; ఫైల్, చిన్న-ఆడియో APIల్లో ఐచ్ఛికంగా వక్తలను వేరు గుర్తించడం | సింగపూర్, బీజింగ్‌లలో హోస్ట్ చేసిన WebSocket లేదా HTTP APIలు. [అంతర్జాతీయ మార్గదర్శకం](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) 30 భాషలు, చైనీస్ భాషా మాండలికాల 10 రూపాలను జాబితా చేస్తుంది. | సింగపూర్‌లో ఫైల్, చిన్న ఆడియోలకు **$0.15/M ఆడియో ఇన్‌పుట్ టోకెన్‌లు + $0.47/M టెక్స్ట్ అవుట్‌పుట్ టోకెన్‌లు**; స్ట్రీమింగ్ లేదా సందేశానికి **$0.93 + $0.70** ధరలు. ఫైల్ మార్పిడికి గరిష్ఠంగా 12 గంటలు/2GB; చిన్న ఆడియోకు 5 నిమిషాలు/2GB. |
| **Qwen Audio 3.1 ASR-Next** | వక్తలకు ఆపాదించడం, సమయ ముద్రలు; భావోద్వేగం, పరిసర సంఘటనలు, యంత్ర శబ్దాలను గుర్తించడం | Qwen ప్రకటించింది; ప్రస్తుత Model Studio, QwenCloud పత్రాల్లో పబ్లిక్ API మోడల్ ID, ప్రాంతం, ధర లేదా పరిమితి కనిపించలేదు | **పబ్లిక్ పత్రాల్లో వివరాలు లేవు** |
| **Qwen Audio 3.1 TTS** | బహుభాషా ప్రసంగం, భాషల మధ్య వాయిస్ బదిలీ, మాట్లాడే తీరు కోసం ప్రాంప్ట్ నియంత్రణ | `qwen-audio-3.1-tts-flash` Alibaba ధరల ప్రకటనలో కనిపిస్తుంది. పరిశీలించిన [వాయిస్ క్లోనింగ్ API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) పత్రాల్లో ఇంకా 3.0 TTS Flashనే ఉంది. | సింగపూర్ ధర: **$0.23/M టెక్స్ట్ ఇన్‌పుట్ టోకెన్‌లు + $1.87/M ఆడియో అవుట్‌పుట్ టోకెన్‌లు**; పరిశీలించిన 3.1 పత్రాల్లో ప్రస్తుత పబ్లిక్ పరిమితులను పేర్కొనలేదు. |
| **Qwen Audio 3.1 TTS-Next** | ప్రసంగం, ప్రభావ ధ్వనులు, నేపథ్య ఆడియోను కలిపి రూపొందించడం | బీజింగ్‌లో హోస్ట్ చేసిన, స్ట్రీమింగ్ లేని HTTPS API; చైనీస్, ఇంగ్లీష్‌కు పత్రబద్ధమైన మద్దతు | **$0.848/M ఇన్‌పుట్ టోకెన్‌లు + $1.696/M అవుట్‌పుట్ టోకెన్‌లు**. గరిష్ఠంగా 3,000 ఇన్‌పుట్ అక్షరాలు; పాడ్‌కాస్ట్‌కు నాలుగు నిమిషాల అవుట్‌పుట్, మిగతావాటికి రెండు నిమిషాలు. |
| **Qwen Audio 3.1 Realtime Plus** | మధ్యలో ఆపడం, సాధనాల కాల్స్‌తో పూర్తి ద్విముఖ వాయిస్ సంభాషణ | సింగపూర్, బీజింగ్‌లలో హోస్ట్ చేసిన WebSocket API. [మార్గదర్శకం](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) 11 భాషలను జాబితా చేస్తుంది. | సింగపూర్ ధరలు: **$0.80/M టెక్స్ట్ ఇన్‌పుట్, $6.40/M ఆడియో ఇన్‌పుట్, $6.40/M టెక్స్ట్ అవుట్‌పుట్, $24/M ఆడియో అవుట్‌పుట్**. ఆడియో చరిత్రగా గరిష్ఠంగా 50 టర్న్‌లు లేదా 300 సెకన్లు ఉంచుతుంది. |

ఇవన్నీ హోస్ట్ చేసిన API ఉత్పత్తులు. డౌన్‌లోడ్ చేసుకునే 3.1 మోడల్ బరువులు లేదా వాటి లైసెన్స్ BIG CHANGEకు కనిపించలేదు. QwenAudio GitHub భాండాగారంలోని MIT లైసెన్స్ ఆ ప్రాజెక్ట్ వెబ్‌సైట్‌కే వర్తిస్తుంది; దాన్ని మోడళ్ల లైసెన్స్‌గా భావించకూడదు.

భాషల సంఖ్య కూడా పత్రాన్ని బట్టి మారుతుంది. Qwen [ధృవీకరించిన విడుదల పోస్టు](https://www.sina.cn/news/detail/5346330620985983.html) ప్రకారం, ASRకు 30 భాషలు, 16 చైనీస్ మాండలికాలు ఉన్నాయని Qwen చెబుతుంది; అంతర్జాతీయ API మార్గదర్శకంలో 30 భాషలు, 10 మాండలిక రూపాలు ఉన్నాయి. డెవలపర్లు తాము నిజంగా ఉపయోగించగల APIకి జతచేసిన జాబితానే అనుసరించాలి.

## 95% తగ్గింపు వాదన పబ్లిక్ ధరల పట్టికతో సరిపోలడం లేదు

Alibaba [ధర మార్పు ప్రకటన](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) సెప్టెంబరు 22 నుంచి అమల్లోకి వచ్చింది. అందులోని ఖచ్చితమైన పోలిక `qwen-audio-3.0-realtime-flash`, కొత్త 3.1 Realtime Plusపై కాదు. సింగపూర్ ధర తగ్గింపులను (పాత ధర − కొత్త ధర) / పాత ధర సూత్రంతో లెక్కించాం:

| Realtime Flash స్ట్రీమ్ | ముందు (USD) | తర్వాత (USD) | తగ్గింపు |
| --- | --- | --- | --- |
| ప్రతి మిలియన్ టోకెన్‌లకు టెక్స్ట్ ఇన్‌పుట్ | $0.45 | $0.23 | 48.89% |
| ప్రతి మిలియన్ టోకెన్‌లకు ఆడియో ఇన్‌పుట్ | $4.50 | $0.93 | 79.33% |
| ప్రతి మిలియన్ టోకెన్‌లకు టెక్స్ట్ అవుట్‌పుట్ | $4.50 | $0.70 | 84.44% |
| ప్రతి మిలియన్ టోకెన్‌లకు అవుట్‌పుట్ (టెక్స్ట్ + ఆడియో) | $15.00 | $1.87 | **87.53%** |

అదే ప్రకటనలో 3.1 TTS Flash ధరను ప్రతి 10,000 అక్షరాలకు $0.15 నుంచి విడివిడిగా లెక్కించే ఇన్‌పుట్, అవుట్‌పుట్ టోకెన్ ధరలుగా మార్చినట్లు ఉంది. [ప్రస్తుత ధరల పేజీ](https://www.alibabacloud.com/help/en/model-studio/model-pricing) కూడా 3.1 ASRకు ఇన్‌పుట్, అవుట్‌పుట్ టోకెన్ ధరలను చూపుతుంది; 3.0 ASRలో ప్రతి ఆడియో సెకనుకు ధర, అవుట్‌పుట్ ఉచితం. ఈ రెండు ధరల జంటల్లో శాతం తేడా పాఠ్యం, ఆడియో నిడివి, టోకెన్‌లుగా విభజించే విధానంపై ఆధారపడుతుంది. అందువల్ల ఇక్కడ పరిశీలించిన పబ్లిక్ పట్టికలతో ASRకు ఖచ్చితమైన 95% తగ్గింపును మళ్లీ లెక్కించలేం.

## స్వతంత్ర ఆధారాలు Qwen 3.0కే సంబంధించినవి

విడుదల రోజున పరిశీలించిన మూలాల్లో ఐదు 3.1 నమూనాల్లో దేనికీ స్వతంత్ర పరీక్ష కనిపించలేదు. Qwen స్వంత [ASR ప్రాజెక్ట్ పేజీ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) బెంచ్‌మార్క్ ఫలితాలను నివేదిస్తుంది; వాటిని స్వతంత్రంగా మళ్లీ పరీక్షించలేదని కూడా చెబుతుంది.

Artificial Analysis తన [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) ప్రొవైడర్-వాయిస్ పోటీలో (అన్ని ఉచ్చారణలు, విభాగాలు) 1,259 Eloతో రెండో స్థానంలో ఉంచింది. 95% విశ్వసనీయత పరిధి ±17; గుడ్డి పోలిక నమూనాలు 1,447. వేరొక [స్పీచ్ ఏజెంట్ పోటీలో](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena), Qwen Audio 3.0 Realtime Plusకు 699 ప్రాధాన్య Elo, తొలి ఆడియో రావడానికి 1.54 సెకన్ల సమయం నమోదయ్యాయి. కేటాయించిన సందర్భాల్లో ప్రత్యక్ష సంభాషణల ద్వారా దాచిన మోడళ్లను పాల్గొనేవారు పోలుస్తారు.

## Sources

- [Alibaba, ఐదు కొత్త నమూనాలతో Qwen Audio 3.1ను విడుదల చేసింది](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — ఐదు నమూనాల విడుదలను, Qwenకు ఆపాదించిన TTS, రియల్‌టైమ్, ASR ధర తగ్గింపుల అంచనాలను తెలిపే వార్తా కథనం. BIG CHANGE ధరలను Alibaba స్వంత పట్టికలతో తనిఖీ చేసింది.
- [Qwen Audio 3.1 విడుదల పోస్టు](https://www.sina.cn/news/detail/5346330620985983.html) — ఐదు నమూనాలు, వాటి ఉద్దేశిత సామర్థ్యాలను పేర్కొన్న ధృవీకరించిన Qwen ఖాతా పోస్టు. సామర్థ్యం, వేగం గురించి ఉన్న ప్రకటనలు విక్రేత వాదనలుగానే పరిగణించాలి.
- [ఎంపిక చేసిన ఆడియో నమూనాలకు Model Studio ధర తగ్గింపు ప్రకటన](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 3.0 Realtime Flashకు సింగపూర్‌లో వర్తించిన ఖచ్చితమైన పాత, కొత్త ధరలను; 3.1 TTS Flashలో బిల్లింగ్ యూనిట్ మార్పును తెలిపిన సెప్టెంబరు 22 అధికారిక ప్రకటన.
- [Model Studio నమూనాల ధరలు](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 3.1 ASR, Realtime Plusతో సహా ప్రస్తుత మోడల్, ధ్వని రకం, ప్రాంతాలవారీ అధికారిక ధరలు.
- [QwenCloud స్పీచ్-టు-టెక్స్ట్ నమూనాలు](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — ప్రస్తుత ASR API IDలు, ప్రాప్యత పద్ధతులు, భాషల జాబితాలు, వక్తల గుర్తింపు మద్దతు, ఆడియో నిడివి పరిమితులు.
- [QwenCloud Realtime Audio Chat](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — ప్రస్తుత 3.1 Realtime Plus WebSocket ఉదాహరణ, వాయిస్, భాషల మద్దతు, నిల్వ చేసే సంభాషణ పరిమితులు.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — బీజింగ్‌కే పరిమితమైన API అందుబాటు, ధరలు, భాషలు, ఇన్‌పుట్ పొడవు, అవుట్‌పుట్ నిడివి పరిమితులపై అధికారిక సమాచారం.
- [Qwen Audio 3.1 ASR ప్రాజెక్ట్ పేజీ](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR, ASR-Next సామర్థ్యాలు, విక్రేత తెలిపిన బెంచ్‌మార్క్‌లకు సంబంధించిన మార్చలేని Qwen ప్రాజెక్ట్ పేజీ. ఫలితాలను స్వతంత్రంగా మళ్లీ ఉత్పత్తి చేయలేదని అది చెబుతుంది.
- [Artificial Analysis టెక్స్ట్-టు-స్పీచ్ పట్టిక](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — మునుపటి Qwen Audio 3.0 TTS Plusపై గుడ్డి ప్రాధాన్య పోలిక ఫలితం; నమూనాల సంఖ్య, విశ్వసనీయత పరిధి సహా.
- [Artificial Analysis Speech Agent Arena](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plusకు సంబంధించిన వేరే ప్రాధాన్య, తొలి ఆడియో సమయ ఫలితం; ఇది 3.1 మూల్యాంకనం కాదు.
- [వాయిస్ క్లోనింగ్ HTTP API సూచిక](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — ప్రస్తుత లక్ష్య నమూనాల ఉదాహరణల్లో 3.0 TTS Flash మాత్రమే ఉంది. 3.1లో ప్రసంగ నిర్మాణానికి అనుసంధాన మార్గం ఉందని అవి స్వతంత్రంగా నిర్ధారించవు.
