세상은 멈춰 있지 않습니다.RSS
BIG CHANGE.

Markdown 버전

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1, 음성 기능 넓혀…95% 가격 인하엔 맥락이 필요하다

> Qwen Audio 3.1은 소리 생성과 이해 기능을 추가했습니다. API 문서는 모델별로 완성도가 다르고, 요금 단위가 달라져 발표된 음성 인식 비용 절감률을 검토하기 어렵습니다.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Alibaba의 Qwen 팀은 전사, 음성 생성, 실시간 음성 대화를 아우르는 Qwen Audio 3.1 모델 다섯 종을 공개했습니다. ASR, TTS-Next, Realtime Plus에는 호스팅 엔드포인트 문서가 있습니다. TTS Flash는 공개된 모델 ID와 가격이 있지만 통합 문서는 상대적으로 부족합니다. BIG CHANGE가 검토한 공개 개발자 문서에는 ASR-Next의 모델 ID, 지역, 가격이 없습니다.

[The Decoder 보도](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent)는 Qwen이 발표한 텍스트 음성 변환 약 70%, 실시간 오디오 약 85%, 음성 인식 최대 95% 가격 인하를 전했습니다. 이 수치를 확인할 때는 요금이 어떤 단위로 계산되는지 살펴봐야 합니다.

## 큰 변화

- **바뀐 점:** Qwen은 이제 하나의 호스팅 모델군에서 전사와 음성 생성부터 음향 장면 제작, 실시간 대화까지 음성 제품의 더 많은 기능을 제공합니다. 다섯 구성 요소의 개발자용 이용 방법이 모두 같은 수준으로 갖춰진 것은 아닙니다.
- **중요한 이유:** 전사나 음성 서비스를 예산에 반영하는 개발자에게는 이제 오디오 1분당 요금만으로 모든 엔드포인트의 비용을 계산할 수 없습니다. 토큰 기준 ASR 요금에는 들어오는 오디오와 변환된 텍스트가 모두 포함되며, 실시간 대화에는 별도로 가격이 책정된 스트림 네 가지가 있습니다.
- **지켜볼 점:** ASR-Next 이용 경로와 함께 독립적인 언어 및 지연 시간 테스트에서 실제 비용 절감이 확인되는지 살펴보세요. 절감 효과가 확인된다면 음성 에이전트, 전사, 더빙 제공업체가 이를 고객 가격에 반영할지, 경쟁 음성 API도 뒤따를지가 더 큰 질문입니다.

## 다섯 모델의 구성

| 공개된 모델 | 용도 | 9월 23일 기준 문서에 나온 이용 방법 | 가격 및 실제 한도 |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | 스트리밍, 파일, 짧은 음성 전사. 파일 및 짧은 음성 엔드포인트에서는 선택적으로 화자 구분 기능을 지원합니다. | 싱가포르와 베이징에서 WebSocket 또는 HTTP 호스팅 API를 제공합니다. [국제용 안내](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)에는 언어 30개와 중국어 방언 10종이 기재돼 있습니다. | 싱가포르에서 파일·짧은 음성 전사 요금은 **$0.15/M 오디오 입력 토큰 + $0.47/M 텍스트 출력 토큰 기준**으로 적용되며, 스트리밍/메시지 요금은 **$0.93 + $0.70 기준**으로 부과됩니다. 파일 전사는 최대 12시간/2GB, 짧은 음성 전사는 최대 5분/2GB를 허용합니다. |
| **Qwen Audio 3.1 ASR-Next** | 화자 지정과 타임스탬프, 감정·주변 소리·기계음 인식을 지원한다고 발표됐습니다. | Qwen이 공개한 모델입니다. 현재 Model Studio 및 QwenCloud 문서에서는 공개 API 모델 ID, 지역, 요금, 한도를 찾을 수 없습니다. | **공개 문서에 없음** |
| **Qwen Audio 3.1 TTS** | 다국어 음성, 언어 간 음성 전환, 말투를 조정하는 프롬프트 제어를 지원합니다. | `qwen-audio-3.1-tts-flash`은 Alibaba의 가격 공지에 기재돼 있습니다. 검토한 [음성 복제 API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)는 여전히 3.0 TTS Flash를 가리킵니다. | 싱가포르: **$0.23/M 텍스트 입력 토큰 + $1.87/M 오디오 출력 토큰**. 검토한 3.1 자료에는 현재 공개 한도가 명시돼 있지 않습니다. |
| **Qwen Audio 3.1 TTS-Next** | 음성, 효과음, 배경 오디오를 함께 생성합니다. | 베이징에서 비스트리밍 HTTPS 호스팅 API를 제공하며 중국어와 영어를 지원한다고 문서화돼 있습니다. | **$0.848/M 입력 토큰 + $1.696/M 출력 토큰**. 입력은 최대 3,000자이며 팟캐스트 오디오는 최대 4분, 그 외 출력은 최대 2분입니다. |
| **Qwen Audio 3.1 Realtime Plus** | 끼어들기와 도구 호출을 지원하는 전이중 음성 대화 기능입니다. | 싱가포르와 베이징에서 WebSocket 호스팅 API를 제공합니다. [안내 문서](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)에는 언어 11개가 기재돼 있습니다. | 싱가포르 요금: **$0.80/M 텍스트 입력, $6.40/M 오디오 입력, $6.40/M 텍스트 출력, $24/M 오디오 출력**. 오디오 대화 기록은 최대 50턴 또는 300초까지 유지됩니다. |

모두 호스팅 API 제품입니다. BIG CHANGE는 내려받을 수 있는 3.1 모델 가중치나 모델 가중치 라이선스를 찾지 못했습니다. QwenAudio GitHub 저장소의 MIT 라이선스는 프로젝트 웹사이트에 적용되므로 모델 라이선스로 해석해서는 안 됩니다.

언어 수는 문서에 따라 달라집니다. Qwen의 [검증된 출시 게시물](https://www.sina.cn/news/detail/5346330620985983.html)은 ASR이 언어 30개와 중국어 방언 16종을 지원한다고 밝힙니다. 국제 API 안내에는 언어 30개와 방언 10종이 나옵니다. 개발자는 실제로 호출할 수 있는 엔드포인트에 연결된 목록을 사용해야 합니다.

## 95% 인하 주장은 공개 요금표와 직접 대응하지 않는다

Alibaba의 [가격 변경 공지](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1)는 9월 22일부터 적용됐습니다. 공지에서 정확히 비교한 모델은 `qwen-audio-3.0-realtime-flash`이며 새 3.1 Realtime Plus는 아닙니다. 싱가포르 요금 인하율은 (기존 요금 − 새 요금) / 기존 요금으로 계산됩니다.

| Realtime Flash 스트림 | 기존 요금(USD) | 새 요금(USD) | 인하율 |
| --- | --- | --- | --- |
| 텍스트 입력, 토큰 100만 개당 | $0.45 | $0.23 | 48.89% |
| 오디오 입력, 토큰 100만 개당 | $4.50 | $0.93 | 79.33% |
| 텍스트 출력, 토큰 100만 개당 | $4.50 | $0.70 | 84.44% |
| 출력(텍스트 + 오디오), 토큰 100만 개당 | $15.00 | $1.87 | **87.53%** |

같은 공지는 3.1 TTS Flash의 요금 단위를 문자 10,000자당 $0.15에서 입력·출력 토큰별 요금으로 바꿨습니다.[ 현재 가격 페이지도 ](https://www.alibabacloud.com/help/en/model-studio/model-pricing)마찬가지로 3.1 ASR을 입력·출력 토큰 기준으로 표시하는 반면, 3.0 ASR은 오디오 초 단위로 요금을 청구하고 출력은 무료입니다. 어느 요금 쌍이든 가격 인하율은 텍스트, 오디오 길이, 토큰화 방식에 따라 달라집니다. 따라서 여기서 검토한 공개 표만으로는 ASR 가격이 정확히 95% 인하됐다는 주장을 재현할 수 없습니다.

## 독립적인 근거는 여전히 Qwen 3.0에 관한 것이다

출시 당일 검토한 자료에는 3.1 모델 다섯 종에 대한 독립 테스트가 없었습니다. Qwen의 자체 [ASR 프로젝트 페이지](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md)는 벤치마크 결과를 공개하지만, 독립적으로 재실행되지는 않았다고 밝힙니다.

Artificial Analysis는 [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice)를 여러 억양과 범주를 포함한 공급업체 음성 선호도 아레나에서 Elo 1,259점으로 2위에 올렸습니다. 95% 신뢰구간은 ±17점이며 블라인드 비교 표본은 1,447개였습니다. 별도의 [음성 에이전트 아레나](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)에서는 Qwen Audio 3.0 Realtime Plus가 선호도 Elo 699점, 첫 오디오까지 1.54초를 기록했습니다. 참가자들은 지정된 상황을 놓고 실시간 대화에서 모델 정보를 숨긴 채 비교합니다.

## Sources

- [Alibaba, 새 모델 다섯 종을 포함한 Qwen Audio 3.1 공개](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — 다섯 모델 출시를 요약하고 Qwen이 발표한 TTS, 실시간 오디오, ASR 가격 인하 추정치를 전한 보도입니다. BIG CHANGE는 자체 Alibaba 가격표와 요금을 대조했습니다.
- [Qwen Audio 3.1 출시 게시물](https://www.sina.cn/news/detail/5346330620985983.html) — 다섯 모델의 이름과 각 모델의 목표 기능을 밝힌 검증된 Qwen 계정 게시물입니다. 기능 및 속도에 관한 설명은 공급업체 주장으로 표시했습니다.
- [일부 오디오 모델 가격 인하 공지](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 3.0 Realtime Flash의 9월 22일 공식 인하 전후 요금과 3.1 TTS Flash의 요금 단위 변경을 제시한 공지입니다.
- [Model Studio 모델 요금](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 3.1 ASR과 Realtime Plus를 포함해 모델, 입력 유형, 지역별 현재 공식 요금을 확인할 수 있습니다.
- [QwenCloud 음성 텍스트 변환 모델](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — 현재 ASR 엔드포인트 ID, 이용 방법, 언어 목록, 화자 구분 지원 및 재생 시간 한도를 설명합니다.
- [QwenCloud 실시간 오디오 대화](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — 현재 3.1 Realtime Plus WebSocket 예제, 음성 및 언어 지원, 유지되는 대화 기록 한도를 제공합니다.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — 베이징 전용 API 이용 가능 여부, 가격, 언어, 입력 길이, 출력 시간 한도를 설명하는 공식 문서입니다.
- [Qwen Audio 3.1 ASR 프로젝트 페이지](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR 및 ASR-Next 기능과 공급업체가 보고한 벤치마크 결과를 담은 변경되지 않는 Qwen 프로젝트 페이지입니다. 결과가 독립적으로 재현되지 않았다고 명시합니다.
- [Artificial Analysis 텍스트 음성 변환 순위표](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — 이전 모델 Qwen Audio 3.0 TTS Plus의 블라인드 선호도 결과로, 표본 수와 신뢰구간을 포함합니다.
- [Artificial Analysis 음성 에이전트 아레나](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plus의 별도 선호도 및 첫 오디오까지 걸리는 시간 결과입니다. 3.1 평가가 아닙니다.
- [음성 복제 HTTP API 참조](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 현재 대상 모델 예제는 3.0 TTS Flash를 지정합니다. 3.1 음성 합성 통합 경로를 독립적으로 확인해 주지는 않습니다.