AI-translated from English; not yet reviewed by a fluent editor.
# Qwen Audio 3.1, 음성 기능 넓혀…95% 가격 인하엔 맥락이 필요하다
> Qwen Audio 3.1은 소리 생성과 이해 기능을 추가했습니다. API 문서는 모델별로 완성도가 다르고, 요금 단위가 달라져 발표된 음성 인식 비용 절감률을 검토하기 어렵습니다.
By BIG CHANGE Editorial
Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

AI-generated conceptual illustration by BIG CHANGE.
Alibaba의 Qwen 팀은 전사, 음성 생성, 실시간 음성 대화를 아우르는 Qwen Audio 3.1 모델 다섯 종을 공개했습니다. ASR, TTS-Next, Realtime Plus에는 호스팅 엔드포인트 문서가 있습니다. TTS Flash는 공개된 모델 ID와 가격이 있지만 통합 문서는 상대적으로 부족합니다. BIG CHANGE가 검토한 공개 개발자 문서에는 ASR-Next의 모델 ID, 지역, 가격이 없습니다.
[The Decoder 보도](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent)는 Qwen이 발표한 텍스트 음성 변환 약 70%, 실시간 오디오 약 85%, 음성 인식 최대 95% 가격 인하를 전했습니다. 이 수치를 확인할 때는 요금이 어떤 단위로 계산되는지 살펴봐야 합니다.
## 큰 변화
- **바뀐 점:** Qwen은 이제 하나의 호스팅 모델군에서 전사와 음성 생성부터 음향 장면 제작, 실시간 대화까지 음성 제품의 더 많은 기능을 제공합니다. 다섯 구성 요소의 개발자용 이용 방법이 모두 같은 수준으로 갖춰진 것은 아닙니다.
- **중요한 이유:** 전사나 음성 서비스를 예산에 반영하는 개발자에게는 이제 오디오 1분당 요금만으로 모든 엔드포인트의 비용을 계산할 수 없습니다. 토큰 기준 ASR 요금에는 들어오는 오디오와 변환된 텍스트가 모두 포함되며, 실시간 대화에는 별도로 가격이 책정된 스트림 네 가지가 있습니다.
- **지켜볼 점:** ASR-Next 이용 경로와 함께 독립적인 언어 및 지연 시간 테스트에서 실제 비용 절감이 확인되는지 살펴보세요. 절감 효과가 확인된다면 음성 에이전트, 전사, 더빙 제공업체가 이를 고객 가격에 반영할지, 경쟁 음성 API도 뒤따를지가 더 큰 질문입니다.
## 다섯 모델의 구성
| 공개된 모델 | 용도 | 9월 23일 기준 문서에 나온 이용 방법 | 가격 및 실제 한도 |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | 스트리밍, 파일, 짧은 음성 전사. 파일 및 짧은 음성 엔드포인트에서는 선택적으로 화자 구분 기능을 지원합니다. | 싱가포르와 베이징에서 WebSocket 또는 HTTP 호스팅 API를 제공합니다. [국제용 안내](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models)에는 언어 30개와 중국어 방언 10종이 기재돼 있습니다. | 싱가포르에서 파일·짧은 음성 전사 요금은 **$0.15/M 오디오 입력 토큰 + $0.47/M 텍스트 출력 토큰 기준**으로 적용되며, 스트리밍/메시지 요금은 **$0.93 + $0.70 기준**으로 부과됩니다. 파일 전사는 최대 12시간/2GB, 짧은 음성 전사는 최대 5분/2GB를 허용합니다. |
| **Qwen Audio 3.1 ASR-Next** | 화자 지정과 타임스탬프, 감정·주변 소리·기계음 인식을 지원한다고 발표됐습니다. | Qwen이 공개한 모델입니다. 현재 Model Studio 및 QwenCloud 문서에서는 공개 API 모델 ID, 지역, 요금, 한도를 찾을 수 없습니다. | **공개 문서에 없음** |
| **Qwen Audio 3.1 TTS** | 다국어 음성, 언어 간 음성 전환, 말투를 조정하는 프롬프트 제어를 지원합니다. | `qwen-audio-3.1-tts-flash`은 Alibaba의 가격 공지에 기재돼 있습니다. 검토한 [음성 복제 API](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api)는 여전히 3.0 TTS Flash를 가리킵니다. | 싱가포르: **$0.23/M 텍스트 입력 토큰 + $1.87/M 오디오 출력 토큰**. 검토한 3.1 자료에는 현재 공개 한도가 명시돼 있지 않습니다. |
| **Qwen Audio 3.1 TTS-Next** | 음성, 효과음, 배경 오디오를 함께 생성합니다. | 베이징에서 비스트리밍 HTTPS 호스팅 API를 제공하며 중국어와 영어를 지원한다고 문서화돼 있습니다. | **$0.848/M 입력 토큰 + $1.696/M 출력 토큰**. 입력은 최대 3,000자이며 팟캐스트 오디오는 최대 4분, 그 외 출력은 최대 2분입니다. |
| **Qwen Audio 3.1 Realtime Plus** | 끼어들기와 도구 호출을 지원하는 전이중 음성 대화 기능입니다. | 싱가포르와 베이징에서 WebSocket 호스팅 API를 제공합니다. [안내 문서](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime)에는 언어 11개가 기재돼 있습니다. | 싱가포르 요금: **$0.80/M 텍스트 입력, $6.40/M 오디오 입력, $6.40/M 텍스트 출력, $24/M 오디오 출력**. 오디오 대화 기록은 최대 50턴 또는 300초까지 유지됩니다. |
모두 호스팅 API 제품입니다. BIG CHANGE는 내려받을 수 있는 3.1 모델 가중치나 모델 가중치 라이선스를 찾지 못했습니다. QwenAudio GitHub 저장소의 MIT 라이선스는 프로젝트 웹사이트에 적용되므로 모델 라이선스로 해석해서는 안 됩니다.
언어 수는 문서에 따라 달라집니다. Qwen의 [검증된 출시 게시물](https://www.sina.cn/news/detail/5346330620985983.html)은 ASR이 언어 30개와 중국어 방언 16종을 지원한다고 밝힙니다. 국제 API 안내에는 언어 30개와 방언 10종이 나옵니다. 개발자는 실제로 호출할 수 있는 엔드포인트에 연결된 목록을 사용해야 합니다.
## 95% 인하 주장은 공개 요금표와 직접 대응하지 않는다
Alibaba의 [가격 변경 공지](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1)는 9월 22일부터 적용됐습니다. 공지에서 정확히 비교한 모델은 `qwen-audio-3.0-realtime-flash`이며 새 3.1 Realtime Plus는 아닙니다. 싱가포르 요금 인하율은 (기존 요금 − 새 요금) / 기존 요금으로 계산됩니다.
| Realtime Flash 스트림 | 기존 요금(USD) | 새 요금(USD) | 인하율 |
| --- | --- | --- | --- |
| 텍스트 입력, 토큰 100만 개당 | $0.45 | $0.23 | 48.89% |
| 오디오 입력, 토큰 100만 개당 | $4.50 | $0.93 | 79.33% |
| 텍스트 출력, 토큰 100만 개당 | $4.50 | $0.70 | 84.44% |
| 출력(텍스트 + 오디오), 토큰 100만 개당 | $15.00 | $1.87 | **87.53%** |
같은 공지는 3.1 TTS Flash의 요금 단위를 문자 10,000자당 $0.15에서 입력·출력 토큰별 요금으로 바꿨습니다.[ 현재 가격 페이지도 ](https://www.alibabacloud.com/help/en/model-studio/model-pricing)마찬가지로 3.1 ASR을 입력·출력 토큰 기준으로 표시하는 반면, 3.0 ASR은 오디오 초 단위로 요금을 청구하고 출력은 무료입니다. 어느 요금 쌍이든 가격 인하율은 텍스트, 오디오 길이, 토큰화 방식에 따라 달라집니다. 따라서 여기서 검토한 공개 표만으로는 ASR 가격이 정확히 95% 인하됐다는 주장을 재현할 수 없습니다.
## 독립적인 근거는 여전히 Qwen 3.0에 관한 것이다
출시 당일 검토한 자료에는 3.1 모델 다섯 종에 대한 독립 테스트가 없었습니다. Qwen의 자체 [ASR 프로젝트 페이지](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md)는 벤치마크 결과를 공개하지만, 독립적으로 재실행되지는 않았다고 밝힙니다.
Artificial Analysis는 [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice)를 여러 억양과 범주를 포함한 공급업체 음성 선호도 아레나에서 Elo 1,259점으로 2위에 올렸습니다. 95% 신뢰구간은 ±17점이며 블라인드 비교 표본은 1,447개였습니다. 별도의 [음성 에이전트 아레나](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena)에서는 Qwen Audio 3.0 Realtime Plus가 선호도 Elo 699점, 첫 오디오까지 1.54초를 기록했습니다. 참가자들은 지정된 상황을 놓고 실시간 대화에서 모델 정보를 숨긴 채 비교합니다.
## Sources
- [Alibaba, 새 모델 다섯 종을 포함한 Qwen Audio 3.1 공개](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — 다섯 모델 출시를 요약하고 Qwen이 발표한 TTS, 실시간 오디오, ASR 가격 인하 추정치를 전한 보도입니다. BIG CHANGE는 자체 Alibaba 가격표와 요금을 대조했습니다.
- [Qwen Audio 3.1 출시 게시물](https://www.sina.cn/news/detail/5346330620985983.html) — 다섯 모델의 이름과 각 모델의 목표 기능을 밝힌 검증된 Qwen 계정 게시물입니다. 기능 및 속도에 관한 설명은 공급업체 주장으로 표시했습니다.
- [일부 오디오 모델 가격 인하 공지](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — 3.0 Realtime Flash의 9월 22일 공식 인하 전후 요금과 3.1 TTS Flash의 요금 단위 변경을 제시한 공지입니다.
- [Model Studio 모델 요금](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — 3.1 ASR과 Realtime Plus를 포함해 모델, 입력 유형, 지역별 현재 공식 요금을 확인할 수 있습니다.
- [QwenCloud 음성 텍스트 변환 모델](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — 현재 ASR 엔드포인트 ID, 이용 방법, 언어 목록, 화자 구분 지원 및 재생 시간 한도를 설명합니다.
- [QwenCloud 실시간 오디오 대화](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — 현재 3.1 Realtime Plus WebSocket 예제, 음성 및 언어 지원, 유지되는 대화 기록 한도를 제공합니다.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — 베이징 전용 API 이용 가능 여부, 가격, 언어, 입력 길이, 출력 시간 한도를 설명하는 공식 문서입니다.
- [Qwen Audio 3.1 ASR 프로젝트 페이지](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — ASR 및 ASR-Next 기능과 공급업체가 보고한 벤치마크 결과를 담은 변경되지 않는 Qwen 프로젝트 페이지입니다. 결과가 독립적으로 재현되지 않았다고 명시합니다.
- [Artificial Analysis 텍스트 음성 변환 순위표](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — 이전 모델 Qwen Audio 3.0 TTS Plus의 블라인드 선호도 결과로, 표본 수와 신뢰구간을 포함합니다.
- [Artificial Analysis 음성 에이전트 아레나](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Qwen Audio 3.0 Realtime Plus의 별도 선호도 및 첫 오디오까지 걸리는 시간 결과입니다. 3.1 평가가 아닙니다.
- [음성 복제 HTTP API 참조](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — 현재 대상 모델 예제는 3.0 TTS Flash를 지정합니다. 3.1 음성 합성 통합 경로를 독립적으로 확인해 주지는 않습니다.
BIG CHANGE 뉴스레터
큰 그림을 나만의 속도로.
AI와 로봇공학에 관한 최신 기사, 주목할 변화, 활용할 수 있는 실용적인 아이디어입니다. 일일 브리핑, 주간 다이제스트 또는 월간 전망을 선택하세요.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
개인정보는 이용자가 선택합니다.
필수 저장소는 사이트 보안을 지원하고 선택 사항을 기억합니다. 선택 사항인 Google Analytics는 허용하기 전까지 꺼져 있습니다. 필수 저장 기능만 사용해 모든 기사를 읽을 수 있습니다. 개인정보 보호 세부 정보