Alibaba의 Qwen 팀은 전사, 음성 생성, 실시간 음성 대화를 아우르는 Qwen Audio 3.1 모델 다섯 종을 공개했습니다. ASR, TTS-Next, Realtime Plus에는 호스팅 엔드포인트 문서가 있습니다. TTS Flash는 공개된 모델 ID와 가격이 있지만 통합 문서는 상대적으로 부족합니다. BIG CHANGE가 검토한 공개 개발자 문서에는 ASR-Next의 모델 ID, 지역, 가격이 없습니다.

The Decoder 보도는 Qwen이 발표한 텍스트 음성 변환 약 70%, 실시간 오디오 약 85%, 음성 인식 최대 95% 가격 인하를 전했습니다. 이 수치를 확인할 때는 요금이 어떤 단위로 계산되는지 살펴봐야 합니다.

큰 변화

  • 바뀐 점: Qwen은 이제 하나의 호스팅 모델군에서 전사와 음성 생성부터 음향 장면 제작, 실시간 대화까지 음성 제품의 더 많은 기능을 제공합니다. 다섯 구성 요소의 개발자용 이용 방법이 모두 같은 수준으로 갖춰진 것은 아닙니다.
  • 중요한 이유: 전사나 음성 서비스를 예산에 반영하는 개발자에게는 이제 오디오 1분당 요금만으로 모든 엔드포인트의 비용을 계산할 수 없습니다. 토큰 기준 ASR 요금에는 들어오는 오디오와 변환된 텍스트가 모두 포함되며, 실시간 대화에는 별도로 가격이 책정된 스트림 네 가지가 있습니다.
  • 지켜볼 점: ASR-Next 이용 경로와 함께 독립적인 언어 및 지연 시간 테스트에서 실제 비용 절감이 확인되는지 살펴보세요. 절감 효과가 확인된다면 음성 에이전트, 전사, 더빙 제공업체가 이를 고객 가격에 반영할지, 경쟁 음성 API도 뒤따를지가 더 큰 질문입니다.

다섯 모델의 구성

공개된 모델

용도

9월 23일 기준 문서에 나온 이용 방법

가격 및 실제 한도

Qwen Audio 3.1 ASR

스트리밍, 파일, 짧은 음성 전사. 파일 및 짧은 음성 엔드포인트에서는 선택적으로 화자 구분 기능을 지원합니다.

싱가포르와 베이징에서 WebSocket 또는 HTTP 호스팅 API를 제공합니다. 국제용 안내에는 언어 30개와 중국어 방언 10종이 기재돼 있습니다.

싱가포르에서 파일·짧은 음성 전사 요금은 $0.15/M 오디오 입력 토큰 + $0.47/M 텍스트 출력 토큰 기준으로 적용되며, 스트리밍/메시지 요금은 $0.93 + $0.70 기준으로 부과됩니다. 파일 전사는 최대 12시간/2GB, 짧은 음성 전사는 최대 5분/2GB를 허용합니다.

Qwen Audio 3.1 ASR-Next

화자 지정과 타임스탬프, 감정·주변 소리·기계음 인식을 지원한다고 발표됐습니다.

Qwen이 공개한 모델입니다. 현재 Model Studio 및 QwenCloud 문서에서는 공개 API 모델 ID, 지역, 요금, 한도를 찾을 수 없습니다.

공개 문서에 없음

Qwen Audio 3.1 TTS

다국어 음성, 언어 간 음성 전환, 말투를 조정하는 프롬프트 제어를 지원합니다.

qwen-audio-3.1-tts-flash은 Alibaba의 가격 공지에 기재돼 있습니다. 검토한 음성 복제 API는 여전히 3.0 TTS Flash를 가리킵니다.

싱가포르: $0.23/M 텍스트 입력 토큰 + $1.87/M 오디오 출력 토큰. 검토한 3.1 자료에는 현재 공개 한도가 명시돼 있지 않습니다.

Qwen Audio 3.1 TTS-Next

음성, 효과음, 배경 오디오를 함께 생성합니다.

베이징에서 비스트리밍 HTTPS 호스팅 API를 제공하며 중국어와 영어를 지원한다고 문서화돼 있습니다.

$0.848/M 입력 토큰 + $1.696/M 출력 토큰. 입력은 최대 3,000자이며 팟캐스트 오디오는 최대 4분, 그 외 출력은 최대 2분입니다.

Qwen Audio 3.1 Realtime Plus

끼어들기와 도구 호출을 지원하는 전이중 음성 대화 기능입니다.

싱가포르와 베이징에서 WebSocket 호스팅 API를 제공합니다. 안내 문서에는 언어 11개가 기재돼 있습니다.

싱가포르 요금: $0.80/M 텍스트 입력, $6.40/M 오디오 입력, $6.40/M 텍스트 출력, $24/M 오디오 출력. 오디오 대화 기록은 최대 50턴 또는 300초까지 유지됩니다.

모두 호스팅 API 제품입니다. BIG CHANGE는 내려받을 수 있는 3.1 모델 가중치나 모델 가중치 라이선스를 찾지 못했습니다. QwenAudio GitHub 저장소의 MIT 라이선스는 프로젝트 웹사이트에 적용되므로 모델 라이선스로 해석해서는 안 됩니다.

언어 수는 문서에 따라 달라집니다. Qwen의 검증된 출시 게시물은 ASR이 언어 30개와 중국어 방언 16종을 지원한다고 밝힙니다. 국제 API 안내에는 언어 30개와 방언 10종이 나옵니다. 개발자는 실제로 호출할 수 있는 엔드포인트에 연결된 목록을 사용해야 합니다.

95% 인하 주장은 공개 요금표와 직접 대응하지 않는다

Alibaba의 가격 변경 공지는 9월 22일부터 적용됐습니다. 공지에서 정확히 비교한 모델은 qwen-audio-3.0-realtime-flash이며 새 3.1 Realtime Plus는 아닙니다. 싱가포르 요금 인하율은 (기존 요금 − 새 요금) / 기존 요금으로 계산됩니다.

Realtime Flash 스트림

기존 요금(USD)

새 요금(USD)

인하율

텍스트 입력, 토큰 100만 개당

$0.45

$0.23

48.89%

오디오 입력, 토큰 100만 개당

$4.50

$0.93

79.33%

텍스트 출력, 토큰 100만 개당

$4.50

$0.70

84.44%

출력(텍스트 + 오디오), 토큰 100만 개당

$15.00

$1.87

87.53%

같은 공지는 3.1 TTS Flash의 요금 단위를 문자 10,000자당 $0.15에서 입력·출력 토큰별 요금으로 바꿨습니다. 현재 가격 페이지도 마찬가지로 3.1 ASR을 입력·출력 토큰 기준으로 표시하는 반면, 3.0 ASR은 오디오 초 단위로 요금을 청구하고 출력은 무료입니다. 어느 요금 쌍이든 가격 인하율은 텍스트, 오디오 길이, 토큰화 방식에 따라 달라집니다. 따라서 여기서 검토한 공개 표만으로는 ASR 가격이 정확히 95% 인하됐다는 주장을 재현할 수 없습니다.

독립적인 근거는 여전히 Qwen 3.0에 관한 것이다

출시 당일 검토한 자료에는 3.1 모델 다섯 종에 대한 독립 테스트가 없었습니다. Qwen의 자체 ASR 프로젝트 페이지는 벤치마크 결과를 공개하지만, 독립적으로 재실행되지는 않았다고 밝힙니다.

Artificial Analysis는 Qwen Audio 3.0 TTS Plus를 여러 억양과 범주를 포함한 공급업체 음성 선호도 아레나에서 Elo 1,259점으로 2위에 올렸습니다. 95% 신뢰구간은 ±17점이며 블라인드 비교 표본은 1,447개였습니다. 별도의 음성 에이전트 아레나에서는 Qwen Audio 3.0 Realtime Plus가 선호도 Elo 699점, 첫 오디오까지 1.54초를 기록했습니다. 참가자들은 지정된 상황을 놓고 실시간 대화에서 모델 정보를 숨긴 채 비교합니다.