МИР НЕ СТОИТ НА МЕСТЕ.RSS
BIG CHANGE.

Версия Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Qwen Audio 3.1 расширяет линейку голосовых моделей. Снижение цены на 95% требует контекста

> Qwen Audio 3.1 добавляет генерацию и распознавание звука. Документация API описывает модели неравномерно, а смена единиц тарификации усложняет оценку заявленной экономии на распознавании речи.

By BIG CHANGE Editorial

Published: 2026-09-23T15:40:58.970Z
Updated: 2026-09-23T15:40:58.970Z
Canonical: https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing

![A speaker in a sound-treated booth talks into a studio microphone while a second person listens at a compact mixing console through glass.](https://bigchange.ai/api/media/file/qwen-audio-studio-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Команда Qwen компании Alibaba представила пять моделей Qwen Audio 3.1 для расшифровки, синтеза речи и голосового взаимодействия в реальном времени. Для ASR, TTS-Next и Realtime Plus документированы размещённые конечные точки. Для TTS Flash указан идентификатор модели и цена, но документация интеграции менее полная; в общедоступных документах разработчика, рассмотренных BIG CHANGE, для ASR-Next не указаны идентификатор модели, регион или цена.

[Как сообщило издание The Decoder,](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) Qwen заявляет о снижении цен примерно на 70% для преобразования текста в речь, на 85% для аудио в реальном времени и до 95% для распознавания речи. При проверке этих цифр важны единицы тарификации.

## Главное изменение

- **Что изменилось:** Теперь семейство размещённых моделей Qwen охватывает больше компонентов голосового продукта: от расшифровки и синтеза речи до создания звуковых сцен и живого диалога. При этом документация доступа для пяти компонентов пока различается по полноте.
- **Почему это важно:** Разработчикам, планирующим бюджет на распознавание речи или голосовые сервисы, уже недостаточно знать цену одной минуты аудио: у ASR с тарификацией по токенам оплачиваются и входящее аудио, и полученный текст, а у диалога в реальном времени отдельно тарифицируются четыре потока данных.
- **За чем следить:** Помимо доступа к ASR-Next, нужно следить за тем, подтвердят ли независимые проверки языкового охвата и задержки полезную экономию. Если да, возникает следующий вопрос: перенесут ли сервисы голосовых агентов, расшифровки и дубляжа эту экономию в цены для клиентов и последуют ли за ними конкурирующие голосовые API.

## Пять моделей: краткая карта

| Анонсированная модель | Назначение | Документированный доступ на 23 сентября | Цена и практические ограничения |
| --- | --- | --- | --- |
| **Qwen Audio 3.1 ASR** | Потоковая расшифровка, обработка файлов и коротких аудиозаписей; диаризация дикторов доступна по выбору для файловых и коротких запросов | Размещённые API по WebSocket или HTTP в Сингапуре и Пекине. В [международном руководстве](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) перечислены 30 языков и 10 разновидностей китайских диалектов. | В Сингапуре цена составляет от **$0.15 за миллион входных аудиотокенов + $0.47 за миллион выходных текстовых токенов** для файловой и краткой расшифровки до **$0.93 + $0.70** для потоковой обработки и сообщений. Файловая расшифровка: до 12 часов и 2 ГБ; короткая: до 5 минут и 2 ГБ. |
| **Qwen Audio 3.1 ASR-Next** | Определение дикторов и временных меток, а также распознавание эмоций, фоновых событий и звуков машин | Модель анонсирована Qwen; в актуальной документации Model Studio и QwenCloud не удалось найти общедоступный идентификатор модели API, регион, тариф или лимит | **В открытых документах не указано** |
| **Qwen Audio 3.1 TTS** | Многоязычный синтез речи, перенос голоса между языками и управление подачей с помощью промпта | `qwen-audio-3.1-tts-flash` указана в уведомлении Alibaba о ценах. В рассмотренной документации [API клонирования голоса](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) по-прежнему указан TTS Flash версии 3.0. | Сингапур: **$0.23 за миллион входных текстовых токенов + $1.87 за миллион выходных аудиотокенов**. В рассмотренных материалах о версии 3.1 не указаны действующие публичные лимиты. |
| **Qwen Audio 3.1 TTS-Next** | Совместная генерация речи, звуковых эффектов и фонового аудио | Размещённый API по HTTPS без потоковой передачи в Пекине; документация описывает поддержку китайского и английского языков | **$0.848 за миллион входных токенов + $1.696 за миллион выходных токенов**. До 3 000 входных символов; до четырёх минут аудио для подкаста и до двух минут для остальных форматов. |
| **Qwen Audio 3.1 Realtime Plus** | Полный дуплекс для голосового диалога, включая прерывания и вызовы инструментов | Размещённый API по WebSocket в Сингапуре и Пекине. В [руководстве](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) перечислены 11 языков. | Сингапур: **$0.80 за миллион входных текстовых токенов, $6.40 за миллион входных аудиотокенов, $6.40 за миллион выходных текстовых токенов и $24 за миллион выходных аудиотокенов**. В истории диалога сохраняется до 50 аудиореплик или 300 секунд аудио. |

Это коммерческие продукты с размещённым API. BIG CHANGE не обнаружила загружаемых весов моделей 3.1 или лицензии на них. Лицензия MIT в репозитории QwenAudio распространяется на веб-сайт проекта, поэтому считать её лицензией на модели не следует.

Число поддерживаемых языков также зависит от документа. В [проверенной публикации о запуске](https://www.sina.cn/news/detail/5346330620985983.html) Qwen указано, что ASR поддерживает 30 языков и 16 китайских диалектов; в международном руководстве API перечислены 30 языков и 10 разновидностей диалектов. Разработчикам следует ориентироваться на список для того конечного API, к которому у них есть доступ.

## Заявление о снижении цены на 95% не соответствует открытой таблице тарифов

В [уведомлении об изменении цен](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) Alibaba, вступившем в силу 22 сентября, точное сравнение касается `qwen-audio-3.0-realtime-flash`, а не новой модели 3.1 Realtime Plus. Снижения тарифов для Сингапура рассчитаны по формуле (прежняя ставка − новая ставка) / прежняя ставка:

| Поток Realtime Flash | Раньше (USD) | Теперь (USD) | Снижение |
| --- | --- | --- | --- |
| Входной текст, за миллион токенов | $0.45 | $0.23 | 48.89% |
| Входное аудио, за миллион токенов | $4.50 | $0.93 | 79.33% |
| Выходной текст, за миллион токенов | $4.50 | $0.70 | 84.44% |
| Выходные данные (текст + аудио), за миллион токенов | $15.00 | $1.87 | **87.53%** |

В том же уведомлении говорится, что для TTS Flash 3.1 вместо оплаты за 10 000 символов (0,15 доллара) вводятся отдельные тарифы на входные и выходные токены. На [текущей странице с ценами](https://www.alibabacloud.com/help/en/model-studio/model-pricing) для ASR 3.1 также указана тарификация входных и выходных токенов, тогда как ASR 3.0 тарифицируется за секунду аудио, а выход бесплатен. Процентное сравнение в каждой паре зависит от текста, длительности аудио и токенизации. Поэтому приведённые здесь общедоступные таблицы не позволяют повторить точный расчёт снижения цены ASR на 95%.

## Независимые данные пока относятся к Qwen 3.0

В источниках, рассмотренных в день запуска, не было независимой оценки пяти моделей 3.1. На [странице проекта ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) Qwen приводит результаты бенчмарков, но сообщает, что их не перепроверяли независимые исследователи.

Artificial Analysis ставит [Qwen Audio 3.0 TTS Plus](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) на второе место в рейтинге голосов поставщиков (все акценты и категории): 1 259 Elo, 95%-й доверительный интервал ±17 и 1 447 слепых сравнений. В отдельном [рейтинге голосовых агентов](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) Qwen Audio 3.0 Realtime Plus набрала 699 Elo по предпочтениям пользователей, а время до первого аудиосигнала составило 1,54 секунды. Участники сравнивают скрытые модели в живых диалогах по заданным сценариям.

## Sources

- [Alibaba представляет Qwen Audio 3.1 с пятью новыми моделями](https://the-decoder.com/alibaba-launches-qwen-audio-3-1-with-five-new-models-and-slashes-ai-audio-prices-by-up-to-95-percent) — Обзор запуска пяти моделей с указанием того, что Qwen заявляет о примерном снижении цен на TTS, аудио в реальном времени и ASR. BIG CHANGE проверила тарифы по собственным таблицам Alibaba.
- [Публикация о запуске Qwen Audio 3.1](https://www.sina.cn/news/detail/5346330620985983.html) — Проверенная публикация аккаунта Qwen с названиями пяти моделей и предполагаемыми возможностями. Утверждения о возможностях и скорости атрибутированы поставщику.
- [Уведомление о снижении цен на отдельные аудиомодели в Model Studio](https://www.alibabacloud.com/en/notice/model_studio_price_reduction_notice_for_selected_audio_models_891?_p_lc=1) — Официальное изменение цен от 22 сентября с точными тарифами до и после для 3.0 Realtime Flash в Сингапуре и переходом на другие единицы тарификации для 3.1 TTS Flash.
- [Цены на модели в Model Studio](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — Текущие официальные цены по моделям, модальностям и регионам, в том числе для 3.1 ASR и Realtime Plus.
- [Модели распознавания речи в QwenCloud](https://docs.qwencloud.com/developer-guides/speech/speech-to-text-models) — Актуальные идентификаторы конечных точек ASR, способы доступа, списки языков, поддержка диаризации и ограничения по длительности.
- [Голосовой чат QwenCloud в реальном времени](https://docs.qwencloud.com/developer-guides/speech/qwen-audio-realtime) — Актуальный пример WebSocket для 3.1 Realtime Plus, поддерживаемые голоса и языки, а также ограничения на сохранение истории диалога.
- [Qwen Audio 3.1 TTS-Next](https://www.alibabacloud.com/help/en/model-studio/qwen-audio-3-1-tts-next) — Официальная информация о доступности API только в Пекине, ценах, языках, максимальной длине входа и длительности выходного аудио.
- [Страница проекта Qwen Audio 3.1 ASR](https://github.com/QwenAudio/QwenAudio.github.io/blob/4b61d6f5855d8bf1b8747895a3c54565be565ae9/qwen-audio-3.1-asr/README.md) — Зафиксированная версия страницы проекта Qwen с описанием возможностей ASR и ASR-Next и опубликованными поставщиком результатами бенчмарков; там же сказано, что результаты не воспроизводились независимыми исследователями.
- [Таблица лидеров Artificial Analysis для преобразования текста в речь](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) — Слепое сравнение предпочтений для предшествующей модели Qwen Audio 3.0 TTS Plus, включая число примеров и доверительный интервал.
- [Арена голосовых агентов Artificial Analysis](https://artificialanalysis.ai/articles/announcing-the-speech-agent-arena) — Отдельный результат по предпочтениям и времени до первого аудиосигнала для Qwen Audio 3.0 Realtime Plus; это не оценка версии 3.1.
- [Справочник HTTP API для клонирования голоса](https://www.alibabacloud.com/help/en/model-studio/voice-clone-design-http-api) — В актуальных примерах целевой модели указана TTS Flash версии 3.0. Они не подтверждают наличие отдельного пути интеграции синтеза для версии 3.1.