Команда Qwen компании Alibaba представила пять моделей Qwen Audio 3.1 для расшифровки, синтеза речи и голосового взаимодействия в реальном времени. Для ASR, TTS-Next и Realtime Plus документированы размещённые конечные точки. Для TTS Flash указан идентификатор модели и цена, но документация интеграции менее полная; в общедоступных документах разработчика, рассмотренных BIG CHANGE, для ASR-Next не указаны идентификатор модели, регион или цена.
Как сообщило издание The Decoder, Qwen заявляет о снижении цен примерно на 70% для преобразования текста в речь, на 85% для аудио в реальном времени и до 95% для распознавания речи. При проверке этих цифр важны единицы тарификации.
Главное изменение
- Что изменилось: Теперь семейство размещённых моделей Qwen охватывает больше компонентов голосового продукта: от расшифровки и синтеза речи до создания звуковых сцен и живого диалога. При этом документация доступа для пяти компонентов пока различается по полноте.
- Почему это важно: Разработчикам, планирующим бюджет на распознавание речи или голосовые сервисы, уже недостаточно знать цену одной минуты аудио: у ASR с тарификацией по токенам оплачиваются и входящее аудио, и полученный текст, а у диалога в реальном времени отдельно тарифицируются четыре потока данных.
- За чем следить: Помимо доступа к ASR-Next, нужно следить за тем, подтвердят ли независимые проверки языкового охвата и задержки полезную экономию. Если да, возникает следующий вопрос: перенесут ли сервисы голосовых агентов, расшифровки и дубляжа эту экономию в цены для клиентов и последуют ли за ними конкурирующие голосовые API.
Пять моделей: краткая карта
Анонсированная модель | Назначение | Документированный доступ на 23 сентября | Цена и практические ограничения |
|---|---|---|---|
Qwen Audio 3.1 ASR | Потоковая расшифровка, обработка файлов и коротких аудиозаписей; диаризация дикторов доступна по выбору для файловых и коротких запросов | Размещённые API по WebSocket или HTTP в Сингапуре и Пекине. В международном руководстве перечислены 30 языков и 10 разновидностей китайских диалектов. | В Сингапуре цена составляет от $0.15 за миллион входных аудиотокенов + $0.47 за миллион выходных текстовых токенов для файловой и краткой расшифровки до $0.93 + $0.70 для потоковой обработки и сообщений. Файловая расшифровка: до 12 часов и 2 ГБ; короткая: до 5 минут и 2 ГБ. |
Qwen Audio 3.1 ASR-Next | Определение дикторов и временных меток, а также распознавание эмоций, фоновых событий и звуков машин | Модель анонсирована Qwen; в актуальной документации Model Studio и QwenCloud не удалось найти общедоступный идентификатор модели API, регион, тариф или лимит | В открытых документах не указано |
Qwen Audio 3.1 TTS | Многоязычный синтез речи, перенос голоса между языками и управление подачей с помощью промпта | | Сингапур: $0.23 за миллион входных текстовых токенов + $1.87 за миллион выходных аудиотокенов. В рассмотренных материалах о версии 3.1 не указаны действующие публичные лимиты. |
Qwen Audio 3.1 TTS-Next | Совместная генерация речи, звуковых эффектов и фонового аудио | Размещённый API по HTTPS без потоковой передачи в Пекине; документация описывает поддержку китайского и английского языков | $0.848 за миллион входных токенов + $1.696 за миллион выходных токенов. До 3 000 входных символов; до четырёх минут аудио для подкаста и до двух минут для остальных форматов. |
Qwen Audio 3.1 Realtime Plus | Полный дуплекс для голосового диалога, включая прерывания и вызовы инструментов | Размещённый API по WebSocket в Сингапуре и Пекине. В руководстве перечислены 11 языков. | Сингапур: $0.80 за миллион входных текстовых токенов, $6.40 за миллион входных аудиотокенов, $6.40 за миллион выходных текстовых токенов и $24 за миллион выходных аудиотокенов. В истории диалога сохраняется до 50 аудиореплик или 300 секунд аудио. |
Это коммерческие продукты с размещённым API. BIG CHANGE не обнаружила загружаемых весов моделей 3.1 или лицензии на них. Лицензия MIT в репозитории QwenAudio распространяется на веб-сайт проекта, поэтому считать её лицензией на модели не следует.
Число поддерживаемых языков также зависит от документа. В проверенной публикации о запуске Qwen указано, что ASR поддерживает 30 языков и 16 китайских диалектов; в международном руководстве API перечислены 30 языков и 10 разновидностей диалектов. Разработчикам следует ориентироваться на список для того конечного API, к которому у них есть доступ.
Заявление о снижении цены на 95% не соответствует открытой таблице тарифов
В уведомлении об изменении цен Alibaba, вступившем в силу 22 сентября, точное сравнение касается qwen-audio-3.0-realtime-flash, а не новой модели 3.1 Realtime Plus. Снижения тарифов для Сингапура рассчитаны по формуле (прежняя ставка − новая ставка) / прежняя ставка:
Поток Realtime Flash | Раньше (USD) | Теперь (USD) | Снижение |
|---|---|---|---|
Входной текст, за миллион токенов | $0.45 | $0.23 | 48.89% |
Входное аудио, за миллион токенов | $4.50 | $0.93 | 79.33% |
Выходной текст, за миллион токенов | $4.50 | $0.70 | 84.44% |
Выходные данные (текст + аудио), за миллион токенов | $15.00 | $1.87 | 87.53% |
В том же уведомлении говорится, что для TTS Flash 3.1 вместо оплаты за 10 000 символов (0,15 доллара) вводятся отдельные тарифы на входные и выходные токены. На текущей странице с ценами для ASR 3.1 также указана тарификация входных и выходных токенов, тогда как ASR 3.0 тарифицируется за секунду аудио, а выход бесплатен. Процентное сравнение в каждой паре зависит от текста, длительности аудио и токенизации. Поэтому приведённые здесь общедоступные таблицы не позволяют повторить точный расчёт снижения цены ASR на 95%.
Независимые данные пока относятся к Qwen 3.0
В источниках, рассмотренных в день запуска, не было независимой оценки пяти моделей 3.1. На странице проекта ASR Qwen приводит результаты бенчмарков, но сообщает, что их не перепроверяли независимые исследователи.
Artificial Analysis ставит Qwen Audio 3.0 TTS Plus на второе место в рейтинге голосов поставщиков (все акценты и категории): 1 259 Elo, 95%-й доверительный интервал ±17 и 1 447 слепых сравнений. В отдельном рейтинге голосовых агентов Qwen Audio 3.0 Realtime Plus набрала 699 Elo по предпочтениям пользователей, а время до первого аудиосигнала составило 1,54 секунды. Участники сравнивают скрытые модели в живых диалогах по заданным сценариям.



