Запуск Google 23 сентября представил в Gemini API и AI Studio две стабильные модели синтеза речи: Flash для творческих задач и Flash-Lite для больших объёмов. Доступ к API Gemini Enterprise появится позже.

Обе модели дешевле в расчёте на минуту сгенерированного аудио, чем предварительная версия 3.1 Flash TTS. Их стандартные тарифы удвоятся 1 января 2027 года. При переходе также придётся изменить передачу инструкций и сохранение аудио.

Главное изменение

  • Что изменилось: Новые версии отделяют текст расшифровки от указаний по исполнению и поддерживают повторно используемые голоса.
  • Почему это важно: При переходе голосового конвейера нужно учитывать две статьи расходов: изменения в разработке сейчас и запланированный рост платы за генерацию.
  • За чем следить: Для дубляжа, аудиокниг и голосовых агентов нужно сравнить разборчивость и постоянство голосов на реальных сценариях производства и на разных языках. Эти результаты покажут, снижает ли более дешёвая минута генерации также стоимость пригодного к использованию аудио.

Стоимость генерации в минуту

Таблица тарифов Google указана скорость 25 аудиотокенов в секунду, или 1500 токенов в минуту. Расчёт: тариф за выходные токены × 1500 / 1 000 000; плата за входной текст начисляется отдельно. Все приведённые ниже суммы — доллары США по стандартному тарифу.

Модель

Языки по списку

Цена за миллион входных и выходных токенов до 31 декабря 2026 года

Стоимость минуты вывода сейчас

Стоимость минуты вывода с 1 января 2027 года

Gemini 3.8 Flash TTS

130

$0.50 / $9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

101

$0.50 / $6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0.03

Изменения не объявлены

Для моделей 3.8 тарифы Batch и Flex вдвое ниже стандартного, а Priority в 1,8 раза выше. В списке моделей Google рекомендуется заменить устаревшую предварительную версию 3.1 на одну из новых моделей.

Запросы и аудиофайлы требуют изменений

В руководстве по переходу на Flash говорится, что текст расшифровки произносится дословно. Длительные указания и обозначения дикторов помещайте в speech_metadata; старую инструкцию, например «Say cheerfully:», иначе могут прочитать вслух. Краткие звуковые события, такие как <laugh>, остаются внутри строки.

Для каждого говорящего в многостороннем диалоге нужно указать имя, соответствующее конфигурации. В ответах API в режиме unary теперь содержится WAV-заголовок; раньше по умолчанию использовался необработанный PCM. Удалите код, добавляющий WAV-заголовок, либо явно запросите необработанный формат.

В документации Flash-Lite подтверждены общая схема запросов и лимиты 8192 входных и 16 384 выходных токена для обеих моделей. Приложения могут сравнивать их через одну и ту же интеграцию.

Клонирование голоса и оценка качества

Google сообщает о более чем 2000 готовых голосов, создании голоса и его клонировании по 30-секундному образцу, который пользователь имеет право использовать. Для клонирования нужна соответствующая аудиозапись устного согласия владельца голоса. По данным Google, в сгенерированные аудиофрагменты добавляется SynthID, а клонированные голоса получают учётные данные C2PA.

Клонирование голоса в AI Studio недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии.

По данным Google, Flash набрал 71,4 балла в целом и 60,8 за моделирование акцентов в Voice Design Benchmark от Hume. Компания ставит Flash и Lite на первое и второе места в индексе общего качества Hume.

Artificial Analysis отдельно оценила Flash в 1260,15 Arena Elo и поставила его на 27-е место среди 95 моделей на 23 сентября. Это оценка предпочтений пользователей; рассмотренная страница не подтверждает качество на разных языках или в длинных записях. Сопоставимый независимый результат для Lite здесь не приводится.

Сравнение с другим размещённым сервисом синтеза речи — в нашем материале: API и цены Qwen Audio 3.1.