Запуск Google 23 сентября представил в Gemini API и AI Studio две стабильные модели синтеза речи: Flash для творческих задач и Flash-Lite для больших объёмов. Доступ к API Gemini Enterprise появится позже.
Обе модели дешевле в расчёте на минуту сгенерированного аудио, чем предварительная версия 3.1 Flash TTS. Их стандартные тарифы удвоятся 1 января 2027 года. При переходе также придётся изменить передачу инструкций и сохранение аудио.
Главное изменение
- Что изменилось: Новые версии отделяют текст расшифровки от указаний по исполнению и поддерживают повторно используемые голоса.
- Почему это важно: При переходе голосового конвейера нужно учитывать две статьи расходов: изменения в разработке сейчас и запланированный рост платы за генерацию.
- За чем следить: Для дубляжа, аудиокниг и голосовых агентов нужно сравнить разборчивость и постоянство голосов на реальных сценариях производства и на разных языках. Эти результаты покажут, снижает ли более дешёвая минута генерации также стоимость пригодного к использованию аудио.
Стоимость генерации в минуту
Таблица тарифов Google указана скорость 25 аудиотокенов в секунду, или 1500 токенов в минуту. Расчёт: тариф за выходные токены × 1500 / 1 000 000; плата за входной текст начисляется отдельно. Все приведённые ниже суммы — доллары США по стандартному тарифу.
Модель | Языки по списку | Цена за миллион входных и выходных токенов до 31 декабря 2026 года | Стоимость минуты вывода сейчас | Стоимость минуты вывода с 1 января 2027 года |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Изменения не объявлены |
Для моделей 3.8 тарифы Batch и Flex вдвое ниже стандартного, а Priority в 1,8 раза выше. В списке моделей Google рекомендуется заменить устаревшую предварительную версию 3.1 на одну из новых моделей.
Запросы и аудиофайлы требуют изменений
В руководстве по переходу на Flash говорится, что текст расшифровки произносится дословно. Длительные указания и обозначения дикторов помещайте в speech_metadata; старую инструкцию, например «Say cheerfully:», иначе могут прочитать вслух. Краткие звуковые события, такие как <laugh>, остаются внутри строки.
Для каждого говорящего в многостороннем диалоге нужно указать имя, соответствующее конфигурации. В ответах API в режиме unary теперь содержится WAV-заголовок; раньше по умолчанию использовался необработанный PCM. Удалите код, добавляющий WAV-заголовок, либо явно запросите необработанный формат.
В документации Flash-Lite подтверждены общая схема запросов и лимиты 8192 входных и 16 384 выходных токена для обеих моделей. Приложения могут сравнивать их через одну и ту же интеграцию.
Клонирование голоса и оценка качества
Google сообщает о более чем 2000 готовых голосов, создании голоса и его клонировании по 30-секундному образцу, который пользователь имеет право использовать. Для клонирования нужна соответствующая аудиозапись устного согласия владельца голоса. По данным Google, в сгенерированные аудиофрагменты добавляется SynthID, а клонированные голоса получают учётные данные C2PA.
Клонирование голоса в AI Studio недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии.
По данным Google, Flash набрал 71,4 балла в целом и 60,8 за моделирование акцентов в Voice Design Benchmark от Hume. Компания ставит Flash и Lite на первое и второе места в индексе общего качества Hume.
Artificial Analysis отдельно оценила Flash в 1260,15 Arena Elo и поставила его на 27-е место среди 95 моделей на 23 сентября. Это оценка предпочтений пользователей; рассмотренная страница не подтверждает качество на разных языках или в длинных записях. Сопоставимый независимый результат для Lite здесь не приводится.
Сравнение с другим размещённым сервисом синтеза речи — в нашем материале: API и цены Qwen Audio 3.1.



