AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS стал дешевле, но с 1 января его цена удвоится

> Стабильные модели Gemini 3.8 TTS от Google снижают расходы на генерацию аудио, однако 1 января цены удвоятся, а переход требует изменить запросы и обработку WAV-файлов.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Запуск Google 23 сентября](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) представил в Gemini API и AI Studio две стабильные модели синтеза речи: Flash для творческих задач и Flash-Lite для больших объёмов. Доступ к API Gemini Enterprise появится позже.

Обе модели дешевле в расчёте на минуту сгенерированного аудио, чем предварительная версия 3.1 Flash TTS. Их стандартные тарифы удвоятся 1 января 2027 года. При переходе также придётся изменить передачу инструкций и сохранение аудио.

## Главное изменение

- **Что изменилось:** Новые версии отделяют текст расшифровки от указаний по исполнению и поддерживают повторно используемые голоса.
- **Почему это важно:** При переходе голосового конвейера нужно учитывать две статьи расходов: изменения в разработке сейчас и запланированный рост платы за генерацию.
- **За чем следить:** Для дубляжа, аудиокниг и голосовых агентов нужно сравнить разборчивость и постоянство голосов на реальных сценариях производства и на разных языках. Эти результаты покажут, снижает ли более дешёвая минута генерации также стоимость пригодного к использованию аудио.

## Стоимость генерации в минуту

[Таблица тарифов Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) указана скорость 25 аудиотокенов в секунду, или 1500 токенов в минуту. Расчёт: тариф за выходные токены × 1500 / 1 000 000; плата за входной текст начисляется отдельно. Все приведённые ниже суммы — доллары США по стандартному тарифу.

| Модель | Языки по списку | Цена за миллион входных и выходных токенов до 31 декабря 2026 года | Стоимость минуты вывода сейчас | Стоимость минуты вывода с 1 января 2027 года |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Изменения не объявлены |

Для моделей 3.8 тарифы Batch и Flex вдвое ниже стандартного, а Priority в 1,8 раза выше. [В списке моделей Google](https://ai.google.dev/gemini-api/docs/models) рекомендуется заменить устаревшую предварительную версию 3.1 на одну из новых моделей.

## Запросы и аудиофайлы требуют изменений

В [руководстве по переходу на Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) говорится, что текст расшифровки произносится дословно. Длительные указания и обозначения дикторов помещайте в `speech_metadata`; старую инструкцию, например «Say cheerfully:», иначе могут прочитать вслух. Краткие звуковые события, такие как `<laugh>`, остаются внутри строки.

Для каждого говорящего в многостороннем диалоге нужно указать имя, соответствующее конфигурации. В ответах API в режиме unary теперь содержится WAV-заголовок; раньше по умолчанию использовался необработанный PCM. Удалите код, добавляющий WAV-заголовок, либо явно запросите необработанный формат.

[В документации Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) подтверждены общая схема запросов и лимиты 8192 входных и 16 384 выходных токена для обеих моделей. Приложения могут сравнивать их через одну и ту же интеграцию.

## Клонирование голоса и оценка качества

Google сообщает о более чем 2000 готовых голосов, создании голоса и его клонировании по 30-секундному образцу, который пользователь имеет право использовать. Для клонирования нужна соответствующая аудиозапись устного согласия владельца голоса. По данным Google, в сгенерированные аудиофрагменты добавляется SynthID, а клонированные голоса получают учётные данные C2PA.

Клонирование голоса в AI Studio недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии.

По данным Google, Flash набрал 71,4 балла в целом и 60,8 за моделирование акцентов в Voice Design Benchmark от Hume. Компания ставит Flash и Lite на первое и второе места в индексе общего качества Hume.

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) отдельно оценила Flash в 1260,15 Arena Elo и поставила его на 27-е место среди 95 моделей на 23 сентября. Это оценка предпочтений пользователей; рассмотренная страница не подтверждает качество на разных языках или в длинных записях. Сопоставимый независимый результат для Lite здесь не приводится.

Сравнение с другим размещённым сервисом синтеза речи — в нашем материале: [API и цены Qwen Audio 3.1](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Gemini 3.8: преобразование текста в речь](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Официальное объявление: доступные роли моделей, общее число языков, функции голосов, меры согласия, региональная доступность и результаты бенчмарков, приведённые Google. Утверждения о качестве приписаны компании.
- [Документация модели Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Текущая схема запроса, ограничения на вход и выход, обработка текста расшифровки, встроенные теги событий, проверка многостороннего диалога и переход с необработанного PCM на WAV по умолчанию.
- [Документация модели Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Текущее описание версии для больших объёмов: 101 язык по списку и общая с Flash-Lite интерфейсная схема 3.8.
- [Цены Gemini API](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Официальные тарифы Standard, Batch, Flex и Priority, срок действия вводных цен до 31 декабря, новые цены с 1 января и пересчёт по 25 аудиотокенам в секунду.
- [Генерация речи](https://ai.google.dev/gemini-api/docs/speech-generation) — Актуальное руководство по речи описывает таблицу языков 3.8, обработку текста расшифровки и изменения при переходе. Текущая таблица языков не подтверждает общее число языков в прежней предварительной версии.
- [Модели Gemini](https://ai.google.dev/gemini-api/docs/models) — В актуальном списке Gemini 3.1 Flash TTS обозначена как устаревшая предварительная версия; рекомендуется перейти на Gemini 3.8 Flash TTS или Flash-Lite TTS.
- [Gemini 3.8 Flash TTS: анализ качества, скорости и цены](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Независимая карточка Flash, опубликованная в день запуска: 1260,15 Arena Elo и 27-е место среди 95 моделей на момент проверки. Рейтинг может измениться; он не подтверждает работу на множестве языков или в длинных материалах.
