세상은 멈춰 있지 않습니다.RSS
BIG CHANGE.

Markdown 버전

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS 가격은 지금 더 낮다. 1월 1일부터 두 배로 오른다

> Google의 안정 버전 Gemini 3.8 TTS 모델은 오디오 생성 비용을 낮추지만, 1월 1일에는 가격이 두 배로 오릅니다. 마이그레이션 과정에서 프롬프트와 WAV 처리 방식도 바뀝니다.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google의 9월 23일 출시](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)로 Gemini API와 AI Studio에 안정 버전 음성 모델 두 가지가 추가됐습니다. 창작 작업에는 Flash, 대량 처리에는 Flash-Lite를 사용할 수 있습니다. Gemini Enterprise API 액세스는 나중에 제공될 예정입니다.

두 모델 모두 생성 오디오 1분당 비용이 3.1 Flash TTS Preview보다 낮습니다. Standard 요금은 2027년 1월 1일에 두 배가 됩니다. 마이그레이션하면 애플리케이션이 지시 사항을 보내고 오디오를 저장하는 방식도 달라집니다.

## 큰 변화

- **바뀐 점:** 새 요금제는 대본 텍스트와 연기 지시를 분리하며, 재사용 가능한 음성을 지원합니다.
- **중요한 이유:** 음성 파이프라인을 마이그레이션할 때는 지금 필요한 엔지니어링 변경과 예정된 생성 요금 인상이라는 두 가지 비용을 고려해야 합니다.
- **지켜볼 점:** 더빙, 오디오북, 음성 에이전트에 사용할 때는 실제 제작 대본으로 여러 언어의 명료도와 화자 일관성을 비교하세요. 그래야 생성 오디오 1분당 비용 절감이 실제로 사용 가능한 오디오의 비용까지 낮추는지 알 수 있습니다.

## 오디오 생성 분당 비용

[Google의 가격표](https://ai.google.dev/gemini-api/docs/pricing?hl=en)는 초당 오디오 토큰 25개, 즉 분당 1,500개로 정하고 있습니다. 계산식은 출력 요금 × 1,500 / 1,000,000이며, 텍스트 입력 요금은 별도입니다. 아래 금액은 모두 Standard 요금 기준 미국 달러입니다.

| 모델 | 지원 언어 수 | 2026년 12월 31일까지 입력 / 출력(토큰 100만 개당) | 현재 분당 출력 비용 | 2027년 1월 1일부터 분당 출력 비용 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130개 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101개 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | 변경 발표 없음 |

3.8 모델에서는 Batch와 Flex 요금이 Standard의 절반, Priority는 Standard의 1.8배입니다. Google의 [모델 인덱스](https://ai.google.dev/gemini-api/docs/models)에서는 기존 3.1 Preview를 새 Flash 또는 Flash-Lite 요금제로 교체할 것을 권장합니다.

## 프롬프트와 오디오 파일도 조정해야 합니다

Google의 [Flash 마이그레이션 안내](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)에서는 대본 텍스트를 입력한 그대로 음성화한다고 설명합니다. 지속적인 지시 사항과 화자 레이블은 `speech_metadata`에 넣어야 합니다. 예전의 ‘Say cheerfully:’와 같은 지시 문구는 그렇지 않으면 소리 내어 읽힐 수 있습니다. `<laugh>`와 같은 짧은 이벤트는 인라인으로 남습니다.

이제 여러 화자가 등장하는 모든 발화에는 구성에 지정된 화자 이름이 들어가야 합니다. 또한 단일 요청(unary) 응답에는 WAV 헤더가 포함되어 기존 기본값인 원시 PCM을 대체합니다. WAV 헤더를 추가하는 코드를 제거하거나, 원시 형식을 명시적으로 요청하세요.

[Flash-Lite 문서](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)는 두 요금제가 동일한 스키마를 공유하며 입력 한도는 8,192토큰, 출력 한도는 16,384토큰이라고 확인해 줍니다. 따라서 애플리케이션은 같은 통합 방식으로 두 모델을 비교할 수 있습니다.

## 음성 복제 및 평가

Google은 바로 사용할 수 있는 음성 2,000개 이상, 음성 디자인, 사용 권한이 있는 음성의 30초 샘플을 이용한 복제 기능을 설명합니다. 음성을 복제하려면 해당 화자와 일치하는 음성 동의 녹음이 필요합니다. Google은 생성된 클립에 SynthID가 삽입되고 복제 음성에는 C2PA 자격 증명이 포함된다고 밝혔습니다.

AI Studio의 음성 복제 기능은 미국 일리노이주와 텍사스주, 유럽경제지역, 영국, 스위스, 인도에서 사용할 수 없습니다.

Google은 Flash가 Hume Voice Design Benchmark에서 전체 점수 71.4점, 억양 모델링 점수 60.8점을 기록했다고 보고했습니다. Overall Quality Index에서는 Flash와 Lite가 각각 1위와 2위라고 밝혔습니다.

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts)는 9월 23일 기준 Flash를 Arena Elo 1260.15점으로 별도 등재했으며, 모델 95개 중 27위였습니다. 이 점수는 대중의 선호도를 측정합니다. 검토한 순위 자료만으로는 언어별 성능이나 장시간 녹음 성능을 알 수 없습니다. 이에 해당하는 Lite의 독립 평가 결과는 이 기사에서 사용하지 않았습니다.

다른 호스팅 음성 모델 제품군과 비교하려면 [Qwen Audio 3.1 API 및 가격 분석](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)을 참조하세요.

## Sources

- [Gemini 3.8 텍스트 음성 변환이 첫선을 보이다](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — 공식 발표의 범위, 모델별 역할, 지원 언어 수, 음성 기능, 동의 절차, 지역별 이용 가능 여부, Google이 보고한 벤치마크 결과를 담고 있습니다. 품질 주장은 모두 Google의 설명으로 표시했습니다.
- [Gemini 3.8 Flash TTS 모델 문서](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — 현재 요청 스키마, 입력 및 출력 한도, 대본 처리, 인라인 이벤트 태그, 다중 화자 검증, 원시 PCM에서 WAV 기본 출력으로의 변경 사항을 설명합니다.
- [Gemini 3.8 Flash-Lite TTS 모델 문서](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — 대량 처리용 요금제와 지원 언어 101개, 3.8 공통 인터페이스에 대한 최신 설명입니다.
- [Gemini API 가격](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — 공식 Standard, Batch, Flex, Priority 요금, 12월 31일 입문 가격 종료일, 1월 1일부터의 요금, 초당 오디오 토큰 25개 기준 환산을 확인할 수 있습니다.
- [텍스트 음성 변환 생성](https://ai.google.dev/gemini-api/docs/speech-generation) — 현재 음성 안내 문서에는 3.8의 언어표, 대본 처리, 마이그레이션 동작이 설명돼 있습니다. 현재 언어표로는 이전 Preview의 지원 언어 수를 확인할 수 없습니다.
- [Gemini 모델](https://ai.google.dev/gemini-api/docs/models) — 현재 모델 인덱스는 3.1 Flash TTS를 레거시 Preview로 표시하고 Gemini 3.8 Flash TTS 또는 Flash-Lite TTS로 업데이트할 것을 권장합니다.
- [Gemini 3.8 Flash TTS 품질, 속도, 가격 분석](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — 출시일에 게시된 독립 목록으로, 검토 당시 Flash 모델의 Arena Elo 점수 1260.15와 95개 모델 중 27위라는 순위를 제시합니다. 순위는 바뀔 수 있으며 다국어 또는 장시간 오디오 검증 결과는 아닙니다.