Google의 9월 23일 출시로 Gemini API와 AI Studio에 안정 버전 음성 모델 두 가지가 추가됐습니다. 창작 작업에는 Flash, 대량 처리에는 Flash-Lite를 사용할 수 있습니다. Gemini Enterprise API 액세스는 나중에 제공될 예정입니다.
두 모델 모두 생성 오디오 1분당 비용이 3.1 Flash TTS Preview보다 낮습니다. Standard 요금은 2027년 1월 1일에 두 배가 됩니다. 마이그레이션하면 애플리케이션이 지시 사항을 보내고 오디오를 저장하는 방식도 달라집니다.
큰 변화
- 바뀐 점: 새 요금제는 대본 텍스트와 연기 지시를 분리하며, 재사용 가능한 음성을 지원합니다.
- 중요한 이유: 음성 파이프라인을 마이그레이션할 때는 지금 필요한 엔지니어링 변경과 예정된 생성 요금 인상이라는 두 가지 비용을 고려해야 합니다.
- 지켜볼 점: 더빙, 오디오북, 음성 에이전트에 사용할 때는 실제 제작 대본으로 여러 언어의 명료도와 화자 일관성을 비교하세요. 그래야 생성 오디오 1분당 비용 절감이 실제로 사용 가능한 오디오의 비용까지 낮추는지 알 수 있습니다.
오디오 생성 분당 비용
Google의 가격표는 초당 오디오 토큰 25개, 즉 분당 1,500개로 정하고 있습니다. 계산식은 출력 요금 × 1,500 / 1,000,000이며, 텍스트 입력 요금은 별도입니다. 아래 금액은 모두 Standard 요금 기준 미국 달러입니다.
모델 | 지원 언어 수 | 2026년 12월 31일까지 입력 / 출력(토큰 100만 개당) | 현재 분당 출력 비용 | 2027년 1월 1일부터 분당 출력 비용 |
|---|---|---|---|---|
Gemini 3.8 Flash TTS | 130개 | $0.50 / $9 | $0.0135 | $0.027 |
Gemini 3.8 Flash-Lite TTS | 101개 | $0.50 / $6 | $0.009 | $0.018 |
Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | 변경 발표 없음 |
3.8 모델에서는 Batch와 Flex 요금이 Standard의 절반, Priority는 Standard의 1.8배입니다. Google의 모델 인덱스에서는 기존 3.1 Preview를 새 Flash 또는 Flash-Lite 요금제로 교체할 것을 권장합니다.
프롬프트와 오디오 파일도 조정해야 합니다
Google의 Flash 마이그레이션 안내에서는 대본 텍스트를 입력한 그대로 음성화한다고 설명합니다. 지속적인 지시 사항과 화자 레이블은 speech_metadata에 넣어야 합니다. 예전의 ‘Say cheerfully:’와 같은 지시 문구는 그렇지 않으면 소리 내어 읽힐 수 있습니다. <laugh>와 같은 짧은 이벤트는 인라인으로 남습니다.
이제 여러 화자가 등장하는 모든 발화에는 구성에 지정된 화자 이름이 들어가야 합니다. 또한 단일 요청(unary) 응답에는 WAV 헤더가 포함되어 기존 기본값인 원시 PCM을 대체합니다. WAV 헤더를 추가하는 코드를 제거하거나, 원시 형식을 명시적으로 요청하세요.
Flash-Lite 문서는 두 요금제가 동일한 스키마를 공유하며 입력 한도는 8,192토큰, 출력 한도는 16,384토큰이라고 확인해 줍니다. 따라서 애플리케이션은 같은 통합 방식으로 두 모델을 비교할 수 있습니다.
음성 복제 및 평가
Google은 바로 사용할 수 있는 음성 2,000개 이상, 음성 디자인, 사용 권한이 있는 음성의 30초 샘플을 이용한 복제 기능을 설명합니다. 음성을 복제하려면 해당 화자와 일치하는 음성 동의 녹음이 필요합니다. Google은 생성된 클립에 SynthID가 삽입되고 복제 음성에는 C2PA 자격 증명이 포함된다고 밝혔습니다.
AI Studio의 음성 복제 기능은 미국 일리노이주와 텍사스주, 유럽경제지역, 영국, 스위스, 인도에서 사용할 수 없습니다.
Google은 Flash가 Hume Voice Design Benchmark에서 전체 점수 71.4점, 억양 모델링 점수 60.8점을 기록했다고 보고했습니다. Overall Quality Index에서는 Flash와 Lite가 각각 1위와 2위라고 밝혔습니다.
Artificial Analysis는 9월 23일 기준 Flash를 Arena Elo 1260.15점으로 별도 등재했으며, 모델 95개 중 27위였습니다. 이 점수는 대중의 선호도를 측정합니다. 검토한 순위 자료만으로는 언어별 성능이나 장시간 녹음 성능을 알 수 없습니다. 이에 해당하는 Lite의 독립 평가 결과는 이 기사에서 사용하지 않았습니다.
다른 호스팅 음성 모델 제품군과 비교하려면 Qwen Audio 3.1 API 및 가격 분석을 참조하세요.



