HINDI TUMITIGIL ANG MUNDO.RSS
BIG CHANGE.

Markdown edition

AI-translated from English; not yet reviewed by a fluent editor.

# Mas mura na ang Gemini 3.8 TTS. Doble ang presyo nito sa Enero 1

> Ibinababa ng mga matatag nang Gemini 3.8 TTS model ng Google ang gastos sa nalikhang audio, pero dodoble ang mga presyo sa Enero 1 at may pagbabago sa prompt at paghawak ng WAV na kailangang isaalang-alang sa paglipat.

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Sa paglulunsad ng Google noong Setyembre 23](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) nagdagdag ito sa Gemini API at AI Studio ng dalawang matatag nang speech model: Flash para sa malikhaing gawain at Flash-Lite para sa malaking bolyum. Darating pa ang akses sa Gemini Enterprise API.

Mas mura kada minutong nalikhang audio ang dalawang ito kaysa 3.1 Flash TTS Preview. Dodoble ang Standard rate ng mga ito sa Enero 1, 2027. Nagbabago rin sa paglipat kung paano nagpapadala ng tagubilin at nagse-save ng audio ang mga application.

## Ang malaking pagbabago

- **Ano ang nagbago:** Pinag-iiba ng mga bagong tier ang teksto ng transcript at direksiyon sa pagbigkas, at sinusuportahan ng mga ito ang mga boses na magagamit muli.
- **Bakit ito mahalaga:** May dalawang gastos sa paglipat na dapat isaalang-alang sa voice pipeline: mga pagbabago sa inhinyeriya ngayon at nakatakdang pagtaas ng singil sa pagbuo ng audio.
- **Ano ang dapat bantayan:** Para sa dubbing, audiobook at voice agent, ihambing sa mga tunay na iskrip sa produksyon sa iba’t ibang wika ang pagkaunawa sa pananalita at pagkakapare-pareho ng tagapagsalita. Ipapakita ng mga resultang iyon kung binabawasan nga ng mas murang minutong nalikha ang gastos sa audio na magagamit.

## Gastos sa pagbuo ng audio kada minuto

[Tinutukoy sa talahanayan ng presyo ng Google](https://ai.google.dev/gemini-api/docs/pricing?hl=en) na 25 audio token kada segundo, o 1,500 kada minuto. Ang kalkulasyon ay presyo sa output × 1,500 / 1,000,000; may dagdag na singil sa input na teksto. Nasa dolyar ng US ang lahat ng halaga sa ibaba, gamit ang Standard rate.

| Modelo | Mga wikang nakalista | Presyo sa input / output kada 1M token hanggang Dis. 31, 2026 | Gastos sa output kada minuto ngayon | Gastos sa output kada minuto simula Ene. 1, 2027 |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | 130 | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | 101 | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | Walang inianunsiyong pagbabago |

Kalahati ng Standard ang halaga ng Batch at Flex para sa mga modelong 3.8; 1.8 ulit naman ng Standard ang Priority. Inirerekomenda sa [indeks ng mga modelo](https://ai.google.dev/gemini-api/docs/models) ng Google na palitan ang lumang 3.1 preview ng alinman sa bagong tier.

## Kailangang baguhin ang mga prompt at audio file

Sinasabi sa [gabay sa paglipat sa Flash](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) na binibigkas nang eksakto ang teksto ng transcript. Ilagay ang tuluy-tuloy na direksiyon at label ng tagapagsalita sa `speech_metadata`; kung hindi, maaaring bigkasin nang malakas ang lumang tagubilin gaya ng “Say cheerfully:”. Nananatiling naka-inline ang maiikling pangyayari gaya ng `<laugh>`.

Dapat tukuyin sa bawat salitan ng maraming tagapagsalita ang isang tagapagsalitang tugma sa configuration. May WAV header na ngayon ang mga unary response, na pumalit sa dating default na raw PCM. Alisin ang code na nagdaragdag ng WAV header o tahasang humiling ng raw format.

[Kinukumpirma ng dokumentasyon ng Flash-Lite](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) ang magkakaparehong schema at limitasyong 8,192 input token at 16,384 output token para sa dalawang tier. Kaya maaaring paghambingin ng mga application ang mga ito gamit ang iisang integrasyon.

## Paggaya ng boses at pagsusuri

Inilalarawan ng Google ang mahigit 2,000 nakahandang boses, pagdidisenyo ng boses at paggaya mula sa 30 segundong sampol ng boses na may karapatan ang gumagamit na gamitin. Kailangan sa paggaya ng katugmang rekording ng pasalitang pahintulot. Ayon sa Google, may SynthID ang mga nalikhang clip at C2PA credential naman ang mga ginayang boses.

Hindi magagamit ang paggaya ng boses sa AI Studio sa Illinois, Texas, European Economic Area, UK, Switzerland at India.

Iniulat ng Google na nakakuha ang Flash ng iskor na 71.4 sa kabuuan at 60.8 sa pagmomodelo ng punto sa pananalita sa Voice Design Benchmark ng Hume. Inilagay nito ang Flash at Lite sa una at ikalawang puwesto sa Overall Quality Index ng Hume.

[Hiwalay na inilista ng Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) noong Setyembre 23 ang Flash na may 1260.15 Arena Elo, ika-27 sa 95 modelo. Sukat ito ng kagustuhan ng mga bumoboto; hindi itinatatag sa sinuring tala ang pagganap sa bawat wika o sa mahahabang rekording. Walang katumbas na hiwalay na resulta para sa Lite na ginamit dito.

Para sa paghahambing sa isa pang hosted na hanay ng speech model, tingnan ang aming pagsusuri sa [API at pagpepresyo ng Qwen Audio 3.1](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing).

## Sources

- [Nagbibigay ng boses ang Gemini 3.8 text-to-speech](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — Opisyal na saklaw ng paglulunsad, mga papel ng modelo, kabuuan ng wika, tampok sa boses, kontrol sa pahintulot, akses ayon sa rehiyon at mga resulta ng benchmark na iniulat ng Google. Iniuugnay pa rin sa Google ang mga pahayag tungkol sa kalidad.
- [Dokumentasyon ng modelong Gemini 3.8 Flash TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — Kasalukuyang schema ng kahilingan, limitasyon sa input at output, paghawak ng transcript, inline na tag ng pangyayari, pagpapatunay sa maraming tagapagsalita at pagpapalit mula raw PCM tungo sa default na WAV output.
- [Dokumentasyon ng modelong Gemini 3.8 Flash-Lite TTS](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — Kasalukuyang paglalarawan sa tier na mataas ang throughput, 101 wikang nakalista at kaparehong interface ng 3.8.
- [Pagpepresyo ng Gemini API](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — Opisyal na Standard, Batch, Flex at Priority rate, takdang petsa ng panimulang presyo sa Disyembre 31, mga rate simula Enero 1 at conversion gamit ang 25 audio token kada segundo.
- [Pagbuo ng text-to-speech](https://ai.google.dev/gemini-api/docs/speech-generation) — Inilalarawan sa kasalukuyang gabay sa pananalita ang talahanayan ng wika para sa 3.8, paghawak ng transcript at gawi sa paglipat. Hindi itinatatag sa kasalukuyang talahanayan ng wika ang kabuuan ng wikang sinusuportahan ng mas lumang preview.
- [Mga modelo ng Gemini](https://ai.google.dev/gemini-api/docs/models) — Nilalagyan ng kasalukuyang indeks ng modelo ng label na lumang preview ang 3.1 Flash TTS at inirerekomenda ang pag-update sa Gemini 3.8 Flash TTS o Flash-Lite TTS.
- [Pagsusuri sa kalidad, bilis at presyo ng Gemini 3.8 Flash TTS](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — Hiwalay na tala noong araw ng paglulunsad para sa mismong modelong Flash: 1260.15 Arena Elo at ika-27 sa 95 noong panahong sinuri. Maaaring magbago ang ranggo at hindi ito beripikasyon sa maraming wika o mahahabang rekording.