পৃথিবী স্থির নেই।RSS
BIG CHANGE.

Markdown সংস্করণ

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 3.8 TTS এখন সস্তা; ১ জানুয়ারি দাম দ্বিগুণ

> Google-এর স্থিতিশীল Gemini 3.8 TTS model-এ তৈরি করা অডিওর খরচ কম, তবে ১ জানুয়ারি দাম দ্বিগুণ হবে। migration-এ prompt ও WAV সামলানোর পদ্ধতিও বদলাবে।

By BIG CHANGE Editorial

Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

![A single unbranded studio monitor sits on isolation pads on a wall-mounted shelf inside a sound-treated alcove.](https://bigchange.ai/api/media/file/gemini-tts-studio-monitor-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

[Google-এর ২৩ সেপ্টেম্বরের উদ্বোধনী ঘোষণা](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) Gemini API ও AI Studio-তে দুটি স্থিতিশীল speech model এনেছে: সৃজনশীল কাজে Flash এবং বেশি পরিমাণে তৈরির কাজে Flash-Lite। Gemini Enterprise-এ API-র মাধ্যমে প্রবেশাধিকার পরে আসবে।

প্রতি মিনিটে তৈরি অডিওর খরচ—দুটিরই 3.1 Flash TTS Preview-এর চেয়ে কম। তবে Standard rate ২০২৭ সালের ১ জানুয়ারি দ্বিগুণ হবে। migration-এ application-এর নির্দেশনা পাঠানো ও অডিও সংরক্ষণের পদ্ধতিও বদলাতে হবে।

## বড় পরিবর্তন

- **কী বদলেছে:** নতুন tier-গুলোতে transcript-এর লেখা ও পরিবেশনার নির্দেশনা আলাদা করে দেওয়া যায়, আর একই voice পুনরায় ব্যবহার করা যায়।
- **কেন গুরুত্বপূর্ণ:** voice pipeline-এ migration-এর দুটি খরচ বিবেচনা করতে হবে: এখনই প্রকৌশলগত পরিবর্তনের খরচ এবং নির্ধারিত হারে generation-এর ব্যয় বৃদ্ধি।
- **কী লক্ষ করবেন:** dubbing, audiobook ও voice agent-এর ক্ষেত্রে একাধিক ভাষার প্রকৃত production script দিয়ে উচ্চারণের বোধগম্যতা ও speaker-এর ধারাবাহিকতা তুলনা করুন। এতে বোঝা যাবে, প্রতি মিনিটে অডিও তৈরি সস্তা হলেও ব্যবহারযোগ্য অডিওর মোট খরচ কমে কি না।

## প্রতি মিনিটে আউটপুটের খরচ

[Google-এর মূল্যতালিকায়](https://ai.google.dev/gemini-api/docs/pricing?hl=en) প্রতি সেকেন্ডে ২৫টি audio token, অর্থাৎ প্রতি মিনিটে ১,৫০০টি ধরা হয়েছে। হিসাব: প্রতি মিনিটের output খরচ = (প্রতি ১,০০০,০০০ token-এ output rate × ১,৫০০) ÷ ১,০০০,০০০; text input-এর চার্জ অতিরিক্ত। নিচের সব অঙ্ক Standard rate-এ মার্কিন ডলারে।

| মডেল | তালিকাভুক্ত ভাষা | ৩১ ডিসেম্বর ২০২৬ পর্যন্ত প্রতি ১ মিলিয়ন token-এ input / output | এখন প্রতি মিনিটে আউটপুট | ১ জানুয়ারি ২০২৭ থেকে প্রতি মিনিটে আউটপুট |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | ১৩০ | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | ১০১ | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | পরিবর্তনের ঘোষণা নেই |

3.8 model-এ Batch ও Flex-এর দাম Standard-এর অর্ধেক; Priority-র দাম Standard-এর ১.৮ গুণ। Google-এর [model index-এ](https://ai.google.dev/gemini-api/docs/models) পুরোনো 3.1 preview-এর বদলে নতুন দুটির যেকোনো tier ব্যবহারের পরামর্শ দেওয়া হয়েছে।

## prompt ও অডিও ফাইলে পরিবর্তন দরকার

এই [Flash migration guide](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)-এ বলা হয়েছে, transcript-এর লেখা হুবহু উচ্চারণ করা হয়। দীর্ঘস্থায়ী নির্দেশনা ও speaker label `speech_metadata` অংশে রাখুন; পুরোনো “আনন্দের সঙ্গে বলুন:” ধরনের নির্দেশনা নইলে উচ্চারণ করে শোনানো হতে পারে। সংক্ষিপ্ত event যেমন `<laugh>` tag-টি transcript-এ inline-ই থাকে।

একাধিক speaker-যুক্ত প্রতিটি turn-এ configuration-এ থাকা কোনো speaker-এর নাম দিতে হবে। এখন unary response-এ WAV header থাকে; আগে default ছিল raw PCM। WAV header যোগ করে এমন code সরিয়ে ফেলুন, অথবা স্পষ্টভাবে raw format চেয়ে নিন।

[Flash-Lite-এর নথিতে](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) দুই tier-এর জন্য একই schema এবং input-এ ৮,১৯২ token ও output-এ ১৬,৩৮৪ token-এর সীমা নিশ্চিত করা হয়েছে। ফলে application-গুলো একই integration দিয়ে দুই model তুলনা করতে পারে।

## voice replication ও মূল্যায়ন

Google-এর বর্ণনা অনুযায়ী, ব্যবহারকারীর ব্যবহারের অধিকার আছে এমন voice-এর ৩০-সেকেন্ডের নমুনা থেকে voice design ও replication করা যায়, আর আগে থেকে তৈরি voice আছে ২,০০০-এর বেশি। replication-এর জন্য একই voice-এ বলা সম্মতির recording দরকার। Google বলেছে, তৈরি clip-এ SynthID থাকে এবং replicate করা voice-এ C2PA credential থাকে।

AI Studio-তে voice replication Illinois, Texas, European Economic Area, UK, Switzerland ও India-তে পাওয়া যায় না।

Google-এর দেওয়া Hume’s Voice Design Benchmark-এ Flash-এর সামগ্রিক score 71.4 এবং accent modeling-এ 60.8। Hume’s Overall Quality Index-এ Google Flash ও Lite-কে যথাক্রমে প্রথম ও দ্বিতীয় স্থানে রেখেছে।

[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) ২৩ সেপ্টেম্বরের তালিকায় Flash-কে আলাদাভাবে 1260.15 Arena Elo দিয়েছে—৯৫টি model-এর মধ্যে ২৭তম। এই মাপটি জনতার পছন্দের প্রতিফলন; পর্যালোচিত তালিকা থেকে ভাষাভিত্তিক বা দীর্ঘ recording-এ কর্মদক্ষতা প্রতিষ্ঠিত হয় না। Lite-এর সমতুল্য কোনো স্বাধীন ফল এখানে ব্যবহার করা হয়নি।

অন্য hosted speech lineup-এর সঙ্গে তুলনার জন্য পড়ুন আমাদের [Qwen Audio 3.1 API ও মূল্য বিশ্লেষণ](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)।

## Sources

- [Gemini 3.8 text-to-speech-এর ঘোষণা](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — উদ্বোধনের আনুষ্ঠানিক পরিধি, model-এর ভূমিকা, ভাষার সংখ্যা, voice সুবিধা, সম্মতি নিয়ন্ত্রণ, আঞ্চলিক প্রবেশাধিকার ও Google-এর জানানো benchmark ফল। গুণমানের দাবিগুলো Google-এর বক্তব্য হিসেবে উল্লেখ করা হয়েছে।
- [Gemini 3.8 Flash TTS model-এর নথি](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — বর্তমান request schema, input ও output সীমা, transcript-এ লেখার ব্যবহার, inline event tag, একাধিক speaker যাচাই এবং raw PCM থেকে default WAV output-এ পরিবর্তন।
- [Gemini 3.8 Flash-Lite TTS model-এর নথি](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — উচ্চ পরিমাণে কাজের tier-এর বর্তমান বিবরণ, তালিকাভুক্ত ১০১টি ভাষা এবং উভয় model-এ অভিন্ন 3.8 interface।
- [Gemini API-এর মূল্য](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — আনুষ্ঠানিক Standard, Batch, Flex ও Priority rate, ৩১ ডিসেম্বরের প্রারম্ভিক দামের শেষ দিন, ১ জানুয়ারির rate এবং প্রতি সেকেন্ডে ২৫ audio token ধরে হিসাব।
- [Text-to-speech তৈরি](https://ai.google.dev/gemini-api/docs/speech-generation) — বর্তমান speech guide-এ 3.8-এর ভাষাতালিকা, transcript-এর লেখা কীভাবে ব্যবহৃত হয় এবং migration-এর আচরণ আছে। তবে বর্তমান ভাষাতালিকা দিয়ে পুরোনো preview-তে ভাষার মোট সংখ্যা প্রতিষ্ঠা করা যায় না।
- [Gemini model](https://ai.google.dev/gemini-api/docs/models) — বর্তমান model index-এ 3.1 Flash TTS-কে legacy preview বলা হয়েছে এবং Gemini 3.8 Flash TTS বা Flash-Lite TTS-এ উন্নীত করার পরামর্শ দেওয়া হয়েছে।
- [Gemini 3.8 Flash TTS-এর গুণমান, গতি ও দামের বিশ্লেষণ](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — ঠিক Flash model-এর launch-day-র স্বাধীন তালিকা: পর্যালোচনার সময় 1260.15 Arena Elo এবং ৯৫টির মধ্যে ২৭তম স্থান। ranking বদলাতে পারে; এটি বহু ভাষা বা দীর্ঘ-form ব্যবহারের যাচাই নয়।