AI-translated from English; not yet reviewed by a fluent editor.
# Gemini 3.8 TTS এখন সস্তা; ১ জানুয়ারি দাম দ্বিগুণ
> Google-এর স্থিতিশীল Gemini 3.8 TTS model-এ তৈরি করা অডিওর খরচ কম, তবে ১ জানুয়ারি দাম দ্বিগুণ হবে। migration-এ prompt ও WAV সামলানোর পদ্ধতিও বদলাবে।
By BIG CHANGE Editorial
Published: 2026-09-23T18:27:39.501Z
Updated: 2026-09-23T18:27:39.501Z
Canonical: https://bigchange.ai/blog/gemini-3-8-tts-pricing-migration

AI-generated conceptual illustration by BIG CHANGE.
[Google-এর ২৩ সেপ্টেম্বরের উদ্বোধনী ঘোষণা](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) Gemini API ও AI Studio-তে দুটি স্থিতিশীল speech model এনেছে: সৃজনশীল কাজে Flash এবং বেশি পরিমাণে তৈরির কাজে Flash-Lite। Gemini Enterprise-এ API-র মাধ্যমে প্রবেশাধিকার পরে আসবে।
প্রতি মিনিটে তৈরি অডিওর খরচ—দুটিরই 3.1 Flash TTS Preview-এর চেয়ে কম। তবে Standard rate ২০২৭ সালের ১ জানুয়ারি দ্বিগুণ হবে। migration-এ application-এর নির্দেশনা পাঠানো ও অডিও সংরক্ষণের পদ্ধতিও বদলাতে হবে।
## বড় পরিবর্তন
- **কী বদলেছে:** নতুন tier-গুলোতে transcript-এর লেখা ও পরিবেশনার নির্দেশনা আলাদা করে দেওয়া যায়, আর একই voice পুনরায় ব্যবহার করা যায়।
- **কেন গুরুত্বপূর্ণ:** voice pipeline-এ migration-এর দুটি খরচ বিবেচনা করতে হবে: এখনই প্রকৌশলগত পরিবর্তনের খরচ এবং নির্ধারিত হারে generation-এর ব্যয় বৃদ্ধি।
- **কী লক্ষ করবেন:** dubbing, audiobook ও voice agent-এর ক্ষেত্রে একাধিক ভাষার প্রকৃত production script দিয়ে উচ্চারণের বোধগম্যতা ও speaker-এর ধারাবাহিকতা তুলনা করুন। এতে বোঝা যাবে, প্রতি মিনিটে অডিও তৈরি সস্তা হলেও ব্যবহারযোগ্য অডিওর মোট খরচ কমে কি না।
## প্রতি মিনিটে আউটপুটের খরচ
[Google-এর মূল্যতালিকায়](https://ai.google.dev/gemini-api/docs/pricing?hl=en) প্রতি সেকেন্ডে ২৫টি audio token, অর্থাৎ প্রতি মিনিটে ১,৫০০টি ধরা হয়েছে। হিসাব: প্রতি মিনিটের output খরচ = (প্রতি ১,০০০,০০০ token-এ output rate × ১,৫০০) ÷ ১,০০০,০০০; text input-এর চার্জ অতিরিক্ত। নিচের সব অঙ্ক Standard rate-এ মার্কিন ডলারে।
| মডেল | তালিকাভুক্ত ভাষা | ৩১ ডিসেম্বর ২০২৬ পর্যন্ত প্রতি ১ মিলিয়ন token-এ input / output | এখন প্রতি মিনিটে আউটপুট | ১ জানুয়ারি ২০২৭ থেকে প্রতি মিনিটে আউটপুট |
| --- | --- | --- | --- | --- |
| Gemini 3.8 Flash TTS | ১৩০ | $0.50 / $9 | $0.0135 | $0.027 |
| Gemini 3.8 Flash-Lite TTS | ১০১ | $0.50 / $6 | $0.009 | $0.018 |
| Gemini 3.1 Flash TTS Preview | — | $1 / $20 | $0.03 | পরিবর্তনের ঘোষণা নেই |
3.8 model-এ Batch ও Flex-এর দাম Standard-এর অর্ধেক; Priority-র দাম Standard-এর ১.৮ গুণ। Google-এর [model index-এ](https://ai.google.dev/gemini-api/docs/models) পুরোনো 3.1 preview-এর বদলে নতুন দুটির যেকোনো tier ব্যবহারের পরামর্শ দেওয়া হয়েছে।
## prompt ও অডিও ফাইলে পরিবর্তন দরকার
এই [Flash migration guide](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts)-এ বলা হয়েছে, transcript-এর লেখা হুবহু উচ্চারণ করা হয়। দীর্ঘস্থায়ী নির্দেশনা ও speaker label `speech_metadata` অংশে রাখুন; পুরোনো “আনন্দের সঙ্গে বলুন:” ধরনের নির্দেশনা নইলে উচ্চারণ করে শোনানো হতে পারে। সংক্ষিপ্ত event যেমন `<laugh>` tag-টি transcript-এ inline-ই থাকে।
একাধিক speaker-যুক্ত প্রতিটি turn-এ configuration-এ থাকা কোনো speaker-এর নাম দিতে হবে। এখন unary response-এ WAV header থাকে; আগে default ছিল raw PCM। WAV header যোগ করে এমন code সরিয়ে ফেলুন, অথবা স্পষ্টভাবে raw format চেয়ে নিন।
[Flash-Lite-এর নথিতে](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) দুই tier-এর জন্য একই schema এবং input-এ ৮,১৯২ token ও output-এ ১৬,৩৮৪ token-এর সীমা নিশ্চিত করা হয়েছে। ফলে application-গুলো একই integration দিয়ে দুই model তুলনা করতে পারে।
## voice replication ও মূল্যায়ন
Google-এর বর্ণনা অনুযায়ী, ব্যবহারকারীর ব্যবহারের অধিকার আছে এমন voice-এর ৩০-সেকেন্ডের নমুনা থেকে voice design ও replication করা যায়, আর আগে থেকে তৈরি voice আছে ২,০০০-এর বেশি। replication-এর জন্য একই voice-এ বলা সম্মতির recording দরকার। Google বলেছে, তৈরি clip-এ SynthID থাকে এবং replicate করা voice-এ C2PA credential থাকে।
AI Studio-তে voice replication Illinois, Texas, European Economic Area, UK, Switzerland ও India-তে পাওয়া যায় না।
Google-এর দেওয়া Hume’s Voice Design Benchmark-এ Flash-এর সামগ্রিক score 71.4 এবং accent modeling-এ 60.8। Hume’s Overall Quality Index-এ Google Flash ও Lite-কে যথাক্রমে প্রথম ও দ্বিতীয় স্থানে রেখেছে।
[Artificial Analysis](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) ২৩ সেপ্টেম্বরের তালিকায় Flash-কে আলাদাভাবে 1260.15 Arena Elo দিয়েছে—৯৫টি model-এর মধ্যে ২৭তম। এই মাপটি জনতার পছন্দের প্রতিফলন; পর্যালোচিত তালিকা থেকে ভাষাভিত্তিক বা দীর্ঘ recording-এ কর্মদক্ষতা প্রতিষ্ঠিত হয় না। Lite-এর সমতুল্য কোনো স্বাধীন ফল এখানে ব্যবহার করা হয়নি।
অন্য hosted speech lineup-এর সঙ্গে তুলনার জন্য পড়ুন আমাদের [Qwen Audio 3.1 API ও মূল্য বিশ্লেষণ](https://bigchange.ai/blog/qwen-audio-3-1-models-api-pricing)।
## Sources
- [Gemini 3.8 text-to-speech-এর ঘোষণা](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) — উদ্বোধনের আনুষ্ঠানিক পরিধি, model-এর ভূমিকা, ভাষার সংখ্যা, voice সুবিধা, সম্মতি নিয়ন্ত্রণ, আঞ্চলিক প্রবেশাধিকার ও Google-এর জানানো benchmark ফল। গুণমানের দাবিগুলো Google-এর বক্তব্য হিসেবে উল্লেখ করা হয়েছে।
- [Gemini 3.8 Flash TTS model-এর নথি](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts) — বর্তমান request schema, input ও output সীমা, transcript-এ লেখার ব্যবহার, inline event tag, একাধিক speaker যাচাই এবং raw PCM থেকে default WAV output-এ পরিবর্তন।
- [Gemini 3.8 Flash-Lite TTS model-এর নথি](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) — উচ্চ পরিমাণে কাজের tier-এর বর্তমান বিবরণ, তালিকাভুক্ত ১০১টি ভাষা এবং উভয় model-এ অভিন্ন 3.8 interface।
- [Gemini API-এর মূল্য](https://ai.google.dev/gemini-api/docs/pricing?hl=en) — আনুষ্ঠানিক Standard, Batch, Flex ও Priority rate, ৩১ ডিসেম্বরের প্রারম্ভিক দামের শেষ দিন, ১ জানুয়ারির rate এবং প্রতি সেকেন্ডে ২৫ audio token ধরে হিসাব।
- [Text-to-speech তৈরি](https://ai.google.dev/gemini-api/docs/speech-generation) — বর্তমান speech guide-এ 3.8-এর ভাষাতালিকা, transcript-এর লেখা কীভাবে ব্যবহৃত হয় এবং migration-এর আচরণ আছে। তবে বর্তমান ভাষাতালিকা দিয়ে পুরোনো preview-তে ভাষার মোট সংখ্যা প্রতিষ্ঠা করা যায় না।
- [Gemini model](https://ai.google.dev/gemini-api/docs/models) — বর্তমান model index-এ 3.1 Flash TTS-কে legacy preview বলা হয়েছে এবং Gemini 3.8 Flash TTS বা Flash-Lite TTS-এ উন্নীত করার পরামর্শ দেওয়া হয়েছে।
- [Gemini 3.8 Flash TTS-এর গুণমান, গতি ও দামের বিশ্লেষণ](https://artificialanalysis.ai/text-to-speech/models/gemini-3-8-flash-tts) — ঠিক Flash model-এর launch-day-র স্বাধীন তালিকা: পর্যালোচনার সময় 1260.15 Arena Elo এবং ৯৫টির মধ্যে ২৭তম স্থান। ranking বদলাতে পারে; এটি বহু ভাষা বা দীর্ঘ-form ব্যবহারের যাচাই নয়।
BIG CHANGE নিউজলেটার
বড় ছবিটা। আপনার গতিতে।
এআই ও রোবোটিক্স নিয়ে সাম্প্রতিক খবর, নজর রাখার মতো পরিবর্তন এবং কাজে লাগানোর ব্যবহারিক ধারণা। দৈনিক ব্রিফিং, সাপ্তাহিক সংকলন বা মাসিক দৃষ্টিভঙ্গি বেছে নিন।
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
আপনার গোপনীয়তা, আপনার পছন্দ।
প্রয়োজনীয় স্টোরেজ সাইটের নিরাপত্তায় সাহায্য করে এবং আপনার পছন্দ মনে রাখে। আপনি অনুমতি না দেওয়া পর্যন্ত ঐচ্ছিক Google Analytics বন্ধ থাকবে। প্রয়োজনীয় স্টোরেজ ব্যবহার করেই প্রতিটি গল্প পড়তে পারেন। গোপনীয়তার বিবরণ