Google-এর ২৩ সেপ্টেম্বরের উদ্বোধনী ঘোষণা Gemini API ও AI Studio-তে দুটি স্থিতিশীল speech model এনেছে: সৃজনশীল কাজে Flash এবং বেশি পরিমাণে তৈরির কাজে Flash-Lite। Gemini Enterprise-এ API-র মাধ্যমে প্রবেশাধিকার পরে আসবে।

প্রতি মিনিটে তৈরি অডিওর খরচ—দুটিরই 3.1 Flash TTS Preview-এর চেয়ে কম। তবে Standard rate ২০২৭ সালের ১ জানুয়ারি দ্বিগুণ হবে। migration-এ application-এর নির্দেশনা পাঠানো ও অডিও সংরক্ষণের পদ্ধতিও বদলাতে হবে।

বড় পরিবর্তন

  • কী বদলেছে: নতুন tier-গুলোতে transcript-এর লেখা ও পরিবেশনার নির্দেশনা আলাদা করে দেওয়া যায়, আর একই voice পুনরায় ব্যবহার করা যায়।
  • কেন গুরুত্বপূর্ণ: voice pipeline-এ migration-এর দুটি খরচ বিবেচনা করতে হবে: এখনই প্রকৌশলগত পরিবর্তনের খরচ এবং নির্ধারিত হারে generation-এর ব্যয় বৃদ্ধি।
  • কী লক্ষ করবেন: dubbing, audiobook ও voice agent-এর ক্ষেত্রে একাধিক ভাষার প্রকৃত production script দিয়ে উচ্চারণের বোধগম্যতা ও speaker-এর ধারাবাহিকতা তুলনা করুন। এতে বোঝা যাবে, প্রতি মিনিটে অডিও তৈরি সস্তা হলেও ব্যবহারযোগ্য অডিওর মোট খরচ কমে কি না।

প্রতি মিনিটে আউটপুটের খরচ

Google-এর মূল্যতালিকায় প্রতি সেকেন্ডে ২৫টি audio token, অর্থাৎ প্রতি মিনিটে ১,৫০০টি ধরা হয়েছে। হিসাব: প্রতি মিনিটের output খরচ = (প্রতি ১,০০০,০০০ token-এ output rate × ১,৫০০) ÷ ১,০০০,০০০; text input-এর চার্জ অতিরিক্ত। নিচের সব অঙ্ক Standard rate-এ মার্কিন ডলারে।

মডেল

তালিকাভুক্ত ভাষা

৩১ ডিসেম্বর ২০২৬ পর্যন্ত প্রতি ১ মিলিয়ন token-এ input / output

এখন প্রতি মিনিটে আউটপুট

১ জানুয়ারি ২০২৭ থেকে প্রতি মিনিটে আউটপুট

Gemini 3.8 Flash TTS

১৩০

$0.50 / $9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

১০১

$0.50 / $6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0.03

পরিবর্তনের ঘোষণা নেই

3.8 model-এ Batch ও Flex-এর দাম Standard-এর অর্ধেক; Priority-র দাম Standard-এর ১.৮ গুণ। Google-এর model index-এ পুরোনো 3.1 preview-এর বদলে নতুন দুটির যেকোনো tier ব্যবহারের পরামর্শ দেওয়া হয়েছে।

prompt ও অডিও ফাইলে পরিবর্তন দরকার

এই Flash migration guide-এ বলা হয়েছে, transcript-এর লেখা হুবহু উচ্চারণ করা হয়। দীর্ঘস্থায়ী নির্দেশনা ও speaker label speech_metadata অংশে রাখুন; পুরোনো “আনন্দের সঙ্গে বলুন:” ধরনের নির্দেশনা নইলে উচ্চারণ করে শোনানো হতে পারে। সংক্ষিপ্ত event যেমন <laugh> tag-টি transcript-এ inline-ই থাকে।

একাধিক speaker-যুক্ত প্রতিটি turn-এ configuration-এ থাকা কোনো speaker-এর নাম দিতে হবে। এখন unary response-এ WAV header থাকে; আগে default ছিল raw PCM। WAV header যোগ করে এমন code সরিয়ে ফেলুন, অথবা স্পষ্টভাবে raw format চেয়ে নিন।

Flash-Lite-এর নথিতে দুই tier-এর জন্য একই schema এবং input-এ ৮,১৯২ token ও output-এ ১৬,৩৮৪ token-এর সীমা নিশ্চিত করা হয়েছে। ফলে application-গুলো একই integration দিয়ে দুই model তুলনা করতে পারে।

voice replication ও মূল্যায়ন

Google-এর বর্ণনা অনুযায়ী, ব্যবহারকারীর ব্যবহারের অধিকার আছে এমন voice-এর ৩০-সেকেন্ডের নমুনা থেকে voice design ও replication করা যায়, আর আগে থেকে তৈরি voice আছে ২,০০০-এর বেশি। replication-এর জন্য একই voice-এ বলা সম্মতির recording দরকার। Google বলেছে, তৈরি clip-এ SynthID থাকে এবং replicate করা voice-এ C2PA credential থাকে।

AI Studio-তে voice replication Illinois, Texas, European Economic Area, UK, Switzerland ও India-তে পাওয়া যায় না।

Google-এর দেওয়া Hume’s Voice Design Benchmark-এ Flash-এর সামগ্রিক score 71.4 এবং accent modeling-এ 60.8। Hume’s Overall Quality Index-এ Google Flash ও Lite-কে যথাক্রমে প্রথম ও দ্বিতীয় স্থানে রেখেছে।

Artificial Analysis ২৩ সেপ্টেম্বরের তালিকায় Flash-কে আলাদাভাবে 1260.15 Arena Elo দিয়েছে—৯৫টি model-এর মধ্যে ২৭তম। এই মাপটি জনতার পছন্দের প্রতিফলন; পর্যালোচিত তালিকা থেকে ভাষাভিত্তিক বা দীর্ঘ recording-এ কর্মদক্ষতা প্রতিষ্ঠিত হয় না। Lite-এর সমতুল্য কোনো স্বাধীন ফল এখানে ব্যবহার করা হয়নি।

অন্য hosted speech lineup-এর সঙ্গে তুলনার জন্য পড়ুন আমাদের Qwen Audio 3.1 API ও মূল্য বিশ্লেষণ।