கூகுளின் செப்டம்பர் 23 அறிமுகம் Gemini API மற்றும் AI Studio-வில் இரண்டு நிலையான பேச்சு மாதிரிகளைக் கொண்டுவருகிறது: படைப்புப் பணிகளுக்கு Flash; அதிக அளவு பயன்பாட்டுக்கு Flash-Lite. Gemini Enterprise API அணுகல் பின்னர் கிடைக்கும்.

உருவாக்கப்படும் ஒவ்வொரு நிமிடத்திற்கும் இரண்டும் 3.1 Flash TTS Preview-ஐவிடக் குறைவாகச் செலவாகின்றன. அவற்றின் Standard கட்டணங்கள் 2027 ஜனவரி 1 அன்று இரட்டிப்பாகும். பயன்பாடுகள் வழிமுறைகளை அனுப்பும் முறையிலும் ஒலியைச் சேமிக்கும் முறையிலும் மாற்றம் தேவை.

முக்கிய மாற்றம்

  • என்ன மாறியது:புதிய நிலைகள், உரையாடல் உரையிலிருந்து நடிப்புக் குறிப்புகளைப் பிரித்து, மீண்டும் பயன்படுத்தக்கூடிய குரல்களை ஆதரிக்கின்றன.
  • ஏன் முக்கியம்:குரல் செயலாக்கக் கட்டமைப்பை மாற்றும்போது இரண்டு செலவுகளைக் கவனிக்க வேண்டும்: இப்போது செய்ய வேண்டிய பொறியியல் மாற்றங்களும், திட்டமிட்டபடி உயரும் உருவாக்கக் கட்டணங்களும்.
  • எதைக் கவனிக்க வேண்டும்:டப்பிங், ஒலிப்புத்தகங்கள், குரல் முகவர்கள் ஆகியவற்றுக்கு, பல மொழிகளில் உண்மையான தயாரிப்புத் திரைக்கதைகளைக் கொண்டு தெளிவையும் பேச்சாளர் சீர்மையையும் ஒப்பிடுங்கள். மலிவான உருவாக்க நிமிடம் பயன்படுத்தக்கூடிய ஒலியின் செலவையும் குறைக்கிறதா என்பதை அந்த முடிவுகளே தீர்மானிக்கும்.

ஒவ்வொரு நிமிடத்திற்குமான வெளியீட்டுச் செலவு

கூகுளின் விலை அட்டவணை ஒரு வினாடிக்கு 25 ஒலி டோக்கன்கள் எனக் குறிப்பிடுகிறது: நிமிடத்துக்கு 1,500. கணக்கு: வெளியீட்டு விகிதம் × 1,500 / 1,000,000; உரை உள்ளீட்டுக் கட்டணம் கூடுதலாகும். கீழுள்ள அனைத்துத் தொகைகளும் Standard விகிதத்திலான அமெரிக்க டாலர்கள்.

மாதிரி

பட்டியலிடப்பட்ட மொழிகள்

2026 டிசம்பர் 31 வரை, ஒவ்வொரு 1 மில்லியன் டோக்கனுக்கும் உள்ளீடு / வெளியீடு

இப்போதைய வெளியீடு/நிமிடம்

2027 ஜனவரி 1 முதல் வெளியீடு/நிமிடம்

Gemini 3.8 Flash TTS

130

$0.50 / $9

$0.0135

$0.027

Gemini 3.8 Flash-Lite TTS

101

$0.50 / $6

$0.009

$0.018

Gemini 3.1 Flash TTS Preview

—

$1 / $20

$0.03

மாற்றம் அறிவிக்கப்படவில்லை

3.8 மாதிரிகளுக்கு Batch மற்றும் Flex சேவைகள் Standard கட்டணத்தின் பாதி; Priority அதன் 1.8 மடங்கு. கூகுளின் மாதிரி குறியீடு மரபுவழி 3.1 முன்னோட்டப் பதிப்புக்குப் பதிலாகப் புதிய நிலைகளில் ஏதேனும் ஒன்றைப் பயன்படுத்தப் பரிந்துரைக்கிறது.

தூண்டுதல்களிலும் ஒலிக் கோப்புகளிலும் மாற்றம் தேவை

Gemini 3.8 Flash மாற்ற வழிகாட்டி உரைநகல் உரை அப்படியே பேசப்படும் என்கிறது. தொடர்ச்சியான வழிமுறைகளையும் பேச்சாளர் குறிச்சொற்களையும் speech_metadataஇல் இட வேண்டும்; இல்லையெனில் “மகிழ்ச்சியாகச் சொல்:” போன்ற பழைய அறிவுறுத்தலை உரக்க வாசிக்கக்கூடும். குறுகிய நிகழ்வுகள், எடுத்துக்காட்டாக <laugh> அதே வரியிலேயே இருக்க வேண்டும்.

பல பேச்சாளர்களைக் கொண்ட ஒவ்வொரு உரையாடல் முறையும், உள்ளமைவுடன் பொருந்தும் பேச்சாளர் பெயரைக் குறிப்பிட வேண்டும். ஒற்றைப் பேச்சாளர் பதில்களில் இப்போது WAV தலைப்புகள் உள்ளன; முன்பு இயல்புநிலையாக இருந்த raw PCM-ஐ இது மாற்றுகிறது. WAV தலைப்பைச் சேர்க்கும் குறியீட்டை அகற்றவும் அல்லது raw வடிவத்தைத் தெளிவாகக் கோரவும்.

Flash-Lite ஆவணங்கள் இரு நிலைகளுக்கும் ஒரே திட்டவடிவமும், 8,192 உள்ளீட்டு டோக்கன்கள் மற்றும் 16,384 வெளியீட்டு டோக்கன்கள் என்ற வரம்புகளும் இருப்பதை உறுதிப்படுத்துகின்றன. எனவே பயன்பாடுகளை ஒரே ஒருங்கிணைப்பின் வழியாக ஒப்பிடலாம்.

குரல் நகலாக்கமும் மதிப்பீடும்

தயாராக உள்ள 2,000-க்கும் மேற்பட்ட குரல்கள், குரல் வடிவமைப்பு, பயன்படுத்த உரிமையுள்ள குரலின் 30 வினாடி மாதிரியிலிருந்து நகலாக்கம் ஆகியவற்றை கூகுள் விவரிக்கிறது. நகலாக்கத்துக்கு, அதற்குப் பொருந்தும் வாய்மொழி ஒப்புதல் பதிவு தேவை. உருவாக்கப்படும் ஒலித் துண்டுகளில் SynthID இருக்கும் என்றும், நகலாக்கப்பட்ட குரல்களுக்கு C2PA நற்சான்றுகள் இருக்கும் என்றும் கூகுள் கூறுகிறது.

AI Studio-வில் குரல் நகலாக்கம் இல்லினாய்ஸ், டெக்சாஸ், ஐரோப்பியப் பொருளாதாரப் பகுதி, ஐக்கிய இராச்சியம், சுவிட்சர்லாந்து, இந்தியா ஆகிய இடங்களில் கிடையாது.

Hume Voice Design Benchmark-இல் Flash ஒட்டுமொத்தமாக 71.4 மதிப்பெண்ணும், உச்சரிப்பு மாதிரியாக்கத்தில் 60.8 மதிப்பெண்ணும் பெற்றதாக கூகுள் தெரிவிக்கிறது. Hume Overall Quality Index-இல் Flash மற்றும் Lite முறையே முதல், இரண்டாம் இடங்களில் இருப்பதாகவும் கூறுகிறது.

Artificial Analysis செப்டம்பர் 23 அன்று Flash-க்கு 1,260.15 Arena Elo மதிப்பையும், 95 மாதிரிகளில் 27ஆம் இடத்தையும் தனியாகப் பட்டியலிட்டது. இது கூட்டத்தின் விருப்பத்தை அளவிடுகிறது; மொழி வாரியான செயல்திறனையோ நீண்ட பதிவுகளின் செயல்திறனையோ மதிப்பாய்வு செய்த பட்டியல் நிறுவவில்லை. Lite-க்கான ஒப்பிடத்தக்க சுயாதீன முடிவு இங்கு பயன்படுத்தப்படவில்லை.

வேறு மேகப் பேச்சு மாதிரித் தொகுப்புடன் ஒப்பிட, எங்கள் Qwen Audio 3.1 API மற்றும் விலை ஆய்வைப் பாருங்கள்.