Alibaba-வின் Qwen குழு, உரைமாற்றம், பேச்சு உருவாக்கம், நேரடிக் குரல் உரையாடல் ஆகியவற்றை உள்ளடக்கிய ஐந்து Qwen Audio 3.1 மாடல்களை அறிமுகப்படுத்தியுள்ளது. ASR, TTS-Next, Realtime Plus ஆகியவற்றுக்கு ஆவணப்படுத்தப்பட்ட ஹோஸ்ட் செய்யப்பட்ட endpoint-கள் உள்ளன. TTS Flash-க்கு வெளியிடப்பட்ட மாடல் ID-யும் விலையும் உள்ளன; ஆனால் ஒருங்கிணைப்பு ஆவணங்கள் குறைவாக முழுமையடைந்துள்ளன. BIG CHANGE ஆய்வு செய்த பொது டெவலப்பர் ஆவணங்களில் ASR-Next-க்கு மாடல் ID, பிராந்தியம் அல்லது விலை இல்லை.

The Decoder செய்தி வெளியிட்டது Qwen கூறியுள்ள உரையிலிருந்து பேச்சாக மாற்றுவதில் சுமார் 70%, நேரடி ஆடியோவில் 85%, பேச்சறிதலில் அதிகபட்சம் 95% வரையிலான விலைக் குறைப்புகளைப் பற்றி. அந்த எண்களைச் சரிபார்க்கும்போது கட்டண அலகுகளையும் கணக்கில் கொள்ள வேண்டும்.

முக்கிய மாற்றம்

  • என்ன மாறியது: Qwen இப்போது உரைமாற்றம், பேச்சு உருவாக்கம், ஒலிச் சூழல் உருவாக்கம், நேரடி உரையாடல் வரை ஒரே ஹோஸ்ட் செய்யப்பட்ட குடும்பத்தில் குரல் தயாரிப்பின் பல அம்சங்களை வழங்குகிறது. அதன் ஐந்து கூறுகளுக்கும் டெவலப்பர் அணுகல் ஒரே அளவு முழுமையாக இல்லை.
  • இது ஏன் முக்கியம்: உரைமாற்றம் அல்லது குரல் சேவைகளுக்கான செலவைத் திட்டமிடும் டெவலப்பர்களுக்கு, ஒவ்வொரு endpoint-ஐயும் விலை நிர்ணயிக்க ஆடியோவின் நிமிட அளவு மட்டும் போதாது. Token அடிப்படையிலான ASR கட்டணம், உள்வரும் ஆடியோவையும் அதிலிருந்து கிடைக்கும் உரையையும் சேர்த்துக் கணக்கிடுகிறது; நேரடி உரையாடலில் தனித்தனியாக விலை நிர்ணயிக்கப்படும் நான்கு stream-கள் உள்ளன.
  • எதைக் கவனிக்க வேண்டும்: ASR-Next அணுகலுடன், சுயாதீன மொழி மற்றும் தாமதச் சோதனைகள் பயனுள்ள சேமிப்பை உறுதிப்படுத்துகிறதா என்பதையும் கவனியுங்கள். அவை உறுதிப்படுத்தினால், குரல் முகவர், உரைமாற்றம், டப்பிங் சேவை வழங்குநர்கள் அந்தச் சேமிப்பை வாடிக்கையாளர் விலைகளிலும் வழங்குகிறார்களா, போட்டி பேச்சு API-களும் இதைப் பின்பற்றுகிறதா என்பதே அடுத்த பெரிய கேள்வி.

ஐந்து மாடல்களின் ஒப்பீடு

அறிவிக்கப்பட்ட மாடல்

நோக்கமிடப்பட்ட பயன்பாடு

செப்டம்பர் 23 அன்று ஆவணப்படுத்தப்பட்ட அணுகல்

விலையும் நடைமுறை வரம்பும்

Qwen Audio 3.1 ASR

தொடர்நிலை, கோப்பு, குறு வடிவ உரைமாற்றம்; கோப்பு மற்றும் குறு வடிவ endpoint-களில் விருப்பப் பேச்சாளர் பிரித்தறிதல்

சிங்கப்பூர் மற்றும் பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட WebSocket அல்லது HTTP API-கள். சர்வதேச வழிகாட்டி 30 மொழிகளையும் சீன மொழியின் 10 வட்டாரப் பேச்சு வகைகளையும் பட்டியலிடுகிறது.

சிங்கப்பூரில் கோப்பு/குறு வடிவ உரைமாற்றத்துக்கு, ஒரு மில்லியன் உள்வரும் ஆடியோ token-களுக்கு $0.15 + ஒரு மில்லியன் வெளியேறும் உரை token-களுக்கு $0.47 என்ற விலையிலிருந்து, $0.93 + $0.70 வரை, தொடர்நிலை/செய்தி அனுப்பலுக்கு. கோப்பு உரைமாற்றம் 12 மணிநேரம்/2 GB வரை அனுமதிக்கிறது; குறு வடிவம் 5 நிமிடங்கள்/2 GB வரை.

Qwen Audio 3.1 ASR-Next

பேச்சாளரைக் கண்டறிந்து நேரமுத்திரையிடுதல்; உணர்ச்சி, சுற்றுப்புற நிகழ்வுகள், இயந்திர ஒலிகள் ஆகியவற்றை அடையாளம் காணுதல்

Qwen இதை அறிவித்துள்ளது; ஆனால் தற்போதைய Model Studio மற்றும் QwenCloud ஆவணங்களில் பொது API மாடல் ID, பிராந்தியம், கட்டணம் அல்லது வரம்பு எதுவும் கிடைக்கவில்லை.

பொதுவில் ஆவணப்படுத்தப்படவில்லை

Qwen Audio 3.1 TTS

பல மொழிப் பேச்சு, மொழிகளுக்கிடையிலான குரல் பரிமாற்றம், பேச்சு வெளிப்பாட்டை prompt மூலம் கட்டுப்படுத்துதல்

qwen-audio-3.1-tts-flash என்பது Alibaba-வின் விலை அறிவிப்பில் இடம்பெறுகிறது. ஆய்வு செய்த குரல் நகலாக்க API இன்னும் 3.0 TTS Flash-ஐக் குறிப்பிடுகிறது.

சிங்கப்பூர்: ஒரு மில்லியன் உள்வரும் உரை token-களுக்கு $0.23 + ஒரு மில்லியன் வெளியேறும் ஆடியோ token-களுக்கு $1.87. ஆய்வு செய்த 3.1 ஆவணங்களில் தற்போதைய பொது வரம்புகள் குறிப்பிடப்படவில்லை.

Qwen Audio 3.1 TTS-Next

பேச்சு, ஒலி விளைவுகள், பின்னணி ஆடியோ ஆகியவற்றை ஒருங்கிணைத்து உருவாக்குதல்

பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட, தொடர்நிலை ஆதரவில்லாத HTTPS API; சீனம் மற்றும் ஆங்கிலத்துக்கான ஆவணம் உள்ளது

உள்வரும் ஒரு மில்லியன் token-களுக்கு $0.848 + வெளியேறும் ஒரு மில்லியன் token-களுக்கு $1.696. உள்ளீடு 3,000 எழுத்துகள் வரை; podcast வெளியீடு நான்கு நிமிடங்கள் வரை, மற்றவை இரண்டு நிமிடங்கள் வரை.

Qwen Audio 3.1 Realtime Plus

இடையூறு செய்யவும் கருவிகளை அழைக்கவும் கூடிய முழு இருதிசைக் குரல் உரையாடல்

சிங்கப்பூர் மற்றும் பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட WebSocket API. வழிகாட்டி 11 மொழிகளைப் பட்டியலிடுகிறது.

சிங்கப்பூர்: உள்வரும் உரையின் ஒரு மில்லியன் token-களுக்கு $0.80, உள்வரும் ஆடியோவுக்கு $6.40, வெளியேறும் உரைக்கு $6.40, வெளியேறும் ஆடியோவுக்கு $24. இது 50 ஆடியோ உரையாடல் திருப்பங்கள் அல்லது 300 விநாடி ஆடியோ வரலாறு வரை வைத்திருக்கும்.

இவை ஹோஸ்ட் செய்யப்பட்ட API தயாரிப்புகள். பதிவிறக்கக்கூடிய 3.1 மாடல் எடைகளையோ அவற்றுக்கான உரிமத்தையோ BIG CHANGE கண்டறியவில்லை. QwenAudio-வின் GitHub களஞ்சியத்தில் உள்ள MIT உரிமம் திட்ட இணையதளத்துக்குப் பொருந்தும்; அதை மாடல்களுக்கான உரிமமாகப் புரிந்துகொள்ளக் கூடாது.

மொழிகளின் எண்ணிக்கையும் எந்த ஆவணத்தைப் பார்க்கிறீர்கள் என்பதைப் பொறுத்தது. Qwen-இன் சரிபார்க்கப்பட்ட வெளியீட்டுப் பதிவு ASR 30 மொழிகளையும் 16 சீன வட்டாரப் பேச்சு வகைகளையும் ஆதரிக்கிறது என்கிறது; சர்வதேச API வழிகாட்டி 30 மொழிகளையும் 10 வட்டாரப் பேச்சு வகைகளையும் பட்டியலிடுகிறது. டெவலப்பர்கள் தாங்கள் உண்மையில் அழைக்கக்கூடிய endpoint-க்கான பட்டியலையே பயன்படுத்த வேண்டும்.

95% குறைப்பு என்ற கூற்று பொது விலை அட்டவணையுடன் பொருந்தவில்லை

Alibaba-வின் விலை மாற்ற அறிவிப்பு செப்டம்பர் 22 அன்று நடைமுறைக்கு வந்தது. அதில் துல்லியமாக ஒப்பிடப்படுவது qwen-audio-3.0-realtime-flash, புதிய 3.1 Realtime Plus அல்ல. சிங்கப்பூர் விலைக் குறைப்புகள் (பழைய விலை − புதிய விலை) / பழைய விலை என்ற கணக்கில் பெறப்பட்டவை:

Realtime Flash தொடர்நிலை

முன்பு (USD)

பிறகு (USD)

குறைப்பு

ஒரு மில்லியன் token-க்கு உள்வரும் உரை

$0.45

$0.23

48.89%

ஒரு மில்லியன் token-க்கு உள்வரும் ஆடியோ

$4.50

$0.93

79.33%

ஒரு மில்லியன் token-க்கு வெளியேறும் உரை

$4.50

$0.70

84.44%

ஒரு மில்லியன் token-க்கு வெளியேறும் வெளியீடு (உரை + ஆடியோ)

$15.00

$1.87

87.53%

அதே அறிவிப்பு, 3.1 TTS Flash விலையை 10,000 எழுத்துகளுக்கு $0.15 என்ற முறையிலிருந்து தனித்த உள்வரும் மற்றும் வெளியேறும் token விலைகளாக மாற்றுகிறது. தற்போதைய விலைப் பக்கம் 3.1 ASR-க்கும் உள்வரும் மற்றும் வெளியேறும் token அடிப்படையிலான விலையைப் பட்டியலிடுகிறது; 3.0 ASR-க்கு ஒவ்வொரு ஆடியோ விநாடிக்கும் கட்டணம், வெளியீட்டுக்கு இலவசம். இந்த விலை ஜோடிகளில் எதற்கும் சதவீதம் கணக்கிடுவது உரை, ஆடியோ நீளம், token பிரிப்பு ஆகியவற்றைப் பொறுத்தது. ஆகவே, இங்கு ஆய்வு செய்த பொது அட்டவணைகள் துல்லியமான 95% ASR விலைக் குறைப்பை உறுதிப்படுத்தவில்லை.

சுயாதீனச் சான்றுகள் இன்னும் Qwen 3.0-ஐப் பற்றியவையே

வெளியீட்டு நாளில் ஆய்வு செய்த ஆதாரங்களில் ஐந்து 3.1 மாடல்களுக்கான சுயாதீனச் சோதனை எதுவும் இல்லை. Qwen-இன் சொந்த ASR திட்டப் பக்கம் தரநிலைச் சோதனை முடிவுகளை வெளியிடுகிறது; ஆனால் அவை சுயாதீனமாக மீண்டும் சோதிக்கப்படவில்லை என்று கூறுகிறது.

Artificial Analysis தரவரிசையில் Qwen Audio 3.0 TTS Plus வழங்குநர் குரல் அரங்கில் (அனைத்து உச்சரிப்புகள் மற்றும் பிரிவுகள்) 1,259 Elo மதிப்புடன் இரண்டாவது இடத்தில் உள்ளது; 95% நம்பக இடைவெளி ±17, குருட்டு ஒப்பீட்டு மாதிரிகள் 1,447. தனியான பேச்சு முகவர் அரங்கில் Qwen Audio 3.0 Realtime Plus 699 preference Elo பெற்றது; முதல் ஆடியோவுக்கான நேரம் 1.54 விநாடிகள். அங்கு பங்கேற்பாளர்கள் ஒதுக்கப்பட்ட சூழல்களில் நேரடி உரையாடல்களின் போது மறைக்கப்பட்ட மாடல்களை ஒப்பிடுகிறார்கள்.