Alibaba-வின் Qwen குழு, உரைமாற்றம், பேச்சு உருவாக்கம், நேரடிக் குரல் உரையாடல் ஆகியவற்றை உள்ளடக்கிய ஐந்து Qwen Audio 3.1 மாடல்களை அறிமுகப்படுத்தியுள்ளது. ASR, TTS-Next, Realtime Plus ஆகியவற்றுக்கு ஆவணப்படுத்தப்பட்ட ஹோஸ்ட் செய்யப்பட்ட endpoint-கள் உள்ளன. TTS Flash-க்கு வெளியிடப்பட்ட மாடல் ID-யும் விலையும் உள்ளன; ஆனால் ஒருங்கிணைப்பு ஆவணங்கள் குறைவாக முழுமையடைந்துள்ளன. BIG CHANGE ஆய்வு செய்த பொது டெவலப்பர் ஆவணங்களில் ASR-Next-க்கு மாடல் ID, பிராந்தியம் அல்லது விலை இல்லை.
The Decoder செய்தி வெளியிட்டது Qwen கூறியுள்ள உரையிலிருந்து பேச்சாக மாற்றுவதில் சுமார் 70%, நேரடி ஆடியோவில் 85%, பேச்சறிதலில் அதிகபட்சம் 95% வரையிலான விலைக் குறைப்புகளைப் பற்றி. அந்த எண்களைச் சரிபார்க்கும்போது கட்டண அலகுகளையும் கணக்கில் கொள்ள வேண்டும்.
முக்கிய மாற்றம்
- என்ன மாறியது: Qwen இப்போது உரைமாற்றம், பேச்சு உருவாக்கம், ஒலிச் சூழல் உருவாக்கம், நேரடி உரையாடல் வரை ஒரே ஹோஸ்ட் செய்யப்பட்ட குடும்பத்தில் குரல் தயாரிப்பின் பல அம்சங்களை வழங்குகிறது. அதன் ஐந்து கூறுகளுக்கும் டெவலப்பர் அணுகல் ஒரே அளவு முழுமையாக இல்லை.
- இது ஏன் முக்கியம்: உரைமாற்றம் அல்லது குரல் சேவைகளுக்கான செலவைத் திட்டமிடும் டெவலப்பர்களுக்கு, ஒவ்வொரு endpoint-ஐயும் விலை நிர்ணயிக்க ஆடியோவின் நிமிட அளவு மட்டும் போதாது. Token அடிப்படையிலான ASR கட்டணம், உள்வரும் ஆடியோவையும் அதிலிருந்து கிடைக்கும் உரையையும் சேர்த்துக் கணக்கிடுகிறது; நேரடி உரையாடலில் தனித்தனியாக விலை நிர்ணயிக்கப்படும் நான்கு stream-கள் உள்ளன.
- எதைக் கவனிக்க வேண்டும்: ASR-Next அணுகலுடன், சுயாதீன மொழி மற்றும் தாமதச் சோதனைகள் பயனுள்ள சேமிப்பை உறுதிப்படுத்துகிறதா என்பதையும் கவனியுங்கள். அவை உறுதிப்படுத்தினால், குரல் முகவர், உரைமாற்றம், டப்பிங் சேவை வழங்குநர்கள் அந்தச் சேமிப்பை வாடிக்கையாளர் விலைகளிலும் வழங்குகிறார்களா, போட்டி பேச்சு API-களும் இதைப் பின்பற்றுகிறதா என்பதே அடுத்த பெரிய கேள்வி.
ஐந்து மாடல்களின் ஒப்பீடு
அறிவிக்கப்பட்ட மாடல் | நோக்கமிடப்பட்ட பயன்பாடு | செப்டம்பர் 23 அன்று ஆவணப்படுத்தப்பட்ட அணுகல் | விலையும் நடைமுறை வரம்பும் |
|---|---|---|---|
Qwen Audio 3.1 ASR | தொடர்நிலை, கோப்பு, குறு வடிவ உரைமாற்றம்; கோப்பு மற்றும் குறு வடிவ endpoint-களில் விருப்பப் பேச்சாளர் பிரித்தறிதல் | சிங்கப்பூர் மற்றும் பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட WebSocket அல்லது HTTP API-கள். சர்வதேச வழிகாட்டி 30 மொழிகளையும் சீன மொழியின் 10 வட்டாரப் பேச்சு வகைகளையும் பட்டியலிடுகிறது. | சிங்கப்பூரில் கோப்பு/குறு வடிவ உரைமாற்றத்துக்கு, ஒரு மில்லியன் உள்வரும் ஆடியோ token-களுக்கு $0.15 + ஒரு மில்லியன் வெளியேறும் உரை token-களுக்கு $0.47 என்ற விலையிலிருந்து, $0.93 + $0.70 வரை, தொடர்நிலை/செய்தி அனுப்பலுக்கு. கோப்பு உரைமாற்றம் 12 மணிநேரம்/2 GB வரை அனுமதிக்கிறது; குறு வடிவம் 5 நிமிடங்கள்/2 GB வரை. |
Qwen Audio 3.1 ASR-Next | பேச்சாளரைக் கண்டறிந்து நேரமுத்திரையிடுதல்; உணர்ச்சி, சுற்றுப்புற நிகழ்வுகள், இயந்திர ஒலிகள் ஆகியவற்றை அடையாளம் காணுதல் | Qwen இதை அறிவித்துள்ளது; ஆனால் தற்போதைய Model Studio மற்றும் QwenCloud ஆவணங்களில் பொது API மாடல் ID, பிராந்தியம், கட்டணம் அல்லது வரம்பு எதுவும் கிடைக்கவில்லை. | பொதுவில் ஆவணப்படுத்தப்படவில்லை |
Qwen Audio 3.1 TTS | பல மொழிப் பேச்சு, மொழிகளுக்கிடையிலான குரல் பரிமாற்றம், பேச்சு வெளிப்பாட்டை prompt மூலம் கட்டுப்படுத்துதல் | | சிங்கப்பூர்: ஒரு மில்லியன் உள்வரும் உரை token-களுக்கு $0.23 + ஒரு மில்லியன் வெளியேறும் ஆடியோ token-களுக்கு $1.87. ஆய்வு செய்த 3.1 ஆவணங்களில் தற்போதைய பொது வரம்புகள் குறிப்பிடப்படவில்லை. |
Qwen Audio 3.1 TTS-Next | பேச்சு, ஒலி விளைவுகள், பின்னணி ஆடியோ ஆகியவற்றை ஒருங்கிணைத்து உருவாக்குதல் | பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட, தொடர்நிலை ஆதரவில்லாத HTTPS API; சீனம் மற்றும் ஆங்கிலத்துக்கான ஆவணம் உள்ளது | உள்வரும் ஒரு மில்லியன் token-களுக்கு $0.848 + வெளியேறும் ஒரு மில்லியன் token-களுக்கு $1.696. உள்ளீடு 3,000 எழுத்துகள் வரை; podcast வெளியீடு நான்கு நிமிடங்கள் வரை, மற்றவை இரண்டு நிமிடங்கள் வரை. |
Qwen Audio 3.1 Realtime Plus | இடையூறு செய்யவும் கருவிகளை அழைக்கவும் கூடிய முழு இருதிசைக் குரல் உரையாடல் | சிங்கப்பூர் மற்றும் பெய்ஜிங்கில் ஹோஸ்ட் செய்யப்பட்ட WebSocket API. வழிகாட்டி 11 மொழிகளைப் பட்டியலிடுகிறது. | சிங்கப்பூர்: உள்வரும் உரையின் ஒரு மில்லியன் token-களுக்கு $0.80, உள்வரும் ஆடியோவுக்கு $6.40, வெளியேறும் உரைக்கு $6.40, வெளியேறும் ஆடியோவுக்கு $24. இது 50 ஆடியோ உரையாடல் திருப்பங்கள் அல்லது 300 விநாடி ஆடியோ வரலாறு வரை வைத்திருக்கும். |
இவை ஹோஸ்ட் செய்யப்பட்ட API தயாரிப்புகள். பதிவிறக்கக்கூடிய 3.1 மாடல் எடைகளையோ அவற்றுக்கான உரிமத்தையோ BIG CHANGE கண்டறியவில்லை. QwenAudio-வின் GitHub களஞ்சியத்தில் உள்ள MIT உரிமம் திட்ட இணையதளத்துக்குப் பொருந்தும்; அதை மாடல்களுக்கான உரிமமாகப் புரிந்துகொள்ளக் கூடாது.
மொழிகளின் எண்ணிக்கையும் எந்த ஆவணத்தைப் பார்க்கிறீர்கள் என்பதைப் பொறுத்தது. Qwen-இன் சரிபார்க்கப்பட்ட வெளியீட்டுப் பதிவு ASR 30 மொழிகளையும் 16 சீன வட்டாரப் பேச்சு வகைகளையும் ஆதரிக்கிறது என்கிறது; சர்வதேச API வழிகாட்டி 30 மொழிகளையும் 10 வட்டாரப் பேச்சு வகைகளையும் பட்டியலிடுகிறது. டெவலப்பர்கள் தாங்கள் உண்மையில் அழைக்கக்கூடிய endpoint-க்கான பட்டியலையே பயன்படுத்த வேண்டும்.
95% குறைப்பு என்ற கூற்று பொது விலை அட்டவணையுடன் பொருந்தவில்லை
Alibaba-வின் விலை மாற்ற அறிவிப்பு செப்டம்பர் 22 அன்று நடைமுறைக்கு வந்தது. அதில் துல்லியமாக ஒப்பிடப்படுவது qwen-audio-3.0-realtime-flash, புதிய 3.1 Realtime Plus அல்ல. சிங்கப்பூர் விலைக் குறைப்புகள் (பழைய விலை − புதிய விலை) / பழைய விலை என்ற கணக்கில் பெறப்பட்டவை:
Realtime Flash தொடர்நிலை | முன்பு (USD) | பிறகு (USD) | குறைப்பு |
|---|---|---|---|
ஒரு மில்லியன் token-க்கு உள்வரும் உரை | $0.45 | $0.23 | 48.89% |
ஒரு மில்லியன் token-க்கு உள்வரும் ஆடியோ | $4.50 | $0.93 | 79.33% |
ஒரு மில்லியன் token-க்கு வெளியேறும் உரை | $4.50 | $0.70 | 84.44% |
ஒரு மில்லியன் token-க்கு வெளியேறும் வெளியீடு (உரை + ஆடியோ) | $15.00 | $1.87 | 87.53% |
அதே அறிவிப்பு, 3.1 TTS Flash விலையை 10,000 எழுத்துகளுக்கு $0.15 என்ற முறையிலிருந்து தனித்த உள்வரும் மற்றும் வெளியேறும் token விலைகளாக மாற்றுகிறது. தற்போதைய விலைப் பக்கம் 3.1 ASR-க்கும் உள்வரும் மற்றும் வெளியேறும் token அடிப்படையிலான விலையைப் பட்டியலிடுகிறது; 3.0 ASR-க்கு ஒவ்வொரு ஆடியோ விநாடிக்கும் கட்டணம், வெளியீட்டுக்கு இலவசம். இந்த விலை ஜோடிகளில் எதற்கும் சதவீதம் கணக்கிடுவது உரை, ஆடியோ நீளம், token பிரிப்பு ஆகியவற்றைப் பொறுத்தது. ஆகவே, இங்கு ஆய்வு செய்த பொது அட்டவணைகள் துல்லியமான 95% ASR விலைக் குறைப்பை உறுதிப்படுத்தவில்லை.
சுயாதீனச் சான்றுகள் இன்னும் Qwen 3.0-ஐப் பற்றியவையே
வெளியீட்டு நாளில் ஆய்வு செய்த ஆதாரங்களில் ஐந்து 3.1 மாடல்களுக்கான சுயாதீனச் சோதனை எதுவும் இல்லை. Qwen-இன் சொந்த ASR திட்டப் பக்கம் தரநிலைச் சோதனை முடிவுகளை வெளியிடுகிறது; ஆனால் அவை சுயாதீனமாக மீண்டும் சோதிக்கப்படவில்லை என்று கூறுகிறது.
Artificial Analysis தரவரிசையில் Qwen Audio 3.0 TTS Plus வழங்குநர் குரல் அரங்கில் (அனைத்து உச்சரிப்புகள் மற்றும் பிரிவுகள்) 1,259 Elo மதிப்புடன் இரண்டாவது இடத்தில் உள்ளது; 95% நம்பக இடைவெளி ±17, குருட்டு ஒப்பீட்டு மாதிரிகள் 1,447. தனியான பேச்சு முகவர் அரங்கில் Qwen Audio 3.0 Realtime Plus 699 preference Elo பெற்றது; முதல் ஆடியோவுக்கான நேரம் 1.54 விநாடிகள். அங்கு பங்கேற்பாளர்கள் ஒதுக்கப்பட்ட சூழல்களில் நேரடி உரையாடல்களின் போது மறைக்கப்பட்ட மாடல்களை ஒப்பிடுகிறார்கள்.



