NVIDIA வெளியிட்டது Nemotron 3 Diarization-ஐ செப்டம்பர் 23 அன்று. சுமார் 100 மில்லியன் அளவுருக்களைக் கொண்ட இந்தத் திறந்த எடையுள்ள மாடல், பதிவு செய்யப்பட்ட அல்லது நேரலை ஒலியில் அதிகபட்சம் எட்டு பேச்சாளர்களில் ஒவ்வொருவர் எப்போது பேசுகிறார்கள் என்பதைக் குறிக்கிறது. உரையாடலில் பேச்சாளர் செயல்பாட்டையும் நேரமுத்திரைகளையும் உருவாக்குநர்களுக்கு இது வழங்குகிறது; சொற்களுடன் கூடிய உரைமாற்றத்துக்கு பேச்சு அறிதலும் தனியாகத் தேவை.
முக்கிய மாற்றம்
- என்ன மாறியது: NVIDIA-வின் முந்தைய நேரலை Sortformer checkpoint நான்கு பேச்சாளர்களை ஆதரித்தது. புதிய வெளியீடு, பதிவு செய்யப்பட்ட ஒலிக்கும் உள்வரும் துண்டுகளுக்கும் பொருந்தும் ஒரே checkpoint-இலிருந்து வருகை வரிசைப்படி எட்டு பேச்சாளர் அலைவரிசைகளை வழங்குகிறது.
- இது ஏன் முக்கியம்: கூட்டம் அல்லது தொலைபேசி அழைப்பை உரைமாற்றும் அமைப்பை உருவாக்குபவர், ஒன்றோடொன்று மோதும் பேச்சு உட்பட கால இடைவெளிகளுக்குப் பொதுவான பேச்சாளர் குறிச்சொற்களை இட இந்த மாடலைப் பயன்படுத்தலாம்; பின்னர் அந்த இடைவெளிகளைத் தனியான பேச்சு அறிதல் மாடல் கண்டறிந்த சொற்களுடன் இணைக்கலாம். இந்தப் பணிக்கான ஆவணப்படுத்தப்பட்ட பேச்சாளர் வரம்பை இந்த வெளியீடு உயர்த்துகிறது.
- கவனிக்க வேண்டியது: ஒவ்வொரு நேரலை முடிவுக்கும் முன் எவ்வளவு ஒலியை இடையகத்தில் வைத்திருக்க வேண்டும் என்பதே நடைமுறைத் தேர்வு. NVIDIA பரிந்துரைக்கும் மிகக் குறுகிய அமைப்பு, கணக்கீடு தொடங்குவதற்கு முன் 0.32 விநாடி ஒலிக்காகக் காத்திருக்கிறது; அந்த அமைப்பைப் பயன்படுத்துவதில் ஏற்படும் துல்லிய இழப்பை நிறுவனத்தின் சொந்த அட்டவணைகள் காட்டுகின்றன. குழுக்கள் தங்கள் பதிவுகளில் முழுப் பணிச்செயல்முறையையும் அளவிட வேண்டும்.
மாடல் என்ன வெளியிடுகிறது
இந்த மாடல் அட்டை 16 kHz, ஒற்றைச் சேனல் ஒலியைக் குறிப்பிடுகிறது. WAV, FLAC, Opus, MP3 கோப்புகளைப் பட்டியலிடுவதுடன், அதன் NeMo இடைமுகம் கோப்புப் பாதைகள், ஒலி array-கள் அல்லது வரிவரியான JSON பட்டியலையும் ஏற்கிறது. ஒலி array-களுக்கு சரியான sample rate-ஐ வாதமாகக் கொடுக்கும் diarize() call. Chunk-ஆக inference செய்வதற்கு, அட்டையில் பதிவின் அதிகபட்ச நீள வரம்பு நிர்ணயிக்கப்படவில்லை.
மாடல் ஒலியை [T, 8] பேச்சாளர் செயல்பாட்டுக்கான நிகழ்தகவு tensor-ஆக மாற்றுகிறது; இயல்புநிலை வெளியீட்டுப் படி 10 மில்லிவிநாடிகள். பலர் ஒரே நேரத்தில் பேசும்போது, ஒன்றுக்கும் மேற்பட்ட சேனல்கள் செயல்படலாம். பிந்தைய செயலாக்கம் இந்த நிகழ்தகவுகளை தொடக்க, முடிவு நேரங்களும் பொதுவான பேச்சாளர் குறிச்சொற்களும் கொண்ட இடைவெளிகளாக மாற்றுகிறது. குரல்கள் முதலில் தோன்றிய வரிசையைப் பின்பற்றியே குறிச்சொற்கள் அமையும்; அவை நபர்களின் பெயர்களைக் கண்டறியாது. முந்தைய துண்டுகளுக்கான பேச்சாளர் cache-ஐயும், சமீபத்திய frame-களுக்கான முதலில் வந்ததை முதலில் வெளியேற்றும் வரிசையையும் NVIDIA பயன்படுத்துகிறது; இதனால் நேரலை மாடல் சூழலைத் தக்கவைக்கிறது.
பேச்சாளர்களைக் குறித்த உரைமாற்றம் தேவைப்படும் உருவாக்குநருக்கு இந்த வேறுபாடு முக்கியமானது. NVIDIA-வின் ஒருங்கிணைப்பு வழிகாட்டி diarization நேரமுத்திரைகளைத் தனியான தானியங்கி பேச்சு அறிதல் வெளியீட்டுடன் இணைக்கிறது. செயலில் பேச்சாளர் இல்லாதபோது அதன் எடுத்துக்காட்டு நடுப்புள்ளி விதி சொல்லை யாருக்கும் ஒதுக்காது; ஒரே நேரத்தில் பல பேச்சாளர்கள் செயல்பட்டால் தெளிவற்றதாகக் குறிக்கும். ஒன்றோடொன்று மோதும் பேச்சில் அடையாளம் காணப்பட்ட சொல்லை எந்தக் குரல் சொன்னது என்பதை diarization மாடல் மட்டும் தீர்மானிக்காது.

இடையக நேரம் பதில் நேரமல்ல
பரிந்துரைக்கப்படும் உள்ளீட்டு இடையக அமைப்புகளாக 30.4, 1.04, 0.64, 0.32 விநாடிகளை NVIDIA பட்டியலிடுகிறது. 0.32-விநாடி அமைப்பில் 80 மில்லிவிநாடி செயலாக்க frame-கள் மூன்றும், வலப்புறச் சூழலுக்கான 80 மில்லிவிநாடி frame ஒன்றும் அடங்கும். தாமதம் என்பதற்கு மாடல் அட்டை வெளிப்படையாக வரையறை அளிக்கிறது: inference-க்கு முன் வைத்திருக்கும் ஒலி நேரமே அது; கணக்கீட்டு நேரம் இதில் சேராது. உரைமாற்று அமைப்பில் பேச்சு அறிதல், தரவு பரிமாற்றம், செயலியின் நேரமும் கூடுதலாகும்.
ஆவணப்படுத்தப்பட்ட NeMo வழிமுறைக்கு Python 3.12 அல்லது அதற்குப் பிந்தைய பதிப்பு, Cython, அண்மைய PyTorch பதிப்பு, NeMo Speech ஆகியவை தேவை. NVIDIA ஒரு SortformerEncLabelModel.from_pretrained() எடுத்துக்காட்டையும், பேச்சாளர் பகுதிகளைத் திருப்பி வழங்கும் diarize() அழைப்பையும், நிகழ்தகவு tensor-களைச் சேர்க்கும் தெரிவையும் வழங்குகிறது. அந்த NeMo அழைப்பின் மூலம் ஹோஸ்ட் செய்யப்பட்ட checkpoint-ஐ ஏற்ற Hugging Face token தேவை என மாடல் அட்டை கூறுகிறது. இணையமின்றி அல்லது நேரலையில் இயங்கும் Transformers இடைமுகத்தையும், Transformers மூலக் குறியீட்டுக் களஞ்சியத்திலிருந்து நிறுவும் முறையையும், கூடவே ஒரு NeMo-Speech.cpp கட்டளை வரி வழியையும் காட்டுகிறது. இவை ஆவணப்படுத்தப்பட்ட இடைமுகங்கள்; BIG CHANGE அவற்றை இயக்கிப் பார்க்கவில்லை. NeMo ஒருங்கிணைப்புக்கு Linux மற்றும் NVIDIA Ampere, Hopper, Blackwell GPU குடும்பங்களை மாடல் அட்டை பட்டியலிடுகிறது. குறிப்பிட்ட பணிச்சுமைக்கான வன்பொருள் தேவை மற்றும் செயலாக்கச் செலவு தேர்ந்தெடுக்கும் வழிமுறையும் கணினியும் பொறுத்து மாறும்; ஒரு மணி நேர இயக்கத்துக்கான விலையை NVIDIA மாடல் அட்டையில் தரவில்லை.
மாடல் எடைகள் OpenMDW 1.1 உரிமத்தின் கீழ் வழங்கப்படுகின்றன. அதன் நிபந்தனைகளுக்கு உட்பட்டு உரிமக் கட்டணமின்றி பயன்படுத்தவும், மாற்றவும், விநியோகிக்கவும் உரிமம் வழங்குகிறது. விநியோகிக்கும்போது உரிமத்தையும் பொருந்தும் மூலக் குறிப்புகளையும் தக்கவைக்க வேண்டும். உருவாக்கப்பட்ட வெளியீடுகளைப் பயன்படுத்தவோ பகிரவோ உரிமம் கட்டுப்பாடு விதிக்கவில்லை; ஒலிக்குத் தேவைப்படக்கூடிய உரிமைகளையும் ஒப்புதல்களையும் உறுதிசெய்யும் பொறுப்பை பயனர்களிடம் ஒப்படைக்கிறது. வணிக மற்றும் வணிகமல்லாத பயன்பாட்டுக்கு மாடல் கிடைக்கிறது என NVIDIA கூறுகிறது.
NVIDIA எதை அளவிட்டது
NVIDIA-வின் மாடல் அட்டை மதிப்பீடு Nemotron 3-ஐ முந்தைய நான்கு பேச்சாளர் நேரலை Sortformer v2.1-உடன் ஒப்பிடுகிறது. முழு DIHARD III மதிப்பீட்டுத் தொகுப்பில், 1.04-விநாடி உள்ளீட்டு இடையக அமைப்பில் Nemotron 3-க்கு 13.18% diarization பிழை விகிதம் என்றும், அதே இடையக அமைப்பில் முந்தைய மாடலுக்கு 19.60% என்றும் NVIDIA தெரிவிக்கிறது. 0.32 விநாடியில் Nemotron 3-இன் முடிவு 13.55%. தவறவிட்ட பேச்சு, தவறான எச்சரிக்கை, பேச்சாளர் குழப்பம் ஆகியவற்றின் மொத்தத்தை உண்மையான பேச்சாளர் நேரத்தால் வகுத்ததே diarization பிழை விகிதம். குறைவான மதிப்பு சிறந்தது.
இந்த எண்கள் குறிப்பிட்ட சோதனை நெறிமுறைக்கு உரியவை. எல்லா மதிப்பீடுகளிலும் ஒன்றோடொன்று மோதும் பேச்சை மதிப்பிடுவதாக NVIDIA கூறுகிறது. DIHARD III-இல் எல்லைக்கான collar பூஜ்ய விநாடி; CALLHOME-Part2-இல் அது 0.25 விநாடி. AMI, AliMeeting, NOTSOFAR1 ஆகியவற்றுக்கு, அசல் பகுதி குறிச்சொற்களுக்குப் பதிலாக இணைக்கப்பட்டு கட்டாயமாக நேரம் பொருத்தப்பட்ட reference குறியீடுகளை NVIDIA பயன்படுத்துகிறது; அவற்றை மாற்றினால் மதிப்பெண்களும் மாறும். மதிப்பீட்டு வழிமுறைகள் ஒப்பிடத்தக்க சோதனைக்கான NeMo நிரல், reference RTTM கோப்பு, overlap அமைப்பு, collar, நேரலை அமைப்புகள், பிந்தைய செயலாக்க விவரங்கள் ஆகியவற்றைக் குறிப்பிடுகின்றன. inference வேகச் சோதனைகளில் NVIDIA, RTX PRO 5000-இல் BF16-ஐப் பயன்படுத்தி, torch.compile() வசதியுடனும் அதுவின்றியும் சோதித்தது. இவை சேவை வழங்குநர் தெரிவித்த சோதனைகள்; BIG CHANGE அவற்றை மீண்டும் செய்ததல்ல.
எட்டு பேச்சாளர் வரம்பு இன்னும் முக்கியம். DIHARD III-இல் ஒன்பது பேச்சாளர்கள் வரை குறிக்கப்பட்ட சில பதிவுகள் உள்ளன; மாடலின் எட்டு சேனல்களுக்கு அப்பாற்பட்ட பேச்சு தவறவிடப்படலாம் அல்லது வேறு சேனலுக்கு ஒதுக்கப்படலாம் என அட்டை கூறுகிறது. AMI சோதனைப் பதிவுகளில், முந்தைய அடிப்படை மாடலைவிட Nemotron 3-க்கு diarization பிழை குறைவாக இருந்தாலும், பேச்சாளர்களின் எண்ணிக்கையைத் துல்லியமாகக் கண்டறியும் விகிதம் குறைவாக இருந்ததாக NVIDIA தெரிவிக்கிறது. ஆகவே துல்லியம் பணி, அளவீடு, ஒலி ஆகியவற்றைப் பொறுத்தது. ஒருங்கிணைக்கலாமா என முடிவெடுக்கும் குழு, NVIDIA வெளியிட்ட இடைமுகங்களிலிருந்து தொடங்கி, தங்கள் பயன்பாட்டை ஒத்த பதிவுகளில் பேச்சாளர் குறியீடும் சொல்லும் இணைந்த முழுப் பணிச்செயல்முறையைச் சோதிக்கலாம்.



