NVIDIA ने Nemotron 3 Diarization 23 सप्टेंबरला सादर केले. सुमारे 100 दशलक्ष पॅरामीटर्सचे हे ओपन-वेट्स मॉडेल रेकॉर्ड केलेल्या किंवा थेट येणाऱ्या ऑडिओमध्ये आठ वक्त्यांपर्यंत कोण कधी बोलते ते नोंदवते. संभाषणातील वक्त्यांची हालचाल आणि वेळेचे ठसे विकासकांना मिळतात; शब्दांसह प्रतिलेख तयार करण्यासाठी भाषण-ओळख प्रणालीही आवश्यक असते.
मोठा बदल
- काय बदलले: NVIDIA चे आधीचे थेट-प्रवाह Sortformer चेकपॉइंट चार वक्त्यांना साथ देत होते. या आवृत्तीत एका चेकपॉइंटमधून आगमनक्रमानुसार आठ वक्त्यांचे चॅनेल मिळतात; तो रेकॉर्ड केलेल्या ऑडिओवर आणि येणाऱ्या तुकड्यांवरही काम करतो.
- हे का महत्त्वाचे: बैठका किंवा कॉलचे प्रतिलेखन बनवणारा विकासक वेळेच्या टप्प्यांना सर्वसाधारण वक्ता-लेबले देण्यासाठी हे मॉडेल वापरू शकतो. यात एकाच वेळी होणारे बोलणेही नोंदवता येते; त्यानंतर हे टप्पे वेगळ्या ओळख-प्रणालीने तयार केलेल्या शब्दांशी जोडता येतात. या कामासाठी जाहीर केलेली वक्त्यांची मर्यादा वाढली आहे.
- कशाकडे लक्ष द्यावे: प्रत्येक थेट निकालापूर्वी किती ऑडिओ साठवायचा, हा प्रत्यक्ष वापरातील महत्त्वाचा निर्णय आहे. NVIDIA ची शिफारस असलेली सर्वांत कमी सेटिंग गणना सुरू होण्याआधी 0.32 सेकंदांचा ऑडिओ साठवते; ही सेटिंग वापरण्याची किंमत NVIDIA च्या स्वतःच्या अचूकता-तक्त्यांत दिसते. टीमने स्वतःच्या ध्वनिमुद्रणांवर संपूर्ण कार्यप्रवाह तपासला पाहिजे.
मॉडेलकडून काय मिळते
हे मॉडेल कार्ड 16 kHz, एकाच चॅनेलचा ऑडिओ आवश्यक असल्याचे नमूद करते. त्यात WAV, FLAC, Opus आणि MP3 फाइल्स सूचीबद्ध आहेत; NeMo इंटरफेस फाइलचे पाथ, ऑडिओ अॅरे किंवा ओळी-ओळीच्या JSON मॅनिफेस्टचा स्वीकार करतो. ऑडिओ अॅरे देताना योग्य सॅम्पल रेटही diarize() कॉलला द्यावा लागतो. कार्डमध्ये तुकड्यांवर आधारित अनुमानासाठी ध्वनिमुद्रणाच्या कालावधीची ठरावीक कमाल मर्यादा दिलेली नाही.
मॉडेल ऑडिओचे रूपांतर [T, 8] वक्त्यांच्या सक्रियतेच्या संभाव्यता दाखवणाऱ्या टेन्सरमध्ये करते; डीफॉल्ट आउटपुट पायरी 10 मिलीसेकंदांची असते. लोक एकाच वेळी बोलत असतील तर अनेक चॅनेल सक्रिय असू शकतात. या संभाव्यतांवर पुढील प्रक्रिया करून सुरुवात व शेवटच्या वेळा आणि सर्वसाधारण वक्ता-लेबले असलेले कालखंड तयार होतात. आवाज प्रथम ज्या क्रमाने ऐकू येतात त्यानुसार लेबले दिली जातात; त्यातून व्यक्तींची नावे ओळखली जात नाहीत. आधीच्या तुकड्यांसाठी NVIDIA वक्ता-कॅशे वापरते आणि संदर्भ राखण्यासाठी अलीकडच्या फ्रेम्सची first-in, first-out रांग ठेवते.
वक्त्यांची खूण असलेला प्रतिलेख हवा असलेल्या विकासकासाठी हा फरक महत्त्वाचा आहे. NVIDIA चे एकत्रीकरण मार्गदर्शक diarization च्या वेळेचे ठसे वेगळ्या स्वयंचलित भाषण-ओळख प्रणालीच्या आउटपुटशी जोडते. त्याच्या उदाहरणातील मध्यबिंदूच्या नियमात सक्रिय वक्ता नसेल तर शब्दाला कोणतेही लेबल मिळत नाही; एकाच वेळी अनेक वक्ते सक्रिय असतील तर निकाल संदिग्ध ठरतो. ओळखलेल्या शब्दामागे एकाच वेळी बोलणाऱ्या कोणत्या आवाजाचा हात होता, हे diarization मॉडेल एकटे ठरवत नाही.

बफरची वेळ म्हणजे प्रतिसादाची वेळ नव्हे
NVIDIA 30.4, 1.04, 0.64 आणि 0.32 सेकंदांच्या इनपुट-बफर सेटिंग्ज सुचवते. 0.32 सेकंदांच्या सेटिंगमध्ये 80 मिलीसेकंदांच्या प्रक्रिया-फ्रेम्सपैकी तीन आणि संदर्भासाठी उजवीकडील एक 80 मिलीसेकंदांची फ्रेम असते. कार्ड विलंबाची स्पष्ट व्याख्या देते तो अनुमानापूर्वी साठवून ठेवलेल्या ऑडिओचा कालावधी आहे; गणनेस लागणारा वेळ यात धरलेला नाही. प्रतिलेख प्रणालीत ओळख-प्रक्रिया, डेटा-वहन आणि अनुप्रयोगाचा वेळही वाढेल.
दस्तऐवजीकरणातील NeMo पद्धतीसाठी Python 3.12 किंवा त्यानंतरची आवृत्ती, Cython, अलीकडची PyTorch आवृत्ती आणि NeMo Speech आवश्यक आहेत. NVIDIA एक SortformerEncLabelModel.from_pretrained() उदाहरण diarize() , वक्त्यांचे विभाग परत करणारा कॉल आणि संभाव्यता-टेन्सर समाविष्ट करण्याचा पर्याय देते. त्या NeMo कॉलद्वारे होस्ट केलेला चेकपॉइंट लोड करण्यासाठी Hugging Face टोकन आवश्यक असल्याचे कार्ड सांगते. त्यात Transformers साठी ऑफलाइन आणि थेट-प्रवाह इंटरफेसही आहेत; Transformers च्या स्रोत रेपॉझिटरीतून इन्स्टॉल करावे लागते. याशिवाय एक NeMo-Speech.cpp कमांड-लाइन पर्याय आहे. हे दस्तऐवजीकरणातील इंटरफेस आहेत; BIG CHANGE ने ते चालवून पाहिलेले नाहीत. NeMo एकत्रीकरणासाठी Linux आणि NVIDIA Ampere, Hopper किंवा Blackwell GPU कुटुंबातील हार्डवेअर कार्डमध्ये नमूद आहे. विशिष्ट कामासाठी लागणारे हार्डवेअर आणि प्रक्रिया-खर्च वापरलेल्या पद्धती व यंत्रावर अवलंबून असतात; कार्डमध्ये प्रति तासाचा परिचालन खर्च दिलेला नाही.
हे वेट्स OpenMDW 1.1 परवान्याअंतर्गत उपलब्ध आहेत. त्याच्या अटींनुसार परवाना शुल्काविना वापर, बदल आणि वितरण करण्याची परवानगी आहे. वितरण करताना परवाना आणि लागू असलेल्या मूळ स्रोताच्या सूचना कायम ठेवाव्या लागतात. तयार केलेल्या आउटपुटचा वापर किंवा वाटप यावर परवाना बंधने घालत नाही; ऑडिओसाठी आवश्यक असलेले हक्क आणि संमती मिळवण्याची जबाबदारी वापरकर्त्याची आहे. व्यावसायिक आणि अव्यावसायिक वापरासाठी मॉडेल उपलब्ध असल्याचे NVIDIA सांगते.
NVIDIA ने काय मोजले
NVIDIA चे मॉडेल-कार्डचे मूल्यमापन Nemotron 3 ची तुलना आधीच्या चार-वक्त्यांच्या थेट-प्रवाह Sortformer v2.1 शी करते. पूर्ण DIHARD III मूल्यमापन संचावर 1.04 सेकंदांच्या इनपुट-बफर सेटिंगमध्ये Nemotron 3 चा diarization error rate 13.18% असल्याचे NVIDIA सांगते; त्याच नमूद बफर सेटिंगमध्ये आधीच्या मॉडेलचा दर 19.60% होता. 0.32 सेकंदांच्या सेटिंगमध्ये Nemotron 3 चा निकाल 13.55% आहे. Diarization error rate मध्ये न सुटलेले भाषण, खोटे अलार्म आणि वक्त्यांची गल्लत यांची बेरीज संदर्भातील वक्त्यांच्या वेळेने भागली जाते. कमी दर चांगला.
हे आकडे ठरावीक चाचणी-पद्धतीवर आधारित आहेत. सर्व मूल्यमापनांत एकमेकांवर चढणारे भाषण मोजले जाते, असे NVIDIA सांगते. DIHARD III मध्ये सीमेजवळील फरकासाठी शून्य सेकंदांची सवलत वापरली जाते; CALLHOME-Part2 मध्ये 0.25 सेकंदांची. AMI, AliMeeting आणि NOTSOFAR1 साठी मूळ विभाग-लेबलांऐवजी परस्पर जोडलेली, सक्तीने वेळ-जुळवलेली संदर्भ-नोंद NVIDIA वापरते; ही लेबले बदलल्यास गुणही बदलतात. तुलनात्मक चाचणीसाठी NeMo स्क्रिप्ट, संदर्भ RTTM फाइल, ओव्हरलॅप सेटिंग, सवलत, थेट-प्रवाह सेटिंग्ज आणि पुढील प्रक्रिया यांचा तपशील मूल्यमापनाच्या सूचना तुलनात्मक चाचणीसाठी NeMo स्क्रिप्ट, संदर्भ RTTM फाइल, ओव्हरलॅप सेटिंग, सवलत, थेट-प्रवाह सेटिंग्ज आणि पुढील प्रक्रिया यांचा तपशील देतात. NVIDIA ने प्रक्रिया-वेगाच्या चाचण्या RTX PRO 5000 वर BF16 वापरून, त्या सेटिंगसह आणि त्याशिवाय केल्या. torch.compile() ही विक्रेत्याने नोंदवलेली चाचणी आहे; BIG CHANGE ने तिची पुनरावृत्ती केलेली नाही.
आठ वक्त्यांची कमाल मर्यादा अजूनही महत्त्वाची आहे. DIHARD III मधील काही ध्वनिमुद्रणांत नऊ वक्त्यांपर्यंत नोंदलेले आहेत, आणि मॉडेलच्या आठ चॅनेल्सपलीकडील भाषण सुटू शकते किंवा दुसऱ्या चॅनेलला दिले जाऊ शकते, असे कार्ड सांगते. AMI च्या चाचणी-ध्वनिमुद्रणांत Nemotron 3 चा diarization error आधीच्या आधार-मॉडेलपेक्षा कमी असल्याचे NVIDIA सांगते; पण वक्त्यांची अचूक संख्या ओळखण्याचे प्रमाण त्याहून कमी आहे. त्यामुळे अचूकता काम, मोजमाप आणि ऑडिओ यांवर अवलंबून असते. मॉडेल जोडायचे की नाही हे ठरवणारी टीम NVIDIA च्या प्रकाशित इंटरफेसपासून सुरुवात करून, अपेक्षित वापरासारख्या ध्वनिमुद्रणांवर वक्ता आणि शब्दांचा संपूर्ण कार्यप्रवाह तपासू शकते.



