AI-translated from English; not yet reviewed by a fluent editor.
# NVIDIA ने आठ वक्त्यांपर्यंतच्या ऑडिओसाठी Nemotron 3 Diarization सादर केले
> 23 सप्टेंबरला NVIDIA ने जाहीर केलेले हे ओपन-वेट्स diarization मॉडेल रेकॉर्ड केलेल्या किंवा थेट येणाऱ्या ऑडिओमध्ये आठ वक्त्यांपर्यंतचे आवाज ओळखते. शिफारस केलेली सर्वांत कमी 0.32 सेकंदांची सेटिंग म्हणजे गणना सुरू होण्यापूर्वी साठवलेला ऑडिओ; अचूकतेचे आकडे NVIDIA च्या स्वतःच्या चाचण्यांमधून आले आहेत.
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
NVIDIA ने [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) 23 सप्टेंबरला सादर केले. सुमारे 100 दशलक्ष पॅरामीटर्सचे हे ओपन-वेट्स मॉडेल रेकॉर्ड केलेल्या किंवा थेट येणाऱ्या ऑडिओमध्ये आठ वक्त्यांपर्यंत कोण कधी बोलते ते नोंदवते. संभाषणातील वक्त्यांची हालचाल आणि वेळेचे ठसे विकासकांना मिळतात; शब्दांसह प्रतिलेख तयार करण्यासाठी भाषण-ओळख प्रणालीही आवश्यक असते.
## मोठा बदल
- **काय बदलले:** NVIDIA चे आधीचे थेट-प्रवाह Sortformer चेकपॉइंट चार वक्त्यांना साथ देत होते. या आवृत्तीत एका चेकपॉइंटमधून आगमनक्रमानुसार आठ वक्त्यांचे चॅनेल मिळतात; तो रेकॉर्ड केलेल्या ऑडिओवर आणि येणाऱ्या तुकड्यांवरही काम करतो.
- **हे का महत्त्वाचे:** बैठका किंवा कॉलचे प्रतिलेखन बनवणारा विकासक वेळेच्या टप्प्यांना सर्वसाधारण वक्ता-लेबले देण्यासाठी हे मॉडेल वापरू शकतो. यात एकाच वेळी होणारे बोलणेही नोंदवता येते; त्यानंतर हे टप्पे वेगळ्या ओळख-प्रणालीने तयार केलेल्या शब्दांशी जोडता येतात. या कामासाठी जाहीर केलेली वक्त्यांची मर्यादा वाढली आहे.
- **कशाकडे लक्ष द्यावे:** प्रत्येक थेट निकालापूर्वी किती ऑडिओ साठवायचा, हा प्रत्यक्ष वापरातील महत्त्वाचा निर्णय आहे. NVIDIA ची शिफारस असलेली सर्वांत कमी सेटिंग गणना सुरू होण्याआधी 0.32 सेकंदांचा ऑडिओ साठवते; ही सेटिंग वापरण्याची किंमत NVIDIA च्या स्वतःच्या अचूकता-तक्त्यांत दिसते. टीमने स्वतःच्या ध्वनिमुद्रणांवर संपूर्ण कार्यप्रवाह तपासला पाहिजे.
## मॉडेलकडून काय मिळते
हे [मॉडेल कार्ड](https://huggingface.co/nvidia/Nemotron-3-Diarization) 16 kHz, एकाच चॅनेलचा ऑडिओ आवश्यक असल्याचे नमूद करते. त्यात WAV, FLAC, Opus आणि MP3 फाइल्स सूचीबद्ध आहेत; NeMo इंटरफेस फाइलचे पाथ, ऑडिओ अॅरे किंवा ओळी-ओळीच्या JSON मॅनिफेस्टचा स्वीकार करतो. ऑडिओ अॅरे देताना योग्य सॅम्पल रेटही `diarize()` कॉलला द्यावा लागतो. कार्डमध्ये तुकड्यांवर आधारित अनुमानासाठी ध्वनिमुद्रणाच्या कालावधीची ठरावीक कमाल मर्यादा दिलेली नाही.
मॉडेल ऑडिओचे रूपांतर `[T, 8]` वक्त्यांच्या सक्रियतेच्या संभाव्यता दाखवणाऱ्या टेन्सरमध्ये करते; डीफॉल्ट आउटपुट पायरी 10 मिलीसेकंदांची असते. लोक एकाच वेळी बोलत असतील तर अनेक चॅनेल सक्रिय असू शकतात. या संभाव्यतांवर पुढील प्रक्रिया करून सुरुवात व शेवटच्या वेळा आणि सर्वसाधारण वक्ता-लेबले असलेले कालखंड तयार होतात. आवाज प्रथम ज्या क्रमाने ऐकू येतात त्यानुसार लेबले दिली जातात; त्यातून व्यक्तींची नावे ओळखली जात नाहीत. आधीच्या तुकड्यांसाठी NVIDIA वक्ता-कॅशे वापरते आणि संदर्भ राखण्यासाठी अलीकडच्या फ्रेम्सची first-in, first-out रांग ठेवते.
वक्त्यांची खूण असलेला प्रतिलेख हवा असलेल्या विकासकासाठी हा फरक महत्त्वाचा आहे. [NVIDIA चे एकत्रीकरण मार्गदर्शक](https://huggingface.co/blog/nvidia/nemotron-diarization) diarization च्या वेळेचे ठसे वेगळ्या स्वयंचलित भाषण-ओळख प्रणालीच्या आउटपुटशी जोडते. त्याच्या उदाहरणातील मध्यबिंदूच्या नियमात सक्रिय वक्ता नसेल तर शब्दाला कोणतेही लेबल मिळत नाही; एकाच वेळी अनेक वक्ते सक्रिय असतील तर निकाल संदिग्ध ठरतो. ओळखलेल्या शब्दामागे एकाच वेळी बोलणाऱ्या कोणत्या आवाजाचा हात होता, हे diarization मॉडेल एकटे ठरवत नाही.

## बफरची वेळ म्हणजे प्रतिसादाची वेळ नव्हे
NVIDIA 30.4, 1.04, 0.64 आणि 0.32 सेकंदांच्या इनपुट-बफर सेटिंग्ज सुचवते. 0.32 सेकंदांच्या सेटिंगमध्ये 80 मिलीसेकंदांच्या प्रक्रिया-फ्रेम्सपैकी तीन आणि संदर्भासाठी उजवीकडील एक 80 मिलीसेकंदांची फ्रेम असते. कार्ड [विलंबाची स्पष्ट व्याख्या देते](https://huggingface.co/nvidia/Nemotron-3-Diarization) तो अनुमानापूर्वी साठवून ठेवलेल्या ऑडिओचा कालावधी आहे; गणनेस लागणारा वेळ यात धरलेला नाही. प्रतिलेख प्रणालीत ओळख-प्रक्रिया, डेटा-वहन आणि अनुप्रयोगाचा वेळही वाढेल.
दस्तऐवजीकरणातील NeMo पद्धतीसाठी Python 3.12 किंवा त्यानंतरची आवृत्ती, Cython, अलीकडची PyTorch आवृत्ती आणि NeMo Speech आवश्यक आहेत. NVIDIA एक `SortformerEncLabelModel.from_pretrained()` उदाहरण `diarize()` , वक्त्यांचे विभाग परत करणारा कॉल आणि संभाव्यता-टेन्सर समाविष्ट करण्याचा पर्याय देते. त्या NeMo कॉलद्वारे होस्ट केलेला चेकपॉइंट लोड करण्यासाठी Hugging Face टोकन आवश्यक असल्याचे कार्ड सांगते. त्यात Transformers साठी ऑफलाइन आणि थेट-प्रवाह इंटरफेसही आहेत; Transformers च्या स्रोत रेपॉझिटरीतून इन्स्टॉल करावे लागते. याशिवाय एक [NeMo-Speech.cpp कमांड-लाइन पर्याय](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) आहे. हे दस्तऐवजीकरणातील इंटरफेस आहेत; BIG CHANGE ने ते चालवून पाहिलेले नाहीत. NeMo एकत्रीकरणासाठी Linux आणि NVIDIA Ampere, Hopper किंवा Blackwell GPU कुटुंबातील हार्डवेअर कार्डमध्ये नमूद आहे. विशिष्ट कामासाठी लागणारे हार्डवेअर आणि प्रक्रिया-खर्च वापरलेल्या पद्धती व यंत्रावर अवलंबून असतात; कार्डमध्ये प्रति तासाचा परिचालन खर्च दिलेला नाही.
हे वेट्स [OpenMDW 1.1](https://openmdw.ai/license/1-1/) परवान्याअंतर्गत उपलब्ध आहेत. त्याच्या अटींनुसार परवाना शुल्काविना वापर, बदल आणि वितरण करण्याची परवानगी आहे. वितरण करताना परवाना आणि लागू असलेल्या मूळ स्रोताच्या सूचना कायम ठेवाव्या लागतात. तयार केलेल्या आउटपुटचा वापर किंवा वाटप यावर परवाना बंधने घालत नाही; ऑडिओसाठी आवश्यक असलेले हक्क आणि संमती मिळवण्याची जबाबदारी वापरकर्त्याची आहे. व्यावसायिक आणि अव्यावसायिक वापरासाठी मॉडेल उपलब्ध असल्याचे NVIDIA सांगते.
## NVIDIA ने काय मोजले
NVIDIA चे [मॉडेल-कार्डचे मूल्यमापन](https://huggingface.co/nvidia/Nemotron-3-Diarization) Nemotron 3 ची तुलना आधीच्या चार-वक्त्यांच्या थेट-प्रवाह Sortformer v2.1 शी करते. पूर्ण DIHARD III मूल्यमापन संचावर 1.04 सेकंदांच्या इनपुट-बफर सेटिंगमध्ये Nemotron 3 चा diarization error rate 13.18% असल्याचे NVIDIA सांगते; त्याच नमूद बफर सेटिंगमध्ये आधीच्या मॉडेलचा दर 19.60% होता. 0.32 सेकंदांच्या सेटिंगमध्ये Nemotron 3 चा निकाल 13.55% आहे. Diarization error rate मध्ये न सुटलेले भाषण, खोटे अलार्म आणि वक्त्यांची गल्लत यांची बेरीज संदर्भातील वक्त्यांच्या वेळेने भागली जाते. कमी दर चांगला.
हे आकडे ठरावीक चाचणी-पद्धतीवर आधारित आहेत. सर्व मूल्यमापनांत एकमेकांवर चढणारे भाषण मोजले जाते, असे NVIDIA सांगते. DIHARD III मध्ये सीमेजवळील फरकासाठी शून्य सेकंदांची सवलत वापरली जाते; CALLHOME-Part2 मध्ये 0.25 सेकंदांची. AMI, AliMeeting आणि NOTSOFAR1 साठी मूळ विभाग-लेबलांऐवजी परस्पर जोडलेली, सक्तीने वेळ-जुळवलेली संदर्भ-नोंद NVIDIA वापरते; ही लेबले बदलल्यास गुणही बदलतात. तुलनात्मक चाचणीसाठी NeMo स्क्रिप्ट, संदर्भ RTTM फाइल, ओव्हरलॅप सेटिंग, सवलत, थेट-प्रवाह सेटिंग्ज आणि पुढील प्रक्रिया यांचा तपशील [मूल्यमापनाच्या सूचना](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) तुलनात्मक चाचणीसाठी NeMo स्क्रिप्ट, संदर्भ RTTM फाइल, ओव्हरलॅप सेटिंग, सवलत, थेट-प्रवाह सेटिंग्ज आणि पुढील प्रक्रिया यांचा तपशील देतात. NVIDIA ने प्रक्रिया-वेगाच्या चाचण्या RTX PRO 5000 वर BF16 वापरून, त्या सेटिंगसह आणि त्याशिवाय केल्या. `torch.compile()` ही विक्रेत्याने नोंदवलेली चाचणी आहे; BIG CHANGE ने तिची पुनरावृत्ती केलेली नाही.
आठ वक्त्यांची कमाल मर्यादा अजूनही महत्त्वाची आहे. DIHARD III मधील काही ध्वनिमुद्रणांत नऊ वक्त्यांपर्यंत नोंदलेले आहेत, आणि मॉडेलच्या आठ चॅनेल्सपलीकडील भाषण सुटू शकते किंवा दुसऱ्या चॅनेलला दिले जाऊ शकते, असे कार्ड सांगते. AMI च्या चाचणी-ध्वनिमुद्रणांत Nemotron 3 चा diarization error आधीच्या आधार-मॉडेलपेक्षा कमी असल्याचे NVIDIA सांगते; पण वक्त्यांची अचूक संख्या ओळखण्याचे प्रमाण त्याहून कमी आहे. त्यामुळे अचूकता काम, मोजमाप आणि ऑडिओ यांवर अवलंबून असते. मॉडेल जोडायचे की नाही हे ठरवणारी टीम NVIDIA च्या प्रकाशित इंटरफेसपासून सुरुवात करून, अपेक्षित वापरासारख्या ध्वनिमुद्रणांवर वक्ता आणि शब्दांचा संपूर्ण कार्यप्रवाह तपासू शकते.
## Sources
- [NVIDIA: Nemotron 3 Diarization मॉडेल कार्ड](https://huggingface.co/nvidia/Nemotron-3-Diarization) — प्रकाशन तारीख, सुमारे 100 दशलक्ष पॅरामीटर्सचा आकार, इनपुट, आउटपुट, थेट-प्रवाह संरचना आणि NVIDIA च्या मूल्यमापन तक्त्यांसाठीचे प्राथमिक तपशील. अचूकता आणि वेगाची मोजमापे विक्रेत्याने नोंदवली आहेत; नमूद 0.32 सेकंद ही इनपुट-बफरची वेळ असून गणना त्यात समाविष्ट नाही.
- [NVIDIA: कोण कधी बोलले हे जाणून घ्या — प्रकाशन लेख](https://huggingface.co/blog/nvidia/nemotron-diarization) — तारखेसह दिलेल्या प्रकाशन-वर्णनात आगमनक्रमानुसार वक्ता-चॅनेल्सची माहिती आणि सर्वसाधारण वक्ता-कालखंड वेगळ्या ASR आउटपुटशी कसे जोडता येतात हे दाखवले आहे. त्याच्या मध्यबिंदू-जुळवणी उदाहरणात एकाच वेळी होणारे बोलणे संदिग्ध ठरते; हा साधा अंदाज-नियम आहे, पडताळलेला प्रतिलेख-निकाल नाही.
- [NVIDIA: Diarization मूल्यमापन उपकार्ड](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — तुलनात्मक diarization error rate नोंदवण्यासाठी NeMo मूल्यमापन स्क्रिप्ट, संदर्भ RTTM ची गरज, ओव्हरलॅप आणि सवलतीच्या व्याख्या तसेच आवश्यक क्षेत्रे दिली आहेत. हा चाचणी-पद्धतीचा दस्तऐवज आहे; स्वतंत्र पुनरावृत्ती नाही.
- [OpenMDW परवाना करार, आवृत्ती 1.1](https://openmdw.ai/license/1-1/) — वापर आणि पुनर्वितरणाच्या परवानग्या व जबाबदाऱ्यांचा अधिकृत स्रोत: अटींनुसार विनामूल्य वापर व मॉडेल-सामग्रीचे पुनर्वितरण, वितरणावेळी परवाना व मूळ स्रोताच्या सूचना कायम ठेवणे, तयार आउटपुटवर बंधने नसणे आणि आवश्यक हक्क व संमती मिळवण्याची जबाबदारी वापरकर्त्यावर असणे.
- [NVIDIA NeMo-Speech.cpp कमांड-लाइन मार्गदर्शक](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — स्थानिक CLI diarization आणि आधीच्या V2 मधील चार वक्त्यांच्या तुलनेत V3 मधील आठ वक्त्यांची मर्यादा यांचे दस्तऐवजीकरण. CLI चा आधार या वृत्तकक्षाने मॉडेल चालवले, हे दाखवत नाही आणि कार्डमधील NeMo बेंचमार्कच्या वेगाची पुष्टी करत नाही.
BIG CHANGE वृत्तपत्र
मोठे चित्र. तुमच्या गतीने.
AI आणि रोबोटिक्सवरील ताज्या बातम्या, पाहण्यासारखे बदल आणि वापरता येतील अशा व्यावहारिक कल्पना. दैनिक माहिती, साप्ताहिक सारांश किंवा मासिक दृष्टिकोन निवडा.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
तुमची गोपनीयता, तुमची निवड.
आवश्यक स्टोरेज साइट सुरक्षित ठेवण्यास आणि तुमच्या निवडी लक्षात ठेवण्यास मदत करते. तुमची परवानगी मिळेपर्यंत पर्यायी Google Analytics बंद राहते. फक्त आवश्यक स्टोरेज वापरून प्रत्येक लेख वाचता येतो. गोपनीयतेचा तपशील