AI-translated from English; not yet reviewed by a fluent editor.

# எட்டு பேச்சாளர்களின் ஒலியைப் பிரித்தறியும் Nemotron 3-ஐ NVIDIA வெளியிட்டது

> NVIDIA-வின் செப்டம்பர் 23 திறந்த எடையுள்ள diarization மாடல், பதிவு செய்யப்பட்ட அல்லது நேரலை ஒலியில் எட்டு பேச்சாளர்கள் வரை அடையாளமிடுகிறது. பரிந்துரைக்கப்படும் மிகக் குறுகிய 0.32-விநாடி அமைப்பு இடையகப்படுத்திய உள்ளீட்டு நேரத்தைக் குறிக்கிறது; துல்லியப் புள்ளிவிவரங்கள் NVIDIA-வின் சொந்தச் சோதனைகளிலிருந்து வந்தவை.

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA வெளியிட்டது [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization)-ஐ செப்டம்பர் 23 அன்று. சுமார் 100 மில்லியன் அளவுருக்களைக் கொண்ட இந்தத் திறந்த எடையுள்ள மாடல், பதிவு செய்யப்பட்ட அல்லது நேரலை ஒலியில் அதிகபட்சம் எட்டு பேச்சாளர்களில் ஒவ்வொருவர் எப்போது பேசுகிறார்கள் என்பதைக் குறிக்கிறது. உரையாடலில் பேச்சாளர் செயல்பாட்டையும் நேரமுத்திரைகளையும் உருவாக்குநர்களுக்கு இது வழங்குகிறது; சொற்களுடன் கூடிய உரைமாற்றத்துக்கு பேச்சு அறிதலும் தனியாகத் தேவை.

## முக்கிய மாற்றம்

- **என்ன மாறியது:** NVIDIA-வின் முந்தைய நேரலை Sortformer checkpoint நான்கு பேச்சாளர்களை ஆதரித்தது. புதிய வெளியீடு, பதிவு செய்யப்பட்ட ஒலிக்கும் உள்வரும் துண்டுகளுக்கும் பொருந்தும் ஒரே checkpoint-இலிருந்து வருகை வரிசைப்படி எட்டு பேச்சாளர் அலைவரிசைகளை வழங்குகிறது.
- **இது ஏன் முக்கியம்:** கூட்டம் அல்லது தொலைபேசி அழைப்பை உரைமாற்றும் அமைப்பை உருவாக்குபவர், ஒன்றோடொன்று மோதும் பேச்சு உட்பட கால இடைவெளிகளுக்குப் பொதுவான பேச்சாளர் குறிச்சொற்களை இட இந்த மாடலைப் பயன்படுத்தலாம்; பின்னர் அந்த இடைவெளிகளைத் தனியான பேச்சு அறிதல் மாடல் கண்டறிந்த சொற்களுடன் இணைக்கலாம். இந்தப் பணிக்கான ஆவணப்படுத்தப்பட்ட பேச்சாளர் வரம்பை இந்த வெளியீடு உயர்த்துகிறது.
- **கவனிக்க வேண்டியது:** ஒவ்வொரு நேரலை முடிவுக்கும் முன் எவ்வளவு ஒலியை இடையகத்தில் வைத்திருக்க வேண்டும் என்பதே நடைமுறைத் தேர்வு. NVIDIA பரிந்துரைக்கும் மிகக் குறுகிய அமைப்பு, கணக்கீடு தொடங்குவதற்கு முன் 0.32 விநாடி ஒலிக்காகக் காத்திருக்கிறது; அந்த அமைப்பைப் பயன்படுத்துவதில் ஏற்படும் துல்லிய இழப்பை நிறுவனத்தின் சொந்த அட்டவணைகள் காட்டுகின்றன. குழுக்கள் தங்கள் பதிவுகளில் முழுப் பணிச்செயல்முறையையும் அளவிட வேண்டும்.

## மாடல் என்ன வெளியிடுகிறது

இந்த [மாடல் அட்டை](https://huggingface.co/nvidia/Nemotron-3-Diarization) 16 kHz, ஒற்றைச் சேனல் ஒலியைக் குறிப்பிடுகிறது. WAV, FLAC, Opus, MP3 கோப்புகளைப் பட்டியலிடுவதுடன், அதன் NeMo இடைமுகம் கோப்புப் பாதைகள், ஒலி array-கள் அல்லது வரிவரியான JSON பட்டியலையும் ஏற்கிறது. ஒலி array-களுக்கு சரியான sample rate-ஐ வாதமாகக் கொடுக்கும் `diarize()` call. Chunk-ஆக inference செய்வதற்கு, அட்டையில் பதிவின் அதிகபட்ச நீள வரம்பு நிர்ணயிக்கப்படவில்லை.

மாடல் ஒலியை `[T, 8]` பேச்சாளர் செயல்பாட்டுக்கான நிகழ்தகவு tensor-ஆக மாற்றுகிறது; இயல்புநிலை வெளியீட்டுப் படி 10 மில்லிவிநாடிகள். பலர் ஒரே நேரத்தில் பேசும்போது, ஒன்றுக்கும் மேற்பட்ட சேனல்கள் செயல்படலாம். பிந்தைய செயலாக்கம் இந்த நிகழ்தகவுகளை தொடக்க, முடிவு நேரங்களும் பொதுவான பேச்சாளர் குறிச்சொற்களும் கொண்ட இடைவெளிகளாக மாற்றுகிறது. குரல்கள் முதலில் தோன்றிய வரிசையைப் பின்பற்றியே குறிச்சொற்கள் அமையும்; அவை நபர்களின் பெயர்களைக் கண்டறியாது. முந்தைய துண்டுகளுக்கான பேச்சாளர் cache-ஐயும், சமீபத்திய frame-களுக்கான முதலில் வந்ததை முதலில் வெளியேற்றும் வரிசையையும் NVIDIA பயன்படுத்துகிறது; இதனால் நேரலை மாடல் சூழலைத் தக்கவைக்கிறது.

பேச்சாளர்களைக் குறித்த உரைமாற்றம் தேவைப்படும் உருவாக்குநருக்கு இந்த வேறுபாடு முக்கியமானது. [NVIDIA-வின் ஒருங்கிணைப்பு வழிகாட்டி](https://huggingface.co/blog/nvidia/nemotron-diarization) diarization நேரமுத்திரைகளைத் தனியான தானியங்கி பேச்சு அறிதல் வெளியீட்டுடன் இணைக்கிறது. செயலில் பேச்சாளர் இல்லாதபோது அதன் எடுத்துக்காட்டு நடுப்புள்ளி விதி சொல்லை யாருக்கும் ஒதுக்காது; ஒரே நேரத்தில் பல பேச்சாளர்கள் செயல்பட்டால் தெளிவற்றதாகக் குறிக்கும். ஒன்றோடொன்று மோதும் பேச்சில் அடையாளம் காணப்பட்ட சொல்லை எந்தக் குரல் சொன்னது என்பதை diarization மாடல் மட்டும் தீர்மானிக்காது.

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## இடையக நேரம் பதில் நேரமல்ல

பரிந்துரைக்கப்படும் உள்ளீட்டு இடையக அமைப்புகளாக 30.4, 1.04, 0.64, 0.32 விநாடிகளை NVIDIA பட்டியலிடுகிறது. 0.32-விநாடி அமைப்பில் 80 மில்லிவிநாடி செயலாக்க frame-கள் மூன்றும், வலப்புறச் சூழலுக்கான 80 மில்லிவிநாடி frame ஒன்றும் அடங்கும். [தாமதம் என்பதற்கு மாடல் அட்டை வெளிப்படையாக வரையறை அளிக்கிறது](https://huggingface.co/nvidia/Nemotron-3-Diarization): inference-க்கு முன் வைத்திருக்கும் ஒலி நேரமே அது; கணக்கீட்டு நேரம் இதில் சேராது. உரைமாற்று அமைப்பில் பேச்சு அறிதல், தரவு பரிமாற்றம், செயலியின் நேரமும் கூடுதலாகும்.

ஆவணப்படுத்தப்பட்ட NeMo வழிமுறைக்கு Python 3.12 அல்லது அதற்குப் பிந்தைய பதிப்பு, Cython, அண்மைய PyTorch பதிப்பு, NeMo Speech ஆகியவை தேவை. NVIDIA ஒரு `SortformerEncLabelModel.from_pretrained()` எடுத்துக்காட்டையும், பேச்சாளர் பகுதிகளைத் திருப்பி வழங்கும் `diarize()` அழைப்பையும், நிகழ்தகவு tensor-களைச் சேர்க்கும் தெரிவையும் வழங்குகிறது. அந்த NeMo அழைப்பின் மூலம் ஹோஸ்ட் செய்யப்பட்ட checkpoint-ஐ ஏற்ற Hugging Face token தேவை என மாடல் அட்டை கூறுகிறது. இணையமின்றி அல்லது நேரலையில் இயங்கும் Transformers இடைமுகத்தையும், Transformers மூலக் குறியீட்டுக் களஞ்சியத்திலிருந்து நிறுவும் முறையையும், கூடவே ஒரு [NeMo-Speech.cpp கட்டளை வரி வழியையும்](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) காட்டுகிறது. இவை ஆவணப்படுத்தப்பட்ட இடைமுகங்கள்; BIG CHANGE அவற்றை இயக்கிப் பார்க்கவில்லை. NeMo ஒருங்கிணைப்புக்கு Linux மற்றும் NVIDIA Ampere, Hopper, Blackwell GPU குடும்பங்களை மாடல் அட்டை பட்டியலிடுகிறது. குறிப்பிட்ட பணிச்சுமைக்கான வன்பொருள் தேவை மற்றும் செயலாக்கச் செலவு தேர்ந்தெடுக்கும் வழிமுறையும் கணினியும் பொறுத்து மாறும்; ஒரு மணி நேர இயக்கத்துக்கான விலையை NVIDIA மாடல் அட்டையில் தரவில்லை.

மாடல் எடைகள் [OpenMDW 1.1](https://openmdw.ai/license/1-1/) உரிமத்தின் கீழ் வழங்கப்படுகின்றன. அதன் நிபந்தனைகளுக்கு உட்பட்டு உரிமக் கட்டணமின்றி பயன்படுத்தவும், மாற்றவும், விநியோகிக்கவும் உரிமம் வழங்குகிறது. விநியோகிக்கும்போது உரிமத்தையும் பொருந்தும் மூலக் குறிப்புகளையும் தக்கவைக்க வேண்டும். உருவாக்கப்பட்ட வெளியீடுகளைப் பயன்படுத்தவோ பகிரவோ உரிமம் கட்டுப்பாடு விதிக்கவில்லை; ஒலிக்குத் தேவைப்படக்கூடிய உரிமைகளையும் ஒப்புதல்களையும் உறுதிசெய்யும் பொறுப்பை பயனர்களிடம் ஒப்படைக்கிறது. வணிக மற்றும் வணிகமல்லாத பயன்பாட்டுக்கு மாடல் கிடைக்கிறது என NVIDIA கூறுகிறது.

## NVIDIA எதை அளவிட்டது

NVIDIA-வின் [மாடல் அட்டை மதிப்பீடு](https://huggingface.co/nvidia/Nemotron-3-Diarization) Nemotron 3-ஐ முந்தைய நான்கு பேச்சாளர் நேரலை Sortformer v2.1-உடன் ஒப்பிடுகிறது. முழு DIHARD III மதிப்பீட்டுத் தொகுப்பில், 1.04-விநாடி உள்ளீட்டு இடையக அமைப்பில் Nemotron 3-க்கு 13.18% diarization பிழை விகிதம் என்றும், அதே இடையக அமைப்பில் முந்தைய மாடலுக்கு 19.60% என்றும் NVIDIA தெரிவிக்கிறது. 0.32 விநாடியில் Nemotron 3-இன் முடிவு 13.55%. தவறவிட்ட பேச்சு, தவறான எச்சரிக்கை, பேச்சாளர் குழப்பம் ஆகியவற்றின் மொத்தத்தை உண்மையான பேச்சாளர் நேரத்தால் வகுத்ததே diarization பிழை விகிதம். குறைவான மதிப்பு சிறந்தது.

இந்த எண்கள் குறிப்பிட்ட சோதனை நெறிமுறைக்கு உரியவை. எல்லா மதிப்பீடுகளிலும் ஒன்றோடொன்று மோதும் பேச்சை மதிப்பிடுவதாக NVIDIA கூறுகிறது. DIHARD III-இல் எல்லைக்கான collar பூஜ்ய விநாடி; CALLHOME-Part2-இல் அது 0.25 விநாடி. AMI, AliMeeting, NOTSOFAR1 ஆகியவற்றுக்கு, அசல் பகுதி குறிச்சொற்களுக்குப் பதிலாக இணைக்கப்பட்டு கட்டாயமாக நேரம் பொருத்தப்பட்ட reference குறியீடுகளை NVIDIA பயன்படுத்துகிறது; அவற்றை மாற்றினால் மதிப்பெண்களும் மாறும். [மதிப்பீட்டு வழிமுறைகள்](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) ஒப்பிடத்தக்க சோதனைக்கான NeMo நிரல், reference RTTM கோப்பு, overlap அமைப்பு, collar, நேரலை அமைப்புகள், பிந்தைய செயலாக்க விவரங்கள் ஆகியவற்றைக் குறிப்பிடுகின்றன. inference வேகச் சோதனைகளில் NVIDIA, RTX PRO 5000-இல் BF16-ஐப் பயன்படுத்தி, `torch.compile()` வசதியுடனும் அதுவின்றியும் சோதித்தது. இவை சேவை வழங்குநர் தெரிவித்த சோதனைகள்; BIG CHANGE அவற்றை மீண்டும் செய்ததல்ல.

எட்டு பேச்சாளர் வரம்பு இன்னும் முக்கியம். DIHARD III-இல் ஒன்பது பேச்சாளர்கள் வரை குறிக்கப்பட்ட சில பதிவுகள் உள்ளன; மாடலின் எட்டு சேனல்களுக்கு அப்பாற்பட்ட பேச்சு தவறவிடப்படலாம் அல்லது வேறு சேனலுக்கு ஒதுக்கப்படலாம் என அட்டை கூறுகிறது. AMI சோதனைப் பதிவுகளில், முந்தைய அடிப்படை மாடலைவிட Nemotron 3-க்கு diarization பிழை குறைவாக இருந்தாலும், பேச்சாளர்களின் எண்ணிக்கையைத் துல்லியமாகக் கண்டறியும் விகிதம் குறைவாக இருந்ததாக NVIDIA தெரிவிக்கிறது. ஆகவே துல்லியம் பணி, அளவீடு, ஒலி ஆகியவற்றைப் பொறுத்தது. ஒருங்கிணைக்கலாமா என முடிவெடுக்கும் குழு, NVIDIA வெளியிட்ட இடைமுகங்களிலிருந்து தொடங்கி, தங்கள் பயன்பாட்டை ஒத்த பதிவுகளில் பேச்சாளர் குறியீடும் சொல்லும் இணைந்த முழுப் பணிச்செயல்முறையைச் சோதிக்கலாம்.

## Sources

- [NVIDIA: Nemotron 3 Diarization மாடல் அட்டை](https://huggingface.co/nvidia/Nemotron-3-Diarization) — வெளியீட்டுத் தேதி, சுமார் 100 மில்லியன் அளவுரு அளவு, உள்ளீடுகள், வெளியீடு, நேரலை உள்ளமைவுகள், NVIDIA மதிப்பீட்டு அட்டவணைகள் ஆகியவற்றுக்கான முதன்மை விவரக்குறிப்பு. துல்லிய, வேக அளவீடுகளை நிறுவனமே தெரிவித்துள்ளது; 0.32 விநாடி அமைப்பு கணக்கீட்டு நேரத்தைத் தவிர்த்து உள்ளீட்டு இடையக நேரத்தைக் குறிக்கிறது.
- [NVIDIA: யார் எப்போது பேசினார்கள் என்பதை அறிதல் — வெளியீட்டுக் கட்டுரை](https://huggingface.co/blog/nvidia/nemotron-diarization) — தேதியிடப்பட்ட வெளியீட்டுக் கட்டுரை, வருகை வரிசைப்படி அமைந்த பேச்சாளர் சேனல்களை விளக்கி, பொதுவான பேச்சாளர் இடைவெளிகளைத் தனியான ASR வெளியீட்டுடன் எவ்வாறு இணைக்கலாம் எனக் காட்டுகிறது. நடுப்புள்ளி பொருத்தும் எடுத்துக்காட்டில் மாறிமோதும் பேச்சு தெளிவற்றதாகக் குறிக்கப்படுகிறது; இது சரிபார்க்கப்பட்ட உரைமாற்று முடிவல்ல, எளிய ஊக விதி.
- [NVIDIA: Diarization மதிப்பீட்டுத் துணை அட்டை](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — ஒப்பிடத்தக்க diarization பிழை விகிதத்தைப் பதிவுசெய்ய NeMo மதிப்பீட்டு நிரல், reference RTTM தேவை, overlap மற்றும் collar வரையறைகள், தேவையான புலங்கள் ஆகியவற்றைக் குறிப்பிடுகிறது. இது சோதனை நெறிமுறை ஆவணம்; சுயாதீன மறுஉருவாக்கம் அல்ல.
- [OpenMDW உரிம ஒப்பந்தம், பதிப்பு 1.1](https://openmdw.ai/license/1-1/) — பயன்பாட்டுக்கான அனுமதியும் கடமைகளும்: நிபந்தனைகளுக்கு உட்பட்டு மாடல் பொருட்களை இலவசமாகப் பயன்படுத்தி மறுவிநியோகிக்கலாம்; விநியோகத்தில் உரிமத்தையும் மூலக் குறிப்புகளையும் தக்கவைக்க வேண்டும்; உருவாக்கப்பட்ட வெளியீடுகளுக்கு கட்டுப்பாடுகள் இல்லை; தேவையான உரிமைகள் மற்றும் ஒப்புதல்களைப் பெறுவது பயனரின் பொறுப்பு.
- [NVIDIA NeMo-Speech.cpp கட்டளை வரி வழிகாட்டி](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — உள்ளூர் கட்டளை வரி வழியாக diarization செய்வதையும், முந்தைய V2-இன் நான்கு பேச்சாளர் வரம்பையும் V3-இன் எட்டு பேச்சாளர் வரம்பையும் ஆவணப்படுத்துகிறது. கட்டளை வரி ஆதரவு இருப்பதால் இந்தச் செய்தியறை மாடலை இயக்கியது என்றோ, அட்டையில் கூறிய NeMo benchmark வேகம் உறுதிப்படுகிறது என்றோ பொருளல்ல.
