AI-translated from English; not yet reviewed by a fluent editor.
# ఎనిమిది మంది వక్తల ఆడియో కోసం NVIDIA Nemotron 3 Diarizationను విడుదల చేసింది
> సెప్టెంబర్ 23న విడుదల చేసిన NVIDIA ఓపెన్-వెయిట్ డయరైజేషన్ మోడల్, రికార్డు చేసిన లేదా ప్రత్యక్ష ప్రసార ఆడియోలో గరిష్ఠంగా ఎనిమిది మంది వక్తలకు లేబుళ్లు ఇస్తుంది. సిఫారసు చేసిన అతి తక్కువ 0.32-సెకన్ల అమరిక, ఆడియో బఫర్లో ఉంచే సమయాన్ని సూచిస్తుంది; కచ్చితత్వ గణాంకాలు NVIDIA స్వంత పరీక్షలవి.
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
NVIDIA విడుదల చేసిన [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) మోడల్ను సెప్టెంబర్ 23న విడుదల చేశారు. దాదాపు 100 మిలియన్ పరామితులున్న ఈ ఓపెన్-వెయిట్ మోడల్, రికార్డు చేసిన లేదా ప్రసారమవుతున్న ఆడియోలో ఎనిమిది మంది వరకు వక్తలు ఎప్పుడు మాట్లాడుతున్నారో గుర్తిస్తుంది. సంభాషణకు సంబంధించిన వక్తల కార్యకలాపం, టైమ్స్టాంప్లను డెవలపర్లకు అందిస్తుంది; పదాలతో కూడిన ట్రాన్స్క్రిప్ట్ తయారుచేయడానికి ప్రత్యేకంగా స్పీచ్ రికగ్నిషన్ కూడా అవసరం.
## ముఖ్యమైన మార్పు
- **ఏం మారింది:** NVIDIA గతంలో విడుదల చేసిన ప్రత్యక్ష ప్రసార Sortformer చెక్పాయింట్ నలుగురు వక్తలకు మద్దతిచ్చింది. ఈ విడుదలలో రికార్డు చేసిన ఆడియోతోనూ, వస్తున్న ఆడియో భాగాలతోనూ పనిచేసే ఒకే చెక్పాయింట్ నుంచి, వచ్చిన క్రమానుసారంగా ఎనిమిది వక్తల ఛానల్లను అందిస్తున్నారు.
- **ఇది ఎందుకు ముఖ్యం:** సమావేశాలు లేదా కాల్ల ట్రాన్స్క్రిప్షన్ వ్యవస్థను నిర్మించే డెవలపర్, ఒక్కో సమయ విరామానికి సాధారణ వక్త లేబుళ్లను కేటాయించడానికి ఈ మోడల్ను వాడవచ్చు. ఒకేసారి పలువురు మాట్లాడిన సందర్భాలనూ గుర్తించి, ఆ విరామాలను వేరే గుర్తింపు వ్యవస్థ తయారుచేసిన పదాలతో కలపవచ్చు. ఈ విడుదల ఆ పనికి పత్రబద్ధం చేసిన వక్తల పరిమితిని పెంచింది.
- **ఏమి గమనించాలి:** ప్రతి ప్రత్యక్ష ఫలితానికి ముందు ఎంత ఆడియోను బఫర్లో ఉంచాలనేది ఆచరణలో తీసుకోవాల్సిన నిర్ణయం. NVIDIA సిఫారసు చేసిన అతి తక్కువ అమరికలో గణన ప్రారంభమయ్యే ముందు 0.32 సెకన్ల ఆడియో వేచి ఉంటుంది; ఆ అమరిక వాడటానికి మూల్యం ఉంటుందని కంపెనీ స్వంత కచ్చితత్వ పట్టికలు చూపిస్తున్నాయి. బృందాలు తమ రికార్డింగ్లపై పూర్తి పనివిధానాన్ని పరీక్షించాలి.
## మోడల్ ఏం అందిస్తుంది
ఈ [మోడల్ కార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization) 16 kHz, ఒకే ఛానల్ ఆడియోను నిర్దేశిస్తుంది. WAV, FLAC, Opus, MP3 ఫైళ్లను జాబితా చేస్తుంది; NeMo ఇంటర్ఫేస్ ఫైల్ మార్గాలు, ఆడియో శ్రేణులు లేదా లైన్-డిలిమిటెడ్ JSON మానిఫెస్ట్ను స్వీకరిస్తుంది. ఆడియో శ్రేణులైతే సరైన నమూనా రేటును `diarize()` ఫంక్షన్ కాల్కు అందించాలి. కార్డు ప్రకారం, భాగాలవారీ అనుమితికి రికార్డింగ్ వ్యవధికి స్థిర గరిష్ఠ పరిమితి లేదు.
మోడల్ ఆడియోను `[T, 8]` వక్తల కార్యకలాప సంభావ్యతల టెన్సర్గా మారుస్తుంది; డిఫాల్ట్ అవుట్పుట్ దశ 10 మిల్లీసెకన్లు. పలువురు ఒకేసారి మాట్లాడినప్పుడు అనేక ఛానల్లు ఒకేసారి చురుకుగా ఉండవచ్చు. అనంతర ప్రాసెసింగ్ ఆ సంభావ్యతలను ప్రారంభ, ముగింపు సమయాలు మరియు సాధారణ వక్త లేబుళ్లున్న విరామాలుగా మారుస్తుంది. స్వరాలు మొదటిసారి వినిపించిన క్రమాన్ని లేబుళ్లు అనుసరిస్తాయి; అవి వ్యక్తులను పేర్లతో గుర్తించవు. ప్రత్యక్ష మోడల్ మునుపటి భాగాల కోసం వక్త కాష్ను, ఇటీవలి ఫ్రేమ్ల కోసం ముందుగా వచ్చినది ముందుగా తొలగించే క్యూను వాడి సందర్భాన్ని నిలుపుతుంది.
వక్తలను గుర్తిస్తూ రూపొందించిన ట్రాన్స్క్రిప్ట్ అవసరమైన డెవలపర్కు ఈ తేడా ముఖ్యం. [NVIDIA అనుసంధాన మార్గదర్శి](https://huggingface.co/blog/nvidia/nemotron-diarization) డయరైజేషన్ టైమ్స్టాంప్లను ప్రత్యేక ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ ఫలితంతో జతచేస్తుంది. దాని ఉదాహరణలో చురుకైన వక్త లేకుంటే పదానికి ఎవరినీ కేటాయించరు; ఒకేసారి పలువురు మాట్లాడితే ఫలితాన్ని సందిగ్ధంగా గుర్తిస్తారు. ఒకదానిపై మరొకటి ఎగసిపడిన స్వరాల్లో గుర్తించిన పదాన్ని ఎవరు పలికారో డయరైజేషన్ మోడల్ ఒక్కటే నిర్ణయించదు.

## బఫర్ సమయం అంటే స్పందన సమయం కాదు
NVIDIA 30.4, 1.04, 0.64, 0.32 సెకన్ల ఇన్పుట్-బఫర్ అమరికలను సిఫారసు చేస్తుంది. 0.32-సెకన్ల అమరికలో మూడు 80-మిల్లీసెకన్ల ప్రాసెసింగ్ ఫ్రేమ్లు, కుడివైపు సందర్భానికి ఒక 80-మిల్లీసెకన్ల ఫ్రేమ్ ఉంటాయి. కార్డు [ఆలస్యాన్ని స్పష్టంగా నిర్వచిస్తుంది](https://huggingface.co/nvidia/Nemotron-3-Diarization) — అనుమితికి ముందు ఆడియోను నిల్వ ఉంచే సమయంగా; గణన సమయాన్ని ఇందులో చేర్చదు. ట్రాన్స్క్రిప్షన్ వ్యవస్థకు గుర్తింపు, సమాచార ప్రసారం, అప్లికేషన్ సమయాలూ అదనంగా చేరతాయి.
పత్రబద్ధం చేసిన NeMo మార్గానికి Python 3.12 లేదా తదుపరిది, Cython, తాజా PyTorch వెర్షన్, NeMo Speech అవసరం. NVIDIA ఒక `SortformerEncLabelModel.from_pretrained()` ఉదాహరణ, `diarize()` ఫంక్షన్ కాల్ వక్తల భాగాలను ఇస్తుంది; సంభావ్యతల టెన్సర్లనూ చేర్చే ఎంపిక ఉంది. ఆ NeMo కాల్ ద్వారా హోస్ట్ చేసిన చెక్పాయింట్ను లోడ్ చేయడానికి Hugging Face టోకెన్ అవసరమని కార్డు చెబుతుంది. Transformers ఇంటర్ఫేస్లో ఆఫ్లైన్, స్ట్రీమింగ్ మార్గాలనూ, Transformers సోర్స్ రిపాజిటరీ నుంచి ఇన్స్టాల్ చేయడాన్నీ చూపుతుంది; అదనంగా [NeMo-Speech.cpp కమాండ్-లైన్ మార్గం](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). ఇవి పత్రబద్ధం చేసిన ఇంటర్ఫేస్లు; BIG CHANGE వీటిని అమలు చేసి చూడలేదు. NeMo అనుసంధానానికి Linux, NVIDIA Ampere, Hopper, Blackwell GPU కుటుంబాలను మోడల్ కార్డు జాబితా చేస్తుంది. నిర్దిష్ట పనిభారానికి అవసరమైన హార్డ్వేర్, అమలు ఖర్చు ఎంచుకున్న మార్గం, కంప్యూటర్పై ఆధారపడతాయి; గంటకు అయ్యే ఖర్చును కార్డు పేర్కొనలేదు.
మోడల్ బరువులు [OpenMDW 1.1](https://openmdw.ai/license/1-1/) లైసెన్స్ కింద అందుబాటులో ఉన్నాయి. దాని షరతులకు లోబడి లైసెన్స్ రుసుము లేకుండా వినియోగించడానికి, మార్చడానికి, పంపిణీ చేయడానికి ఇది అనుమతిస్తుంది. పంపిణీ చేసేటప్పుడు లైసెన్స్, వర్తించే మూల-సూచనలను అలాగే ఉంచాలి. రూపొందించిన అవుట్పుట్ల వినియోగం లేదా పంచుకోవడంపై లైసెన్స్ పరిమితులు విధించదు; తమ ఆడియోకు అవసరమైన హక్కులు, సమ్మతులు పొందే బాధ్యత వినియోగదారులదే. వాణిజ్య, వాణిజ్యేతర వినియోగానికి మోడల్ అందుబాటులో ఉందని NVIDIA చెబుతోంది.
## NVIDIA ఏం కొలిచింది
NVIDIA తన [మోడల్-కార్డు మూల్యాంకనంలో](https://huggingface.co/nvidia/Nemotron-3-Diarization) Nemotron 3ను మునుపటి నాలుగు-వక్తల ప్రత్యక్ష ప్రసార Sortformer v2.1తో పోల్చింది. DIHARD III పూర్తి మూల్యాంకన సమితిలో, 1.04-సెకన్ల ఇన్పుట్-బఫర్ అమరిక వద్ద Nemotron 3కు 13.18% డయరైజేషన్ లోప రేటు వచ్చిందని NVIDIA నివేదించింది; అదే బఫర్ అమరికలో పాత మోడల్కు అది 19.60%. 0.32 సెకన్ల వద్ద Nemotron 3 ఫలితం 13.55%. డయరైజేషన్ లోప రేటు తప్పిన మాటలు, తప్పుడు గుర్తింపులు, వక్తల గందరగోళాన్ని కలిపి, సూచనలోని వక్త సమయంతో భాగిస్తుంది. తక్కువ విలువ మెరుగైనది.
ఈ గణాంకాలు నిర్దిష్ట పరీక్షా పద్ధతికి చెందినవి. అన్ని మూల్యాంకనాల్లోనూ ఒకేసారి మాట్లాడిన సందర్భాలను స్కోర్ చేస్తామని NVIDIA చెబుతోంది. DIHARD IIIలో సరిహద్దు కాలర్ సున్నా సెకన్లు; CALLHOME-Part2లో అది 0.25 సెకన్లు. AMI, AliMeeting, NOTSOFAR1 కోసం అసలు భాగాల లేబుళ్లకు బదులుగా అనుసంధానించిన, బలవంతంగా సమయానికి సరిపోల్చిన సూచన వ్యాఖ్యానాలను NVIDIA ఉపయోగించింది; లేబుళ్లు మారితే స్కోర్లూ మారతాయి. [మూల్యాంకన సూచనలు](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) పోల్చదగిన పరీక్ష కోసం NeMo స్క్రిప్ట్, సూచన RTTM ఫైల్, అతివ్యాప్తి అమరిక, కాలర్, స్ట్రీమింగ్ అమరికలు, అనంతర ప్రాసెసింగ్ వివరాలు అవసరమని చెబుతున్నాయి. NVIDIA వేగ పరీక్షల్లో RTX PRO 5000పై BF16తోనూ, BF16 లేకుండానూ `torch.compile()`. ఇవి విక్రేత నివేదించిన పరీక్షలు; BIG CHANGE స్వయంగా మళ్లీ నిర్వహించినవి కావు.
ఎనిమిది మంది వక్తల గరిష్ఠ పరిమితి ఇంకా ముఖ్యం. DIHARD IIIలో కొన్ని రికార్డింగ్లకు తొమ్మిది మంది వక్తల వరకూ వ్యాఖ్యానాలు ఉన్నాయి; మోడల్ ఎనిమిది ఛానల్లను మించిన మాటలు మిస్సవచ్చనీ లేదా మరో ఛానల్కు కేటాయించబడవచ్చనీ కార్డు చెబుతోంది. AMI పరీక్ష రికార్డింగ్లలో, మునుపటి ఆధార మోడల్తో పోలిస్తే Nemotron 3కు డయరైజేషన్ లోపం తక్కువగా ఉన్నా, వక్తల ఖచ్చిత సంఖ్యను గుర్తించడంలో కచ్చితత్వం తక్కువని NVIDIA నివేదించింది. అందువల్ల కచ్చితత్వం పని, కొలమానం, ఆడియోపై ఆధారపడుతుంది. మోడల్ను అనుసంధానించాలా అని నిర్ణయించే బృందం, NVIDIA పత్రబద్ధం చేసిన ఇంటర్ఫేస్లతో మొదలుపెట్టి, తాము వాడబోయే రికార్డింగ్లను పోలిన ఆడియోపై వక్త-పదాల పూర్తి ప్రక్రియను పరీక్షించవచ్చు.
## Sources
- [NVIDIA: Nemotron 3 Diarization మోడల్ కార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization) — విడుదల తేదీ, సుమారు 100M పరామితుల పరిమాణం, ఇన్పుట్లు, అవుట్పుట్, స్ట్రీమింగ్ అమరికలు, NVIDIA మూల్యాంకన పట్టికలకు సంబంధించిన ప్రాథమిక స్పెసిఫికేషన్. కచ్చితత్వం, వేగ గణాంకాలు విక్రేత నివేదించినవి; 0.32-సెకన్ల అమరిక గణన సమయాన్ని కలపని ఇన్పుట్-బఫర్ వ్యవధి.
- [NVIDIA: Know Who Spoke When విడుదల కథనం](https://huggingface.co/blog/nvidia/nemotron-diarization) — తేదీతో కూడిన ఈ విడుదల వివరణ, వచ్చిన క్రమంలో అమర్చిన వక్తల ఛానల్లను, సాధారణ వక్త సమయ విరామాలను ప్రత్యేక ASR ఫలితంతో ఎలా కలపాలో వివరిస్తుంది. దాని మధ్యబిందువు సరిపోల్చే ఉదాహరణ ఒకేసారి మాట్లాడిన సందర్భాన్ని సందిగ్ధంగా గుర్తిస్తుంది; ఇది ధృవీకరించిన ట్రాన్స్క్రిప్ట్ ఫలితం కాదు, ఒక సరళమైన నియమం మాత్రమే.
- [NVIDIA: డయరైజేషన్ మూల్యాంకన ఉపకార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — పోల్చదగిన డయరైజేషన్ లోప రేటును నమోదు చేయడానికి NeMo మూల్యాంకన స్క్రిప్ట్, సూచన RTTM, ఒకేసారి మాట్లాడే సందర్భాలు, కాలర్ అర్థం, అవసరమైన ఫీల్డ్లను ఇది సూచిస్తుంది. ఇది పరీక్షా విధాన పత్రం; స్వతంత్రంగా పునరుత్పత్తి చేసిన ఫలితం కాదు.
- [OpenMDW లైసెన్స్ ఒప్పందం, వెర్షన్ 1.1](https://openmdw.ai/license/1-1/) — వినియోగానికి వర్తించే అనుమతులు, బాధ్యతలు: నిబంధనలకు లోబడి మోడల్ సామగ్రిని ఉచితంగా ఉపయోగించడం, పునఃపంపిణీ చేయడం; పంచేటప్పుడు లైసెన్స్, మూల-సూచనలను అలాగే ఉంచడం; రూపొందించిన అవుట్పుట్లపై పరిమితులు లేకపోవడం; అవసరమైన హక్కులు, సమ్మతులు పొందే బాధ్యత వినియోగదారుదే.
- [NVIDIA NeMo-Speech.cpp కమాండ్-లైన్ మార్గదర్శి](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — స్థానిక CLI ద్వారా డయరైజేషన్ను, గత V2 నాలుగు-వక్తల పరిమితితో పోలిస్తే V3 ఎనిమిది-వక్తల పరిమితిని ఇది పత్రబద్ధం చేస్తుంది. CLI మద్దతు ఉందన్న విషయం ఈ వార్తా సంస్థ మోడల్ను అమలు చేసిందని గానీ, కార్డులోని NeMo వేగ పరీక్షను ధృవీకరిస్తుందని గానీ నిరూపించదు.
BIG CHANGE వార్తాపత్రిక
పెద్ద దృశ్యం. మీ వేగంతో.
AI, రోబోటిక్స్ తాజా కథనాలు, గమనించదగిన మార్పులు, ఆచరణలో పెట్టగల ఆలోచనలు. రోజువారీ బ్రీఫింగ్, వారపు సంకలనం లేదా నెలవారీ దృక్కోణం ఎంచుకోండి.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
మీ గోప్యత, మీ ఎంపిక.
అవసరమైన నిల్వ సైట్ భద్రతకు తోడ్పడి, మీ ఎంపికలను గుర్తుంచుకుంటుంది. మీరు అనుమతించే వరకు ఐచ్ఛిక Google Analytics ఆఫ్లోనే ఉంటుంది. అవసరమైన స్టోరేజ్తోనే ప్రతి కథనాన్ని చదవవచ్చు. గోప్యత వివరాలు