ప్రపంచం ఆగడం లేదు.RSS
BIG CHANGE.

Markdown సంచిక

AI-translated from English; not yet reviewed by a fluent editor.

# ఎనిమిది మంది వక్తల ఆడియో కోసం NVIDIA Nemotron 3 Diarizationను విడుదల చేసింది

> సెప్టెంబర్ 23న విడుదల చేసిన NVIDIA ఓపెన్-వెయిట్ డయరైజేషన్ మోడల్, రికార్డు చేసిన లేదా ప్రత్యక్ష ప్రసార ఆడియోలో గరిష్ఠంగా ఎనిమిది మంది వక్తలకు లేబుళ్లు ఇస్తుంది. సిఫారసు చేసిన అతి తక్కువ 0.32-సెకన్ల అమరిక, ఆడియో బఫర్‌లో ఉంచే సమయాన్ని సూచిస్తుంది; కచ్చితత్వ గణాంకాలు NVIDIA స్వంత పరీక్షలవి.

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA విడుదల చేసిన [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) మోడల్‌ను సెప్టెంబర్ 23న విడుదల చేశారు. దాదాపు 100 మిలియన్ పరామితులున్న ఈ ఓపెన్-వెయిట్ మోడల్, రికార్డు చేసిన లేదా ప్రసారమవుతున్న ఆడియోలో ఎనిమిది మంది వరకు వక్తలు ఎప్పుడు మాట్లాడుతున్నారో గుర్తిస్తుంది. సంభాషణకు సంబంధించిన వక్తల కార్యకలాపం, టైమ్‌స్టాంప్‌లను డెవలపర్లకు అందిస్తుంది; పదాలతో కూడిన ట్రాన్స్‌క్రిప్ట్ తయారుచేయడానికి ప్రత్యేకంగా స్పీచ్ రికగ్నిషన్ కూడా అవసరం.

## ముఖ్యమైన మార్పు

- **ఏం మారింది:** NVIDIA గతంలో విడుదల చేసిన ప్రత్యక్ష ప్రసార Sortformer చెక్‌పాయింట్ నలుగురు వక్తలకు మద్దతిచ్చింది. ఈ విడుదలలో రికార్డు చేసిన ఆడియోతోనూ, వస్తున్న ఆడియో భాగాలతోనూ పనిచేసే ఒకే చెక్‌పాయింట్ నుంచి, వచ్చిన క్రమానుసారంగా ఎనిమిది వక్తల ఛానల్‌లను అందిస్తున్నారు.
- **ఇది ఎందుకు ముఖ్యం:** సమావేశాలు లేదా కాల్‌ల ట్రాన్స్‌క్రిప్షన్ వ్యవస్థను నిర్మించే డెవలపర్, ఒక్కో సమయ విరామానికి సాధారణ వక్త లేబుళ్లను కేటాయించడానికి ఈ మోడల్‌ను వాడవచ్చు. ఒకేసారి పలువురు మాట్లాడిన సందర్భాలనూ గుర్తించి, ఆ విరామాలను వేరే గుర్తింపు వ్యవస్థ తయారుచేసిన పదాలతో కలపవచ్చు. ఈ విడుదల ఆ పనికి పత్రబద్ధం చేసిన వక్తల పరిమితిని పెంచింది.
- **ఏమి గమనించాలి:** ప్రతి ప్రత్యక్ష ఫలితానికి ముందు ఎంత ఆడియోను బఫర్‌లో ఉంచాలనేది ఆచరణలో తీసుకోవాల్సిన నిర్ణయం. NVIDIA సిఫారసు చేసిన అతి తక్కువ అమరికలో గణన ప్రారంభమయ్యే ముందు 0.32 సెకన్ల ఆడియో వేచి ఉంటుంది; ఆ అమరిక వాడటానికి మూల్యం ఉంటుందని కంపెనీ స్వంత కచ్చితత్వ పట్టికలు చూపిస్తున్నాయి. బృందాలు తమ రికార్డింగ్‌లపై పూర్తి పనివిధానాన్ని పరీక్షించాలి.

## మోడల్ ఏం అందిస్తుంది

ఈ [మోడల్ కార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization) 16 kHz, ఒకే ఛానల్ ఆడియోను నిర్దేశిస్తుంది. WAV, FLAC, Opus, MP3 ఫైళ్లను జాబితా చేస్తుంది; NeMo ఇంటర్‌ఫేస్ ఫైల్ మార్గాలు, ఆడియో శ్రేణులు లేదా లైన్-డిలిమిటెడ్ JSON మానిఫెస్ట్‌ను స్వీకరిస్తుంది. ఆడియో శ్రేణులైతే సరైన నమూనా రేటును `diarize()` ఫంక్షన్ కాల్‌కు అందించాలి. కార్డు ప్రకారం, భాగాలవారీ అనుమితికి రికార్డింగ్ వ్యవధికి స్థిర గరిష్ఠ పరిమితి లేదు.

మోడల్ ఆడియోను `[T, 8]` వక్తల కార్యకలాప సంభావ్యతల టెన్సర్‌గా మారుస్తుంది; డిఫాల్ట్ అవుట్‌పుట్ దశ 10 మిల్లీసెకన్లు. పలువురు ఒకేసారి మాట్లాడినప్పుడు అనేక ఛానల్‌లు ఒకేసారి చురుకుగా ఉండవచ్చు. అనంతర ప్రాసెసింగ్ ఆ సంభావ్యతలను ప్రారంభ, ముగింపు సమయాలు మరియు సాధారణ వక్త లేబుళ్లున్న విరామాలుగా మారుస్తుంది. స్వరాలు మొదటిసారి వినిపించిన క్రమాన్ని లేబుళ్లు అనుసరిస్తాయి; అవి వ్యక్తులను పేర్లతో గుర్తించవు. ప్రత్యక్ష మోడల్ మునుపటి భాగాల కోసం వక్త కాష్‌ను, ఇటీవలి ఫ్రేమ్‌ల కోసం ముందుగా వచ్చినది ముందుగా తొలగించే క్యూను వాడి సందర్భాన్ని నిలుపుతుంది.

వక్తలను గుర్తిస్తూ రూపొందించిన ట్రాన్స్‌క్రిప్ట్ అవసరమైన డెవలపర్‌కు ఈ తేడా ముఖ్యం. [NVIDIA అనుసంధాన మార్గదర్శి](https://huggingface.co/blog/nvidia/nemotron-diarization) డయరైజేషన్ టైమ్‌స్టాంప్‌లను ప్రత్యేక ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ ఫలితంతో జతచేస్తుంది. దాని ఉదాహరణలో చురుకైన వక్త లేకుంటే పదానికి ఎవరినీ కేటాయించరు; ఒకేసారి పలువురు మాట్లాడితే ఫలితాన్ని సందిగ్ధంగా గుర్తిస్తారు. ఒకదానిపై మరొకటి ఎగసిపడిన స్వరాల్లో గుర్తించిన పదాన్ని ఎవరు పలికారో డయరైజేషన్ మోడల్ ఒక్కటే నిర్ణయించదు.

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## బఫర్ సమయం అంటే స్పందన సమయం కాదు

NVIDIA 30.4, 1.04, 0.64, 0.32 సెకన్ల ఇన్‌పుట్-బఫర్ అమరికలను సిఫారసు చేస్తుంది. 0.32-సెకన్ల అమరికలో మూడు 80-మిల్లీసెకన్ల ప్రాసెసింగ్ ఫ్రేమ్‌లు, కుడివైపు సందర్భానికి ఒక 80-మిల్లీసెకన్ల ఫ్రేమ్ ఉంటాయి. కార్డు [ఆలస్యాన్ని స్పష్టంగా నిర్వచిస్తుంది](https://huggingface.co/nvidia/Nemotron-3-Diarization) — అనుమితికి ముందు ఆడియోను నిల్వ ఉంచే సమయంగా; గణన సమయాన్ని ఇందులో చేర్చదు. ట్రాన్స్‌క్రిప్షన్ వ్యవస్థకు గుర్తింపు, సమాచార ప్రసారం, అప్లికేషన్ సమయాలూ అదనంగా చేరతాయి.

పత్రబద్ధం చేసిన NeMo మార్గానికి Python 3.12 లేదా తదుపరిది, Cython, తాజా PyTorch వెర్షన్, NeMo Speech అవసరం. NVIDIA ఒక `SortformerEncLabelModel.from_pretrained()` ఉదాహరణ, `diarize()` ఫంక్షన్ కాల్ వక్తల భాగాలను ఇస్తుంది; సంభావ్యతల టెన్సర్‌లనూ చేర్చే ఎంపిక ఉంది. ఆ NeMo కాల్ ద్వారా హోస్ట్ చేసిన చెక్‌పాయింట్‌ను లోడ్ చేయడానికి Hugging Face టోకెన్ అవసరమని కార్డు చెబుతుంది. Transformers ఇంటర్‌ఫేస్‌లో ఆఫ్‌లైన్, స్ట్రీమింగ్ మార్గాలనూ, Transformers సోర్స్ రిపాజిటరీ నుంచి ఇన్‌స్టాల్ చేయడాన్నీ చూపుతుంది; అదనంగా [NeMo-Speech.cpp కమాండ్-లైన్ మార్గం](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). ఇవి పత్రబద్ధం చేసిన ఇంటర్‌ఫేస్‌లు; BIG CHANGE వీటిని అమలు చేసి చూడలేదు. NeMo అనుసంధానానికి Linux, NVIDIA Ampere, Hopper, Blackwell GPU కుటుంబాలను మోడల్ కార్డు జాబితా చేస్తుంది. నిర్దిష్ట పనిభారానికి అవసరమైన హార్డ్‌వేర్, అమలు ఖర్చు ఎంచుకున్న మార్గం, కంప్యూటర్‌పై ఆధారపడతాయి; గంటకు అయ్యే ఖర్చును కార్డు పేర్కొనలేదు.

మోడల్ బరువులు [OpenMDW 1.1](https://openmdw.ai/license/1-1/) లైసెన్స్ కింద అందుబాటులో ఉన్నాయి. దాని షరతులకు లోబడి లైసెన్స్ రుసుము లేకుండా వినియోగించడానికి, మార్చడానికి, పంపిణీ చేయడానికి ఇది అనుమతిస్తుంది. పంపిణీ చేసేటప్పుడు లైసెన్స్, వర్తించే మూల-సూచనలను అలాగే ఉంచాలి. రూపొందించిన అవుట్‌పుట్‌ల వినియోగం లేదా పంచుకోవడంపై లైసెన్స్ పరిమితులు విధించదు; తమ ఆడియోకు అవసరమైన హక్కులు, సమ్మతులు పొందే బాధ్యత వినియోగదారులదే. వాణిజ్య, వాణిజ్యేతర వినియోగానికి మోడల్ అందుబాటులో ఉందని NVIDIA చెబుతోంది.

## NVIDIA ఏం కొలిచింది

NVIDIA తన [మోడల్-కార్డు మూల్యాంకనంలో](https://huggingface.co/nvidia/Nemotron-3-Diarization) Nemotron 3ను మునుపటి నాలుగు-వక్తల ప్రత్యక్ష ప్రసార Sortformer v2.1తో పోల్చింది. DIHARD III పూర్తి మూల్యాంకన సమితిలో, 1.04-సెకన్ల ఇన్‌పుట్-బఫర్ అమరిక వద్ద Nemotron 3కు 13.18% డయరైజేషన్ లోప రేటు వచ్చిందని NVIDIA నివేదించింది; అదే బఫర్ అమరికలో పాత మోడల్‌కు అది 19.60%. 0.32 సెకన్ల వద్ద Nemotron 3 ఫలితం 13.55%. డయరైజేషన్ లోప రేటు తప్పిన మాటలు, తప్పుడు గుర్తింపులు, వక్తల గందరగోళాన్ని కలిపి, సూచనలోని వక్త సమయంతో భాగిస్తుంది. తక్కువ విలువ మెరుగైనది.

ఈ గణాంకాలు నిర్దిష్ట పరీక్షా పద్ధతికి చెందినవి. అన్ని మూల్యాంకనాల్లోనూ ఒకేసారి మాట్లాడిన సందర్భాలను స్కోర్ చేస్తామని NVIDIA చెబుతోంది. DIHARD IIIలో సరిహద్దు కాలర్ సున్నా సెకన్లు; CALLHOME-Part2లో అది 0.25 సెకన్లు. AMI, AliMeeting, NOTSOFAR1 కోసం అసలు భాగాల లేబుళ్లకు బదులుగా అనుసంధానించిన, బలవంతంగా సమయానికి సరిపోల్చిన సూచన వ్యాఖ్యానాలను NVIDIA ఉపయోగించింది; లేబుళ్లు మారితే స్కోర్లూ మారతాయి. [మూల్యాంకన సూచనలు](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) పోల్చదగిన పరీక్ష కోసం NeMo స్క్రిప్ట్, సూచన RTTM ఫైల్, అతివ్యాప్తి అమరిక, కాలర్, స్ట్రీమింగ్ అమరికలు, అనంతర ప్రాసెసింగ్ వివరాలు అవసరమని చెబుతున్నాయి. NVIDIA వేగ పరీక్షల్లో RTX PRO 5000పై BF16తోనూ, BF16 లేకుండానూ `torch.compile()`. ఇవి విక్రేత నివేదించిన పరీక్షలు; BIG CHANGE స్వయంగా మళ్లీ నిర్వహించినవి కావు.

ఎనిమిది మంది వక్తల గరిష్ఠ పరిమితి ఇంకా ముఖ్యం. DIHARD IIIలో కొన్ని రికార్డింగ్‌లకు తొమ్మిది మంది వక్తల వరకూ వ్యాఖ్యానాలు ఉన్నాయి; మోడల్ ఎనిమిది ఛానల్‌లను మించిన మాటలు మిస్సవచ్చనీ లేదా మరో ఛానల్‌కు కేటాయించబడవచ్చనీ కార్డు చెబుతోంది. AMI పరీక్ష రికార్డింగ్‌లలో, మునుపటి ఆధార మోడల్‌తో పోలిస్తే Nemotron 3కు డయరైజేషన్ లోపం తక్కువగా ఉన్నా, వక్తల ఖచ్చిత సంఖ్యను గుర్తించడంలో కచ్చితత్వం తక్కువని NVIDIA నివేదించింది. అందువల్ల కచ్చితత్వం పని, కొలమానం, ఆడియోపై ఆధారపడుతుంది. మోడల్‌ను అనుసంధానించాలా అని నిర్ణయించే బృందం, NVIDIA పత్రబద్ధం చేసిన ఇంటర్‌ఫేస్‌లతో మొదలుపెట్టి, తాము వాడబోయే రికార్డింగ్‌లను పోలిన ఆడియోపై వక్త-పదాల పూర్తి ప్రక్రియను పరీక్షించవచ్చు.

## Sources

- [NVIDIA: Nemotron 3 Diarization మోడల్ కార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization) — విడుదల తేదీ, సుమారు 100M పరామితుల పరిమాణం, ఇన్‌పుట్‌లు, అవుట్‌పుట్, స్ట్రీమింగ్ అమరికలు, NVIDIA మూల్యాంకన పట్టికలకు సంబంధించిన ప్రాథమిక స్పెసిఫికేషన్. కచ్చితత్వం, వేగ గణాంకాలు విక్రేత నివేదించినవి; 0.32-సెకన్ల అమరిక గణన సమయాన్ని కలపని ఇన్‌పుట్-బఫర్ వ్యవధి.
- [NVIDIA: Know Who Spoke When విడుదల కథనం](https://huggingface.co/blog/nvidia/nemotron-diarization) — తేదీతో కూడిన ఈ విడుదల వివరణ, వచ్చిన క్రమంలో అమర్చిన వక్తల ఛానల్‌లను, సాధారణ వక్త సమయ విరామాలను ప్రత్యేక ASR ఫలితంతో ఎలా కలపాలో వివరిస్తుంది. దాని మధ్యబిందువు సరిపోల్చే ఉదాహరణ ఒకేసారి మాట్లాడిన సందర్భాన్ని సందిగ్ధంగా గుర్తిస్తుంది; ఇది ధృవీకరించిన ట్రాన్స్‌క్రిప్ట్ ఫలితం కాదు, ఒక సరళమైన నియమం మాత్రమే.
- [NVIDIA: డయరైజేషన్ మూల్యాంకన ఉపకార్డు](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — పోల్చదగిన డయరైజేషన్ లోప రేటును నమోదు చేయడానికి NeMo మూల్యాంకన స్క్రిప్ట్, సూచన RTTM, ఒకేసారి మాట్లాడే సందర్భాలు, కాలర్ అర్థం, అవసరమైన ఫీల్డ్‌లను ఇది సూచిస్తుంది. ఇది పరీక్షా విధాన పత్రం; స్వతంత్రంగా పునరుత్పత్తి చేసిన ఫలితం కాదు.
- [OpenMDW లైసెన్స్ ఒప్పందం, వెర్షన్ 1.1](https://openmdw.ai/license/1-1/) — వినియోగానికి వర్తించే అనుమతులు, బాధ్యతలు: నిబంధనలకు లోబడి మోడల్ సామగ్రిని ఉచితంగా ఉపయోగించడం, పునఃపంపిణీ చేయడం; పంచేటప్పుడు లైసెన్స్, మూల-సూచనలను అలాగే ఉంచడం; రూపొందించిన అవుట్‌పుట్‌లపై పరిమితులు లేకపోవడం; అవసరమైన హక్కులు, సమ్మతులు పొందే బాధ్యత వినియోగదారుదే.
- [NVIDIA NeMo-Speech.cpp కమాండ్-లైన్ మార్గదర్శి](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — స్థానిక CLI ద్వారా డయరైజేషన్‌ను, గత V2 నాలుగు-వక్తల పరిమితితో పోలిస్తే V3 ఎనిమిది-వక్తల పరిమితిని ఇది పత్రబద్ధం చేస్తుంది. CLI మద్దతు ఉందన్న విషయం ఈ వార్తా సంస్థ మోడల్‌ను అమలు చేసిందని గానీ, కార్డులోని NeMo వేగ పరీక్షను ధృవీకరిస్తుందని గానీ నిరూపించదు.