NVIDIA విడుదల చేసిన Nemotron 3 Diarization మోడల్ను సెప్టెంబర్ 23న విడుదల చేశారు. దాదాపు 100 మిలియన్ పరామితులున్న ఈ ఓపెన్-వెయిట్ మోడల్, రికార్డు చేసిన లేదా ప్రసారమవుతున్న ఆడియోలో ఎనిమిది మంది వరకు వక్తలు ఎప్పుడు మాట్లాడుతున్నారో గుర్తిస్తుంది. సంభాషణకు సంబంధించిన వక్తల కార్యకలాపం, టైమ్స్టాంప్లను డెవలపర్లకు అందిస్తుంది; పదాలతో కూడిన ట్రాన్స్క్రిప్ట్ తయారుచేయడానికి ప్రత్యేకంగా స్పీచ్ రికగ్నిషన్ కూడా అవసరం.
ముఖ్యమైన మార్పు
- ఏం మారింది: NVIDIA గతంలో విడుదల చేసిన ప్రత్యక్ష ప్రసార Sortformer చెక్పాయింట్ నలుగురు వక్తలకు మద్దతిచ్చింది. ఈ విడుదలలో రికార్డు చేసిన ఆడియోతోనూ, వస్తున్న ఆడియో భాగాలతోనూ పనిచేసే ఒకే చెక్పాయింట్ నుంచి, వచ్చిన క్రమానుసారంగా ఎనిమిది వక్తల ఛానల్లను అందిస్తున్నారు.
- ఇది ఎందుకు ముఖ్యం: సమావేశాలు లేదా కాల్ల ట్రాన్స్క్రిప్షన్ వ్యవస్థను నిర్మించే డెవలపర్, ఒక్కో సమయ విరామానికి సాధారణ వక్త లేబుళ్లను కేటాయించడానికి ఈ మోడల్ను వాడవచ్చు. ఒకేసారి పలువురు మాట్లాడిన సందర్భాలనూ గుర్తించి, ఆ విరామాలను వేరే గుర్తింపు వ్యవస్థ తయారుచేసిన పదాలతో కలపవచ్చు. ఈ విడుదల ఆ పనికి పత్రబద్ధం చేసిన వక్తల పరిమితిని పెంచింది.
- ఏమి గమనించాలి: ప్రతి ప్రత్యక్ష ఫలితానికి ముందు ఎంత ఆడియోను బఫర్లో ఉంచాలనేది ఆచరణలో తీసుకోవాల్సిన నిర్ణయం. NVIDIA సిఫారసు చేసిన అతి తక్కువ అమరికలో గణన ప్రారంభమయ్యే ముందు 0.32 సెకన్ల ఆడియో వేచి ఉంటుంది; ఆ అమరిక వాడటానికి మూల్యం ఉంటుందని కంపెనీ స్వంత కచ్చితత్వ పట్టికలు చూపిస్తున్నాయి. బృందాలు తమ రికార్డింగ్లపై పూర్తి పనివిధానాన్ని పరీక్షించాలి.
మోడల్ ఏం అందిస్తుంది
ఈ మోడల్ కార్డు 16 kHz, ఒకే ఛానల్ ఆడియోను నిర్దేశిస్తుంది. WAV, FLAC, Opus, MP3 ఫైళ్లను జాబితా చేస్తుంది; NeMo ఇంటర్ఫేస్ ఫైల్ మార్గాలు, ఆడియో శ్రేణులు లేదా లైన్-డిలిమిటెడ్ JSON మానిఫెస్ట్ను స్వీకరిస్తుంది. ఆడియో శ్రేణులైతే సరైన నమూనా రేటును diarize() ఫంక్షన్ కాల్కు అందించాలి. కార్డు ప్రకారం, భాగాలవారీ అనుమితికి రికార్డింగ్ వ్యవధికి స్థిర గరిష్ఠ పరిమితి లేదు.
మోడల్ ఆడియోను [T, 8] వక్తల కార్యకలాప సంభావ్యతల టెన్సర్గా మారుస్తుంది; డిఫాల్ట్ అవుట్పుట్ దశ 10 మిల్లీసెకన్లు. పలువురు ఒకేసారి మాట్లాడినప్పుడు అనేక ఛానల్లు ఒకేసారి చురుకుగా ఉండవచ్చు. అనంతర ప్రాసెసింగ్ ఆ సంభావ్యతలను ప్రారంభ, ముగింపు సమయాలు మరియు సాధారణ వక్త లేబుళ్లున్న విరామాలుగా మారుస్తుంది. స్వరాలు మొదటిసారి వినిపించిన క్రమాన్ని లేబుళ్లు అనుసరిస్తాయి; అవి వ్యక్తులను పేర్లతో గుర్తించవు. ప్రత్యక్ష మోడల్ మునుపటి భాగాల కోసం వక్త కాష్ను, ఇటీవలి ఫ్రేమ్ల కోసం ముందుగా వచ్చినది ముందుగా తొలగించే క్యూను వాడి సందర్భాన్ని నిలుపుతుంది.
వక్తలను గుర్తిస్తూ రూపొందించిన ట్రాన్స్క్రిప్ట్ అవసరమైన డెవలపర్కు ఈ తేడా ముఖ్యం. NVIDIA అనుసంధాన మార్గదర్శి డయరైజేషన్ టైమ్స్టాంప్లను ప్రత్యేక ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ ఫలితంతో జతచేస్తుంది. దాని ఉదాహరణలో చురుకైన వక్త లేకుంటే పదానికి ఎవరినీ కేటాయించరు; ఒకేసారి పలువురు మాట్లాడితే ఫలితాన్ని సందిగ్ధంగా గుర్తిస్తారు. ఒకదానిపై మరొకటి ఎగసిపడిన స్వరాల్లో గుర్తించిన పదాన్ని ఎవరు పలికారో డయరైజేషన్ మోడల్ ఒక్కటే నిర్ణయించదు.

బఫర్ సమయం అంటే స్పందన సమయం కాదు
NVIDIA 30.4, 1.04, 0.64, 0.32 సెకన్ల ఇన్పుట్-బఫర్ అమరికలను సిఫారసు చేస్తుంది. 0.32-సెకన్ల అమరికలో మూడు 80-మిల్లీసెకన్ల ప్రాసెసింగ్ ఫ్రేమ్లు, కుడివైపు సందర్భానికి ఒక 80-మిల్లీసెకన్ల ఫ్రేమ్ ఉంటాయి. కార్డు ఆలస్యాన్ని స్పష్టంగా నిర్వచిస్తుంది — అనుమితికి ముందు ఆడియోను నిల్వ ఉంచే సమయంగా; గణన సమయాన్ని ఇందులో చేర్చదు. ట్రాన్స్క్రిప్షన్ వ్యవస్థకు గుర్తింపు, సమాచార ప్రసారం, అప్లికేషన్ సమయాలూ అదనంగా చేరతాయి.
పత్రబద్ధం చేసిన NeMo మార్గానికి Python 3.12 లేదా తదుపరిది, Cython, తాజా PyTorch వెర్షన్, NeMo Speech అవసరం. NVIDIA ఒక SortformerEncLabelModel.from_pretrained() ఉదాహరణ, diarize() ఫంక్షన్ కాల్ వక్తల భాగాలను ఇస్తుంది; సంభావ్యతల టెన్సర్లనూ చేర్చే ఎంపిక ఉంది. ఆ NeMo కాల్ ద్వారా హోస్ట్ చేసిన చెక్పాయింట్ను లోడ్ చేయడానికి Hugging Face టోకెన్ అవసరమని కార్డు చెబుతుంది. Transformers ఇంటర్ఫేస్లో ఆఫ్లైన్, స్ట్రీమింగ్ మార్గాలనూ, Transformers సోర్స్ రిపాజిటరీ నుంచి ఇన్స్టాల్ చేయడాన్నీ చూపుతుంది; అదనంగా NeMo-Speech.cpp కమాండ్-లైన్ మార్గం. ఇవి పత్రబద్ధం చేసిన ఇంటర్ఫేస్లు; BIG CHANGE వీటిని అమలు చేసి చూడలేదు. NeMo అనుసంధానానికి Linux, NVIDIA Ampere, Hopper, Blackwell GPU కుటుంబాలను మోడల్ కార్డు జాబితా చేస్తుంది. నిర్దిష్ట పనిభారానికి అవసరమైన హార్డ్వేర్, అమలు ఖర్చు ఎంచుకున్న మార్గం, కంప్యూటర్పై ఆధారపడతాయి; గంటకు అయ్యే ఖర్చును కార్డు పేర్కొనలేదు.
మోడల్ బరువులు OpenMDW 1.1 లైసెన్స్ కింద అందుబాటులో ఉన్నాయి. దాని షరతులకు లోబడి లైసెన్స్ రుసుము లేకుండా వినియోగించడానికి, మార్చడానికి, పంపిణీ చేయడానికి ఇది అనుమతిస్తుంది. పంపిణీ చేసేటప్పుడు లైసెన్స్, వర్తించే మూల-సూచనలను అలాగే ఉంచాలి. రూపొందించిన అవుట్పుట్ల వినియోగం లేదా పంచుకోవడంపై లైసెన్స్ పరిమితులు విధించదు; తమ ఆడియోకు అవసరమైన హక్కులు, సమ్మతులు పొందే బాధ్యత వినియోగదారులదే. వాణిజ్య, వాణిజ్యేతర వినియోగానికి మోడల్ అందుబాటులో ఉందని NVIDIA చెబుతోంది.
NVIDIA ఏం కొలిచింది
NVIDIA తన మోడల్-కార్డు మూల్యాంకనంలో Nemotron 3ను మునుపటి నాలుగు-వక్తల ప్రత్యక్ష ప్రసార Sortformer v2.1తో పోల్చింది. DIHARD III పూర్తి మూల్యాంకన సమితిలో, 1.04-సెకన్ల ఇన్పుట్-బఫర్ అమరిక వద్ద Nemotron 3కు 13.18% డయరైజేషన్ లోప రేటు వచ్చిందని NVIDIA నివేదించింది; అదే బఫర్ అమరికలో పాత మోడల్కు అది 19.60%. 0.32 సెకన్ల వద్ద Nemotron 3 ఫలితం 13.55%. డయరైజేషన్ లోప రేటు తప్పిన మాటలు, తప్పుడు గుర్తింపులు, వక్తల గందరగోళాన్ని కలిపి, సూచనలోని వక్త సమయంతో భాగిస్తుంది. తక్కువ విలువ మెరుగైనది.
ఈ గణాంకాలు నిర్దిష్ట పరీక్షా పద్ధతికి చెందినవి. అన్ని మూల్యాంకనాల్లోనూ ఒకేసారి మాట్లాడిన సందర్భాలను స్కోర్ చేస్తామని NVIDIA చెబుతోంది. DIHARD IIIలో సరిహద్దు కాలర్ సున్నా సెకన్లు; CALLHOME-Part2లో అది 0.25 సెకన్లు. AMI, AliMeeting, NOTSOFAR1 కోసం అసలు భాగాల లేబుళ్లకు బదులుగా అనుసంధానించిన, బలవంతంగా సమయానికి సరిపోల్చిన సూచన వ్యాఖ్యానాలను NVIDIA ఉపయోగించింది; లేబుళ్లు మారితే స్కోర్లూ మారతాయి. మూల్యాంకన సూచనలు పోల్చదగిన పరీక్ష కోసం NeMo స్క్రిప్ట్, సూచన RTTM ఫైల్, అతివ్యాప్తి అమరిక, కాలర్, స్ట్రీమింగ్ అమరికలు, అనంతర ప్రాసెసింగ్ వివరాలు అవసరమని చెబుతున్నాయి. NVIDIA వేగ పరీక్షల్లో RTX PRO 5000పై BF16తోనూ, BF16 లేకుండానూ torch.compile(). ఇవి విక్రేత నివేదించిన పరీక్షలు; BIG CHANGE స్వయంగా మళ్లీ నిర్వహించినవి కావు.
ఎనిమిది మంది వక్తల గరిష్ఠ పరిమితి ఇంకా ముఖ్యం. DIHARD IIIలో కొన్ని రికార్డింగ్లకు తొమ్మిది మంది వక్తల వరకూ వ్యాఖ్యానాలు ఉన్నాయి; మోడల్ ఎనిమిది ఛానల్లను మించిన మాటలు మిస్సవచ్చనీ లేదా మరో ఛానల్కు కేటాయించబడవచ్చనీ కార్డు చెబుతోంది. AMI పరీక్ష రికార్డింగ్లలో, మునుపటి ఆధార మోడల్తో పోలిస్తే Nemotron 3కు డయరైజేషన్ లోపం తక్కువగా ఉన్నా, వక్తల ఖచ్చిత సంఖ్యను గుర్తించడంలో కచ్చితత్వం తక్కువని NVIDIA నివేదించింది. అందువల్ల కచ్చితత్వం పని, కొలమానం, ఆడియోపై ఆధారపడుతుంది. మోడల్ను అనుసంధానించాలా అని నిర్ణయించే బృందం, NVIDIA పత్రబద్ధం చేసిన ఇంటర్ఫేస్లతో మొదలుపెట్టి, తాము వాడబోయే రికార్డింగ్లను పోలిన ఆడియోపై వక్త-పదాల పూర్తి ప్రక్రియను పరీక్షించవచ్చు.



