AI-translated from English; not yet reviewed by a fluent editor.
# Inilabas ng NVIDIA ang Nemotron 3 Diarization para sa audio na may hanggang walong tagapagsalita
> Nilalagyan ng label ng open-weight na diarization model ng NVIDIA noong Setyembre 23 ang hanggang walong tagapagsalita sa nirekord o live na audio. Ang pinakamaikling inirerekomendang setting na 0.32 segundo ay oras ng pag-iipon ng audio; mula naman sa sariling pagsubok ng NVIDIA ang mga bilang ng katumpakan.
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
Inilabas ng NVIDIA ang [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) noong Setyembre 23. Minamarkahan ng open-weight na modelong may humigit-kumulang 100 milyong parameter kung kailan nagsasalita ang bawat isa sa hanggang walong tagapagsalita sa nirekord o live na audio. Nagbibigay ito sa mga developer ng aktibidad ng tagapagsalita at timestamp sa usapan; kailangan din ng speech recognition upang makagawa ng transcript na may mga salita.
## Ang malaking pagbabago
- **Ano ang nagbago:**Apat na tagapagsalita ang sinusuportahan ng naunang streaming Sortformer checkpoint ng NVIDIA. Nagbibigay ang release na ito ng walong channel ng tagapagsalita ayon sa pagkakasunod ng pagsasalita mula sa iisang checkpoint na gumagana kapwa sa nirekord na audio at dumarating na mga chunk.
- **Bakit mahalaga:**Maaaring gumamit ang developer ng transcription para sa pulong o tawag sa modelo upang magtalaga ng pangkalahatang label sa mga tagapagsalita sa pagitan ng oras, kabilang ang sabayang pagsasalita, at saka itugma ang mga pagitan sa mga salitang mula sa hiwalay na recognizer. Pinalalawak ng release ang dokumentadong hangganan sa bilang ng tagapagsalita para sa gawaing iyon.
- **Ano ang dapat bantayan:**Ang praktikal na pasya ay kung gaano karaming audio ang iipunin bago maglabas ng bawat resulta ng streaming. Naghihintay muna ng 0.32 segundo ng audio bago magsimula ang pag-compute sa pinakamaikling inirerekomendang setting ng NVIDIA, at ipinakikita ng sarili nitong mga talahanayan ng katumpakan ang kapalit ng setting na iyon. Kailangan pa ring sukatin ng mga pangkat ang buong pipeline sa sarili nilang mga rekording.
## Ano ang ibinabalik ng modelo
Tinutukoy sa [model card](https://huggingface.co/nvidia/Nemotron-3-Diarization) Kailangang ipasa ang tamang sample rate sa `diarize()` na tawag. Walang itinakdang pinakamahabang tagal ng rekording sa card para sa inference na hinati sa mga chunk.
Ginagawang `[T, 8]` ng posibilidad ng aktibidad ng tagapagsalita, na may default na hakbang sa output na 10 millisecond. Maaaring sabay na aktibo ang maraming channel kapag nagsasapawan ang pagsasalita. Ginagawang mga pagitan na may oras ng pagsisimula at pagtatapos at pangkalahatang label ng tagapagsalita ang mga posibilidad sa postprocessing. Ayon sa pagkakasunod ng unang paglitaw ng boses ang mga label; hindi nito tinutukoy ang pangalan ng tao. Gumagamit ang NVIDIA ng speaker cache para sa mga naunang chunk at FIFO queue para sa kamakailang mga frame upang mapanatili ng streaming model ang konteksto.
Mahalaga ang pagkakaibang ito para sa developer na nangangailangan ng transcript na may label ng tagapagsalita. Itinatapat ng [gabay sa integrasyon ng NVIDIA](https://huggingface.co/blog/nvidia/nemotron-diarization) ang mga timestamp ng diarization sa output ng hiwalay na automatic speech recognition. Hindi inaatasan ng halimbawa nitong tuntunin sa gitna ng pagitan ang salitang walang aktibong tagapagsalita at nilalagyan ng markang malabo ang sabayang aktibidad. Hindi kayang tukuyin ng modelong diarization lamang kung aling nagsasapawang boses ang nagsabi ng kinilalang salita.

## Hindi oras ng pagtugon ang oras ng buffering
Inililista ng NVIDIA ang mga inirerekomendang setting ng input buffer na 30.4, 1.04, 0.64 at 0.32 segundo. Binubuo ang setting na 0.32 segundo ng tatlong 80-millisecond na processing frame at isang 80-millisecond na frame para sa karagdagang konteksto. Tahasang itinatakda sa [card ang latency](https://huggingface.co/nvidia/Nemotron-3-Diarization) bilang oras na hinahawakan ang audio bago ang inference; hindi kasama rito ang pag-compute. Magdaragdag din ng oras ang recognition, paglilipat ng datos at aplikasyon sa isang sistema ng transcript.
Kailangan ng dokumentadong paraan gamit ang NeMo ang Python 3.12 pataas, Cython, bagong bersiyon ng PyTorch at NeMo Speech. Nagbibigay ang NVIDIA ng `SortformerEncLabelModel.from_pretrained()` halimbawa, isang `diarize()` tawag na nagbabalik ng mga segment ng tagapagsalita, at switch upang isama ang mga tensor ng posibilidad. Sinasabi sa card na kailangan ng Hugging Face token upang i-load sa tawag na NeMo ang checkpoint na nasa host. Ipinakikita rin dito ang offline at streaming na interface ng Transformers, na ini-install mula sa source repository ng Transformers, pati ang [command-line na paraan ng NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). Mga dokumentadong interface ang mga ito; hindi pinatakbo ng BIG CHANGE ang mga ito. Nakalista sa model card ang Linux at mga GPU ng NVIDIA na Ampere, Hopper at Blackwell para sa integrasyon nito sa NeMo. Nakasalalay sa piniling paraan at makina ang pangangailangan sa hardware at gastos sa pagproseso ng partikular na gawain; walang ibinigay ang NVIDIA na presyong kada oras ng operasyon sa card.
Iniaalok ang mga timbang sa ilalim ng lisensiyang [OpenMDW 1.1](https://openmdw.ai/license/1-1/). Pinahihintulutan ng lisensiya ang paggamit, pagbabago at pamamahagi nang walang bayad sa lisensiya, alinsunod sa mga tuntunin nito. Kailangang panatilihin sa pamamahagi ang lisensiya at naaangkop na abiso tungkol sa pinagmulan. Hindi nito nililimitahan ang paggamit o pagbabahagi ng output at inaatasan nito ang mga gumagamit na tiyakin ang anumang karapatang-ari at pahintulot na maaaring kailanganin para sa kanilang audio. Inilalarawan ng NVIDIA na maaari itong gamitin sa komersiyal at di-komersiyal na layunin.
## Ano ang sinukat ng NVIDIA
Inihahambing sa [pagsusuri sa model card ng NVIDIA](https://huggingface.co/nvidia/Nemotron-3-Diarization) ang Nemotron 3 sa nauna nitong four-speaker streaming Sortformer v2.1. Sa buong evaluation set ng DIHARD III, nag-ulat ang NVIDIA ng diarization error rate na 13.18% para sa Nemotron 3 sa setting na 1.04 segundong input buffer, kumpara sa 19.60% para sa naunang modelo sa parehong nakasaad na setting. 13.55% ang resulta ng Nemotron 3 sa 0.32 segundo. Pinagsasama ng diarization error rate ang hindi natukoy na pagsasalita, maling alarma at pagkalito sa tagapagsalita, at hinahati ito sa oras ng sangguniang pagsasalita. Mas mababa ang mas mahusay.
Nakabatay ang mga bilang na iyon sa tinukoy na protocol. Ayon sa NVIDIA, isinasaalang-alang ng lahat ng pagsusuri nito ang nagsasapawang pagsasalita. Gumagamit ang DIHARD III ng zero-second na pagitan sa hangganan, samantalang 0.25 segundo ang gamit ng CALLHOME-Part2. Para sa AMI, AliMeeting at NOTSOFAR1, gumagamit ang NVIDIA ng magkakaugnay at sapilitang itinapat na anotasyon ng sanggunian sa halip na orihinal na mga label ng segment; nagbabago ang mga marka kapag binago ang mga label na ito. Tinutukoy sa [mga tagubilin sa pagsusuri](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) ang NeMo script at hinihingi ang reference RTTM file, setting ng overlap, pagitan, setting ng streaming at detalye ng postprocessing upang maihambing ang resulta. Sinukat ng NVIDIA ang bilis ng inference gamit ang BF16 sa RTX PRO 5000, may `torch.compile()` at wala nito. Mga pagsubok na iniulat ng vendor ang mga ito, hindi muling pagsubok ng BIG CHANGE.
Mahalaga pa rin ang hangganang walong tagapagsalita. May ilang rekording sa DIHARD III na nilagyan ng anotasyon para sa hanggang siyam na tagapagsalita, at sinasabi sa card na maaaring hindi matukoy o mailagay sa ibang channel ang pagsasalita na lampas sa walong channel ng modelo. Sa mga test recording ng AMI, nag-uulat ang NVIDIA ng mas mababang diarization error para sa Nemotron 3 kaysa sa nauna nitong baseline, ngunit mas mababa ang katumpakan nito sa eksaktong bilang ng mga tagapagsalita. Kaya nakasalalay ang katumpakan sa gawain at panukat, gayundin sa audio. Maaaring magsimula ang pangkat na nag-iisip kung isasama ang modelo sa mga inilathalang interface ng NVIDIA, pagkatapos ay subukan ang buong pipeline ng tagapagsalita at salita sa mga rekording na kahawig ng nilalayong gamit.
## Sources
- [NVIDIA: Model card ng Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) — Pangunahing espesipikasyon sa petsa ng release, laki na nasa antas ng 100M, input, output, mga konfigurasyon ng streaming at mga talahanayan ng pagsusuri ng NVIDIA. Iniulat ng vendor ang mga sukat sa katumpakan at bilis; oras ito ng input buffer sa setting na 0.32 segundo at hindi kasama ang pag-compute.
- [NVIDIA: Artikulo sa release ng Know Who Spoke When](https://huggingface.co/blog/nvidia/nemotron-diarization) — Ipinapaliwanag sa napetsahang salaysay ng release ang mga channel ng tagapagsalita ayon sa pagkakasunod ng pagsasalita at kung paano maitatapat ang mga pangkalahatang pagitan ng tagapagsalita sa output ng hiwalay na ASR. Minamarkahan ng halimbawa nitong pagtutugma sa gitna ang overlap bilang malabo; payak na heuristic ito, hindi napatunayang resulta ng transcript.
- [NVIDIA: Subcard sa Pagsusuri ng Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — Tinutukoy rito ang NeMo evaluation script, kahingian sa reference RTTM, mga kahulugan ng overlap at pagitan, at mga patlang na kailangan upang mag-ulat ng maihahambing na diarization error rate. Dokumento ito ng protocol, hindi malayang muling pagsubok.
- [Kasunduan sa Lisensiyang OpenMDW, bersiyon 1.1](https://openmdw.ai/license/1-1/) — Mga pahintulot at obligasyong umiiral: libreng paggamit at muling pamamahagi ng mga materyal ng modelo alinsunod sa mga tuntunin, pagpapanatili ng lisensiya at mga abiso sa pinagmulan kapag namamahagi, walang restriksiyon sa nabuong output, at pananagutan ng gumagamit sa mga kinakailangang karapatan at pahintulot.
- [Gabay sa command line ng NVIDIA NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — Idinodokumento nito ang lokal na CLI diarization at naunang hangganan na apat na tagapagsalita sa V2 kumpara sa walong tagapagsalita sa V3. Hindi pinatutunayan ng suporta sa CLI na pinatakbo ng newsroom na ito ang modelo o itinatakda ang bilis ng benchmark ng NeMo sa card.
Newsletter ng BIG CHANGE
Ang kabuuang larawan, sa sarili mong bilis.
Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Privacy mo, pasya mo.
Tumutulong ang kinakailangang storage na panatilihing ligtas ang site at tandaan ang mga pinili mo. Nananatiling naka-off ang opsyonal na Google Analytics hangga’t hindi mo ito pinapahintulutan. Mababasa mo ang lahat ng kuwento gamit lamang ang kinakailangang storage. Mga detalye tungkol sa privacy