AI-translated from English; not yet reviewed by a fluent editor.
# NVIDIA објавила Nemotron 3 Diarization за аудио-снимке са осам говорника
> NVIDIA-ин модел за раздвајање говорника отворених тежина, објављен 23. септембра, означава до осам говорника у снимљеном звуку или звуку који се преноси уживо. Најкраће препоручено подешавање од 0,32 секунде односи се на баферовани улаз, а бројке о тачности потичу из тестова саме компаније NVIDIA.
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
NVIDIA је 23. септембра објавио [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization). Овај модел отворених тежина са приближно 100 милиона параметара означава када говори сваки од највише осам говорника, у снимљеном звуку или преносу уживо. Развојним тимовима даје податке о активности говорника и временске ознаке разговора; за транскрипт са препознатим речима потребан је и засебан систем за препознавање говора.
## Суштинска промена
- **Шта се променило:** NVIDIA-ина претходна контролна тачка Sortformer за пренос уживо подржава четири говорника. Ново издање нуди осам канала за говорнике, нумерисаних по редоследу појављивања, из једне контролне тачке која ради и са снимљеним звуком и са пристиглим сегментима.
- **Зашто је то важно:** Развојни тим који прави систем за транскрипцију састанака или позива може моделом да додели генеричке ознаке говорника временским интервалима, укључујући преклапање говора, па да те интервале споји са речима из засебног система за препознавање говора. Овим издањем повећава се документовани број говорника за тај задатак.
- **На шта обратити пажњу:** У пракси треба одабрати колико звука ће се баферовати пре сваког резултата преноса уживо. NVIDIA-ино најкраће препоручено подешавање чека да пристигне 0,32 секунде звука пре почетка обраде, а сопствене табеле тачности компаније показују цену тог подешавања. Тимови и даље морају да измере цео поступак на својим снимцима.
## Шта модел враћа
Картица [модела](https://huggingface.co/nvidia/Nemotron-3-Diarization) наводи моно звук уз фреквенцију узорковања од 16 кХз. Подржава WAV, FLAC, Опус и MP3 датотеке, а интерфејс NeMo прихвата путање до датотека, низове звучних података и JSON манифест са по једним записом у реду. За низове звучних података одговарајућу фреквенцију узорковања треба проследити кроз функцију `diarize()` позива. Картица не наводи фиксно максимално трајање снимка за закључивање по сегментима.
Модел претвара звук у тензор `[T, 8]` вероватноћа активности говорника са подразумеваним кораком излаза од 10 милисекунди. Више канала може бити активно истовремено када се гласови преклапају. Накнадна обрада те вероватноће претвара у интервале са почетним и завршним временима и генеричким ознакама говорника. Ознаке прате редослед којим се гласови први пут јављају; не откривају идентитет особе. NVIDIA користи кеш говорника за претходне сегменте и ред „први унутра, први напоље“ за недавне кадрове како би модел за пренос уживо задржао контекст.
За развојни тим коме је потребан транскрипт са ознакама говорника, та разлика је битна. [NVIDIA-ино упутство за повезивање система](https://huggingface.co/blog/nvidia/nemotron-diarization) спаја временске ознаке раздвајања говорника са излазом засебног аутоматског препознавања говора. У примеру се реч не додељује ниједном говорнику када у том тренутку нико не говори, а истовремена активност означава се као нејасна. Сам модел за раздвајање говорника не одређује који је говорник изговорио препознату реч током преклапања.

## Време баферовања није време одзива
NVIDIA наводи препоручена подешавања улазног бафера од 30,4, 1,04, 0,64 и 0,32 секунде. Подешавање од 0,32 секунде састоји се од три процесна кадра од 80 милисекунди и једног кадра будућег контекста од 80 милисекунди. [У картици се изричито дефинише латенција](https://huggingface.co/nvidia/Nemotron-3-Diarization) као време током ког се звук задржава пре закључивања; време обраде није укључено. Систем за транскрипцију додао би и време потребно за препознавање, пренос и апликацију.
Документовани поступак са NeMo-ом захтева Python 3.12 или новији, Cython, новију верзију PyTorch и NeMo Speech. NVIDIA даје `SortformerEncLabelModel.from_pretrained()` пример, а `diarize()` позив који враћа сегменте говорника и прекидач за укључивање тензора вероватноћа. У картици модела пише да је за учитавање контролне тачке са хостинга потребан Hugging Face токен. Приказани су и интерфејси Transformers-а за локалну обраду и пренос уживо, уз инсталацију из изворног репозиторијума Transformers-а, као и [командни алат NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). Ово су документовани интерфејси; BIG CHANGE их није покренуо. Картица модела за интеграцију са NeMo-ом наводи Linux и NVIDIA GPU породице Ампере, Хоппер и Blackwell. Потребна опрема и трошак обраде за конкретно оптерећење зависе од изабраног поступка и рачунара; NVIDIA у картици не наводи цену рада по сату.
Тежине се нуде под лиценцом [OpenMDW 1.1](https://openmdw.ai/license/1-1/). Лиценца, у складу са својим условима, дозвољава употребу, измене и дистрибуцију без накнаде за лиценцу. При дистрибуцији се морају задржати лиценца и одговарајућа обавештења о пореклу. Лиценца не ограничава употребу или дељење излазних резултата и оставља корисницима одговорност да обезбеде права и сагласности који могу бити потребни за њихове звучне записе. NVIDIA наводи да је модел доступан за комерцијалну и некомерцијалну употребу.
## Шта је NVIDIA мерио
NVIDIA-ина [евалуација у картици модела](https://huggingface.co/nvidia/Nemotron-3-Diarization) пореди Nemotron 3 са ранијим моделом Sortformer в2.1 за четири говорника у преносу уживо. На целом скупу за евалуацију DIHARD III, NVIDIA наводи стопу грешке раздвајања говорника од 13,18% за Nemotron 3 при подешавању улазног бафера од 1,04 секунде, у поређењу са 19,60% за ранији модел при истом наведеном подешавању. При 0,32 секунде резултат Nemotron-а 3 износи 13,55%. Стопа грешке раздвајања говорника обједињује пропуштени говор, лажне детекције и забуну око говорника, подељене референтним временом говорника. Нижа вредност је боља.
Ове бројке важе за дефинисани протокол. NVIDIA наводи да све њене евалуације оцењују и преклапајући говор. DIHARD III користи гранични интервал од нула секунди, док CALLHOME-Part2 користи интервал од 0,25 секунди. За скупове AMI, AliMeeting и NOTSOFAR1 NVIDIA користи повезане референтне ознаке поравнате са звуком, уместо изворних ознака сегмената; промена ознака мења резултате. У [упутству за евалуацију](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) наводе се NeMo скрипта и обавезна референтна RTTM датотека, подешавање преклапања, гранични интервал, поставке преноса уживо и детаљи накнадне обраде за упоредиво покретање. NVIDIA-ина мерења брзине закључивања обављена су у формату BF16 на рачунару RTX PRO 5000, са укљученим и искљученим `torch.compile()`. Ово су резултати које је пријавио произвођач, а не тест који је BIG CHANGE поновио.
Граница од осам говорника и даље је важна. Неки снимци у скупу DIHARD III означени су са највише девет говорника, а у картици се наводи да говор изнад осам канала модела може бити пропуштен или додељен другом каналу. За тестне снимке AMI-ја NVIDIA наводи нижу стопу грешке раздвајања говорника за Nemotron 3 него за ранији основни модел, али и нижу тачност утврђивања тачног броја говорника. Тачност зато зависи од задатка и мерила, као и од звука. Тим који разматра интеграцију модела може да почне од јавно документованих NVIDIA-иних интерфејса и тестира цео поступак означавања говорника и речи на снимцима сличним онима за које намерава да га користи.
## Sources
- [NVIDIA: Nemotron 3 Diarization model card](https://huggingface.co/nvidia/Nemotron-3-Diarization) — Примарна спецификација датума објаве, величине од око 100 милиона параметара, улаза, излаза, подешавања преноса уживо и табела NVIDIA-ине евалуације. Мерења тачности и брзине пријавио је произвођач; наведено подешавање од 0,32 секунде односи се на улазни бафер и не обухвата обраду.
- [NVIDIA: “Know Who Spoke When” release blog](https://huggingface.co/blog/nvidia/nemotron-diarization) — Датирани опис издања објашњава канале говорника према редоследу појављивања и показује како се генерички интервали говорника спајају са засебним излазом система за аутоматско препознавање говора. Пример са средњом тачком означава преклапање као нејасно и представља једноставну хеуристику, а не проверен резултат транскрипције.
- [NVIDIA: додатна картица за евалуацију раздвајања говорника](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — Наводи NeMo скрипту за евалуацију, захтев за референтну RTTM датотеку, правила о преклапању и граничном интервалу и податке потребне за приказ упоредиве стопе грешке раздвајања говорника. Реч је о протоколу, а не независно поновљеном тесту.
- [OpenMDW License Agreement, Version 1.1](https://openmdw.ai/license/1-1/) — Дозволе и обавезе: бесплатна употреба и даља дистрибуција материјала модела под наведеним условима, задржавање лиценце и обавештења о пореклу приликом дистрибуције, без ограничења за генерисане излазе и уз одговорност корисника за прибављање потребних права и сагласности.
- [NVIDIA NeMo-Speech.cpp command-line guide](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — Документује локалну раздвајање говорника преко командне линије и раније ограничење од четири говорника у V2 наспрам осам у V3. Подршка командне линије не доказује да је наша редакција покренула модел нити потврђује брзину NeMo бенцхмарк-а из картице модела.
Билтен BIG CHANGE
Шира слика. Вашим темпом.
Недавне приче о вештачкој интелигенцији и роботици, промене вредне праћења и практичне идеје за примену. Изаберите дневни преглед, недељни сажетак или месечну перспективу.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Ваша приватност, ваш избор.
Неопходно складиште доприноси безбедности сајта и памти ваше изборе. Опционални Google Analytics остаје искључен док га не дозволите. Све чланке можете читати само уз неопходно складиштење података. Детаљи о приватности