Markdown 版本
AI-translated from English; not yet reviewed by a fluent editor.
# 英伟达发布 Nemotron 3 Diarization,可区分最多八名说话者
> 英伟达于 9 月 23 日发布了这款开放权重说话人分离模型,可为录制音频或流式音频中的最多八名说话者标注语音。其建议的最短 0.32 秒设置衡量的是缓冲输入时长;准确率数据来自英伟达自己的测试。
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
英伟达发布了[Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization)模型,时间为 9 月 23 日。这款开放权重模型约有 1 亿个参数,可标记录制或流式音频中最多八名说话者各自发言的时间。它会为对话中的说话者活动和时间戳提供标记;若要生成带文字内容的转录,还需要语音识别。
## 主要变化
- **发生了什么变化:**英伟达此前的流式 Sortformer 检查点支持四名说话者。此次发布的单一检查点提供八个按说话者首次出现顺序排列的说话人通道,同时适用于录制音频和传入的音频块。
- **为何重要:**开发会议或通话转录工具的人,可以用该模型为时间段分配通用说话人标签,包括多人重叠发言的时间段,再将这些时间段与另一个识别器输出的文字结合。此次发布扩大了该任务公开标注的说话人数上限。
- **接下来关注什么:**实际使用时,需要决定在每次流式处理结果生成前缓冲多少音频。英伟达建议的最短设置要先等待 0.32 秒音频才开始计算,而其准确率表显示,采用这一设置会带来代价。团队仍需在自己的录音上测量完整处理流程。
## 模型会返回什么
该[模型卡](https://huggingface.co/nvidia/Nemotron-3-Diarization)规定输入为 16 kHz 单声道音频。它列出了 WAV、FLAC、Opus 和 MP3 文件格式;NeMo 接口接受文件路径、音频数组或逐行 JSON 清单。传入音频数组时,必须向`diarize()`调用时传入正确的采样率。模型卡没有为分块推理设定固定的最长录音时长。
模型会将音频转换为一个`[T, 8]`说话人活动概率张量,默认输出步长为 10 毫秒。多人重叠发言时,多个通道可以同时处于活动状态。后处理会将这些概率转换为带有起止时间和通用说话人标签的区间。标签按声音首次出现的顺序排列,并不用于识别说话者的姓名。英伟达使用说话人缓存保存较早音频块的信息,并通过先进先出队列处理近期帧,使流式模型能够保留上下文。
对于需要生成带说话人标记转录的开发者来说,这一区别很重要。[英伟达的集成指南](https://huggingface.co/blog/nvidia/nemotron-diarization)会将说话人分离时间戳与单独的自动语音识别输出配对。示例中的中点规则规定:没有说话人处于活动状态时,不给词语分配说话人;多人同时发言时,则标记为含糊不清。单靠说话人分离模型,无法判定识别出的词语究竟由哪位重叠发言者说出。

## 缓冲时长不等于响应时间
英伟达列出的建议输入缓冲设置为 30.4、1.04、0.64 和 0.32 秒。0.32 秒设置由三个 80 毫秒处理帧和一个 80 毫秒右侧上下文帧组成。[模型卡明确将延迟定义为](https://huggingface.co/nvidia/Nemotron-3-Diarization)推理前保留的音频时长,不包括计算时间。转录系统还会增加识别、传输和应用处理时间。
文档说明,NeMo 路径需要 Python 3.12 或更高版本、Cython、较新的 PyTorch 版本和 NeMo Speech。英伟达提供了一个`SortformerEncLabelModel.from_pretrained()`示例,以及一个`diarize()`返回说话人片段的调用,并提供用于包含概率张量的开关。模型卡称,通过该 NeMo 调用加载托管检查点需要 Hugging Face 令牌。它还展示了离线和流式 Transformers 接口,安装方式是从 Transformers 源代码仓库安装;此外还提供了[NeMo-Speech.cpp 命令行方案](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md)。这些都是文档列出的接口;BIG CHANGE 并未实际运行。模型卡为 NeMo 集成列出了 Linux 系统,以及 NVIDIA Ampere、Hopper 和 Blackwell GPU 系列。特定工作负载所需的硬件和处理成本取决于所选方案和机器;英伟达没有在模型卡中列出每小时运行价格。
这些权重依据[OpenMDW 1.1 许可](https://openmdw.ai/license/1-1/)提供。根据许可条款,使用、修改和分发均无需支付许可费。分发时必须保留许可文本和适用的来源声明。许可不限制使用或分享输出内容,并要求用户自行确保其音频所需的权利和同意。英伟达称,该模型可用于商业和非商业用途。
## 英伟达测量了什么
英伟达的[模型卡评估](https://huggingface.co/nvidia/Nemotron-3-Diarization)将 Nemotron 3 与较早的四人流式 Sortformer v2.1 进行比较。在完整 DIHARD III 评测集上,英伟达报告称,Nemotron 3 在 1.04 秒输入缓冲设置下的说话人分离错误率为 13.18%;较早模型在相同标注缓冲设置下为 19.60%。缓冲为 0.32 秒时,Nemotron 3 的结果为 13.55%。说话人分离错误率将漏检语音、误报和说话人混淆合并后,除以参考说话人时长。数值越低越好。
这些数字对应一套明确的测试规程。英伟达称,所有评估都会对重叠语音计分。DIHARD III 使用零秒边界容差,而 CALLHOME-Part2 使用 0.25 秒容差。对于 AMI、AliMeeting 和 NOTSOFAR1,英伟达使用经过关联并强制对齐的参考标注,而非原始分段标签;更改这些标签会改变分数。[评估说明](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md)列明了 NeMo 脚本,并要求提供参考 RTTM 文件、重叠语音设置、边界容差、流式设置和后处理细节,才能进行可比测试。英伟达的推理速度结果是在 RTX PRO 5000 上以 BF16 测得,分别测试了启用和未启用`torch.compile()`。这些是厂商报告的测试,并非 BIG CHANGE 的复现实验。
八名说话者的上限仍然重要。DIHARD III 包含一些标注了多达九名说话者的录音;模型卡称,超出模型八个通道范围的语音可能被漏掉,或分配给其他通道。在 AMI 测试录音上,英伟达报告称,与此前基线相比,Nemotron 3 的说话人分离错误率更低,但准确判断说话人数的能力也更低。因此,准确性取决于任务和衡量指标,也取决于音频本身。考虑是否集成该模型的团队,可以先参考英伟达公开的接口,再用符合预期用途的录音测试完整的说话人和文字处理流程。
## Sources
- [英伟达:Nemotron 3 Diarization 模型卡](https://huggingface.co/nvidia/Nemotron-3-Diarization) — 有关发布时间、约 1 亿参数的模型规模、输入、输出、流式配置和英伟达评估表的主要规格来源。准确率和速度数据由厂商报告;文中 0.32 秒设置指输入缓冲时间,不包括计算时间。
- [英伟达:《知道是谁在何时说话》发布文章](https://huggingface.co/blog/nvidia/nemotron-diarization) — 带日期的发布说明介绍了按说话者首次出现顺序排列的通道,并展示如何将通用说话人区间与单独的 ASR 输出结合。文中的中点匹配示例会将重叠语音标为含糊不清;这是一种简单启发式方法,并非经过验证的转录结果。
- [英伟达:说话人分离评估子卡](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — 说明了 NeMo 评估脚本、参考 RTTM 要求、重叠语音和边界容差的含义,以及报告可比说话人分离错误率所需的字段。这是一份测试规程文档,并非独立复现实验。
- [OpenMDW 许可协议,1.1 版](https://openmdw.ai/license/1-1/) — 规定的许可和义务包括:依据条款免费使用和再分发模型材料;分发时保留许可和来源声明;对生成的输出不设限制;用户负责取得所需权利和同意。
- [英伟达 NeMo-Speech.cpp 命令行指南](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — 记录了本地命令行说话人分离功能,以及此前 V2 版本支持四名、V3 版本支持八名说话者的上限。命令行支持并不能证明本新闻编辑室运行了该模型,也不能验证模型卡中的 NeMo 基准速度。
BIG CHANGE 新闻通讯
纵览全局,按自己的节奏。
关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.