AI-translated from English; not yet reviewed by a fluent editor.

# NVIDIA 推出 Nemotron 3 說話者分離模型，支援最多八人語音

> NVIDIA 於 9 月 23 日推出開放權重說話者分離模型 Nemotron 3，可為錄音或串流音訊標示最多八位說話者。最短建議的 0.32 秒設定是輸入緩衝時間；準確度數據則來自 NVIDIA 自行測試。

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA 於 9 月 23 日推出[Nemotron 3 說話者分離模型](https://huggingface.co/nvidia/Nemotron-3-Diarization)。這款約有 1 億參數的開放權重模型，可標示最多八位說話者在錄音或串流音訊中的發言時段。它會提供對話中各說話者的活動資訊與時間戳記；若要產生包含文字內容的逐字稿，還需要另外使用語音辨識模型。

## 核心變化

- **有哪些改變：**NVIDIA 先前的 Sortformer 串流檢查點最多支援四位說話者。這次發布的模型則透過同一個檢查點提供依聲音出現順序排列的八個說話者通道，並可處理錄音檔與即時輸入的音訊區塊。
- **為何重要：**開發會議或通話逐字稿服務的人，可用此模型將時間區間標記為通用說話者代號，也涵蓋多人同時發言的情況；接著再把這些區間與另一個語音辨識模型產生的文字結合。這次發布提高了該任務公開規格中的說話者人數上限。
- **後續觀察重點：**實際使用時，開發者必須決定每次產生串流結果前要緩衝多少音訊。NVIDIA 建議的最短設定是在開始運算前等待 0.32 秒音訊；其自家準確度表也顯示，採用這項設定會付出一定代價。團隊仍須使用符合實際情境的錄音，測試完整處理流程。

## 模型會輸出什麼

這份[模型卡](https://huggingface.co/nvidia/Nemotron-3-Diarization)指定音訊格式為 16 kHz、單聲道，並列出 WAV、FLAC、Opus 及 MP3 檔案格式。NeMo 介面可接受檔案路徑、音訊陣列，或以逐行分隔的 JSON 清單提供資料。使用音訊陣列時，必須在`diarize()`呼叫時須傳入正確的取樣率。模型卡未為分塊推論設定固定的最長錄音時間。

模型會將音訊轉換為`[T, 8]`說話者活動機率張量，預設輸出步長為 10 毫秒。多人重疊發言時，多個通道可同時啟用。後處理會將機率轉成含起訖時間的區間，並附上通用說話者代號。代號依聲音首次出現的順序排列，不能辨識說話者的真實姓名。NVIDIA 使用說話者快取保留較早區塊的資訊，並以先進先出佇列保存近期影格，讓串流模型得以延續上下文。

對需要產生含說話者標記逐字稿的開發者來說，這項區分很關鍵。[NVIDIA 的整合指南](https://huggingface.co/blog/nvidia/nemotron-diarization)會將說話者分離的時間戳記與另一個自動語音辨識系統的輸出結合。指南中的範例採用時間中點比對規則：若當下沒有啟用中的說話者，就不指派該詞；若多個說話者同時發言，則標為不明確。說話者分離模型本身不會判定辨識出的詞是由哪一個重疊發言者說出。

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## 緩衝時間不等於回應時間

NVIDIA 列出的建議輸入緩衝設定為 30.4、1.04、0.64 與 0.32 秒。0.32 秒設定由三個 80 毫秒處理影格，以及一個 80 毫秒的右側上下文影格組成。模型[卡片明確將延遲定義為](https://huggingface.co/nvidia/Nemotron-3-Diarization)推論前保留音訊的時間，不包括運算時間。逐字稿系統還會增加語音辨識、傳輸及應用程式處理時間。

文件記載的 NeMo 流程需要 Python 3.12 或更新版本、Cython、近期版本的 PyTorch，以及 NeMo Speech。NVIDIA 提供`SortformerEncLabelModel.from_pretrained()`範例，以及一個`diarize()`會回傳說話者片段的呼叫，並可選擇輸出機率張量。模型卡指出，透過該 NeMo 呼叫載入託管檢查點需要 Hugging Face 權杖。文件也提供離線與串流 Transformers 介面，並要求從 Transformers 原始碼儲存庫安裝；另外還有[NeMo-Speech.cpp 命令列方式](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md)。以上都是文件記載的介面；BIG CHANGE 並未實際執行。模型卡列出 NeMo 整合所需的 Linux 環境，以及 NVIDIA Ampere、Hopper 或 Blackwell GPU。特定工作負載的硬體需求與處理成本，取決於所選流程及機器；模型卡未提供每小時運算價格。

模型權重採用[OpenMDW 1.1](https://openmdw.ai/license/1-1/)授權。依授權條款，使用者可免費使用、修改及散布模型，但散布時須保留授權及適用的來源聲明。授權不限制使用或分享模型輸出，並由使用者負責確認音訊所需的權利與同意。NVIDIA 表示，模型可供商業及非商業用途使用。

## NVIDIA 測量了什麼

NVIDIA 的[模型卡評估](https://huggingface.co/nvidia/Nemotron-3-Diarization)將 Nemotron 3 與先前支援四位說話者的串流模型 Sortformer v2.1 比較。在完整 DIHARD III 評估集上，NVIDIA 報告 Nemotron 3 使用 1.04 秒輸入緩衝時，說話者分離錯誤率為 13.18%；先前模型使用同一緩衝設定時為 19.60%。Nemotron 3 在 0.32 秒設定下的結果為 13.55%。說話者分離錯誤率將漏失語音、誤報及說話者混淆時間相加，再除以參考說話者總時長；數值越低越好。

這些數據只適用於特定評估規範。NVIDIA 表示，所有評估都計入重疊語音。DIHARD III 使用零秒邊界容差，CALLHOME-Part2 則使用 0.25 秒容差。在 AMI、AliMeeting 與 NOTSOFAR1 資料集上，NVIDIA 使用經連結並強制對齊的參考標註，而非原始片段標籤；更換標籤也會改變分數。[評估說明](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md)列出 NeMo 指令碼，並要求提供參考 RTTM 檔、重疊語音設定、邊界容差、串流設定及後處理細節，才能進行可比較的測試。NVIDIA 的推論速度測試以 BF16 在 RTX PRO 5000 上執行，並比較兩種設定下的結果`torch.compile()`。這些是廠商自行報告的測試結果，並非 BIG CHANGE 重現的結果。

八位說話者的人數上限仍然重要。DIHARD III 部分錄音標註多達九位說話者；模型卡指出，超過八個通道可處理範圍的語音可能會漏掉，或被分配至其他通道。在 AMI 測試錄音上，NVIDIA 報告 Nemotron 3 的說話者分離錯誤率低於舊版基準模型，但精確判斷說話者人數的準確率較低。因此，準確度會因任務、衡量指標及音訊內容而異。要決定是否整合此模型，團隊可先參考 NVIDIA 公布的介面，再用符合預定用途的錄音測試整套說話者與文字處理流程。

## Sources

- [NVIDIA：Nemotron 3 說話者分離模型卡](https://huggingface.co/nvidia/Nemotron-3-Diarization) — 主要規格來源，涵蓋發布日期、約 1 億參數的模型規模、輸入、輸出、串流設定及 NVIDIA 評估表。準確度和速度均為廠商自行報告；所述 0.32 秒設定是輸入緩衝時間，不含運算。
- [NVIDIA：辨識誰在何時說話的發布文章](https://huggingface.co/blog/nvidia/nemotron-diarization) — 發布文章說明依聲音出現順序排列的說話者通道，並示範如何將通用說話者區間與另一個語音辨識系統的輸出結合。其時間中點比對範例會將重疊發言標示為不明確；這是簡易判定規則，並非經驗證的逐字稿結果。
- [NVIDIA：說話者分離評估附卡](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — 列出 NeMo 評估指令碼、參考 RTTM 檔、重疊語音及邊界容差的定義，以及回報可比較說話者分離錯誤率所需的欄位。這是評估規範文件，並非獨立重現的測試。
- [OpenMDW 授權協議第 1.1 版](https://openmdw.ai/license/1-1/) — 列出適用的授權許可與義務：依條款免費使用及再散布模型資料、散布時保留授權與來源聲明、不限制生成輸出，並由使用者負責確認所需權利及同意。
- [NVIDIA NeMo-Speech.cpp 命令列指南](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — 說明本機命令列的說話者分離流程，以及先前 V2 四人、V3 八人的支援上限。提供命令列介面不代表本新聞室曾執行模型，也不能證實模型卡所列的 NeMo 基準速度。
