AI-translated from English; not yet reviewed by a fluent editor.

# NVIDIA lance Nemotron 3 Diarization, un modèle capable de distinguer jusqu’à huit voix dans les enregistrements audio

> Le modèle de diarisation à poids ouverts de NVIDIA, publié le 23 septembre, attribue une étiquette à huit locuteurs au maximum dans des enregistrements ou des flux audio. Le réglage minimal recommandé de 0,32 seconde correspond à la mise en tampon de l’entrée ; les chiffres de précision proviennent des propres tests de NVIDIA.

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA a lancé [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) le 23 septembre. Ce modèle à poids ouverts, d’environ 100 millions de paramètres, indique quand chacune des huit voix au maximum intervient dans un enregistrement ou un flux audio. Il fournit aux développeurs l’activité des locuteurs et des horodatages ; pour obtenir aussi la transcription des mots, il faut recourir à un système distinct de reconnaissance vocale.

## Le changement majeur

- **Ce qui a changé :** Le précédent point de contrôle Sortformer de NVIDIA pour le traitement en continu prenait en charge quatre locuteurs. Cette version fournit huit canaux de locuteurs, ordonnés selon leur première apparition, à partir d’un seul point de contrôle compatible avec les enregistrements et les blocs audio reçus en flux.
- **Pourquoi c’est important :** Un développeur qui crée un système de transcription de réunions ou d’appels peut utiliser le modèle pour attribuer des étiquettes génériques de locuteur à des intervalles temporels, y compris lorsque les voix se chevauchent, puis combiner ces intervalles avec les mots produits par un système de reconnaissance distinct. Cette version relève la limite documentée du nombre de locuteurs pour cette tâche.
- **À surveiller :** Le choix pratique consiste à déterminer quelle quantité d’audio mettre en tampon avant chaque résultat en continu. Le réglage minimal recommandé par NVIDIA attend 0,32 seconde d’audio avant de commencer le calcul, et ses propres tableaux de précision montrent le coût de ce réglage. Les équipes doivent toujours mesurer la chaîne complète sur leurs propres enregistrements.

## Ce que renvoie le modèle

La [fiche du modèle](https://huggingface.co/nvidia/Nemotron-3-Diarization) précise que l’audio doit être mono et échantillonné à 16 kHz. Elle répertorie les fichiers WAV, FLAC, Opus et MP3 ; l’interface NeMo accepte les chemins de fichiers, les tableaux audio ou un manifeste JSON délimité par des retours à la ligne. Pour les tableaux audio, il faut transmettre le taux d’échantillonnage correct à la fonction `diarize()`. L’inférence par blocs n’a pas de durée maximale fixe dans la fiche.

Le modèle convertit l’audio en un tenseur de forme `[T, 8]` contenant les probabilités d’activité des locuteurs, avec un pas de sortie de 10 millisecondes par défaut. Plusieurs canaux peuvent être actifs simultanément lorsque des personnes parlent en même temps. Le post-traitement transforme ces probabilités en intervalles avec des heures de début et de fin ainsi que des étiquettes génériques de locuteur. Les étiquettes suivent l’ordre d’apparition des voix ; elles ne permettent pas d’identifier les personnes par leur nom. NVIDIA utilise un cache des locuteurs pour les blocs précédents et une file « premier entré, premier sorti » pour les trames récentes, afin que le modèle en continu conserve le contexte.

Pour un développeur qui a besoin d’une transcription attribuée aux différents locuteurs, cette distinction est importante. [Le guide d’intégration de NVIDIA](https://huggingface.co/blog/nvidia/nemotron-diarization) associe les horodatages de la diarisation à la sortie d’un système distinct de reconnaissance automatique de la parole. Dans son exemple, la règle du point milieu laisse un mot sans attribution lorsqu’aucun locuteur n’est actif et signale les activités simultanées comme ambiguës. Le seul modèle de diarisation ne détermine pas laquelle des voix qui se chevauchent a produit un mot reconnu.

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## Le temps de mise en tampon n’est pas le temps de réponse

NVIDIA recommande des durées de mise en tampon de l’entrée de 30,4, 1,04, 0,64 et 0,32 seconde. Le réglage à 0,32 seconde comprend trois trames de traitement de 80 millisecondes et une trame de contexte droit de 80 millisecondes. La [fiche définit explicitement la latence](https://huggingface.co/nvidia/Nemotron-3-Diarization) comme la durée pendant laquelle l’audio est conservé avant l’inférence ; le calcul est exclu. Un système de transcription ajoute aussi le temps nécessaire à la reconnaissance, au transport et à l’application.

Le parcours documenté avec NeMo nécessite Python 3.12 ou une version ultérieure, Cython, une version récente de PyTorch et NeMo Speech. NVIDIA fournit un exemple avec `SortformerEncLabelModel.from_pretrained()`, un appel à `diarize()` qui renvoie des segments de locuteurs, ainsi qu’une option pour inclure les tenseurs de probabilités. Selon la fiche, un jeton Hugging Face est nécessaire pour charger le point de contrôle hébergé avec cet appel NeMo. Elle présente également une interface Transformers hors ligne et en continu, qui nécessite l’installation depuis le dépôt source de Transformers, ainsi qu’une [commande en ligne de commande NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). Il s’agit des interfaces documentées ; BIG CHANGE ne les a pas exécutées. Pour son intégration avec NeMo, la fiche du modèle répertorie Linux et les familles de GPU NVIDIA Ampere, Hopper et Blackwell. Les besoins matériels et le coût de traitement d’une charge de travail donnée dépendent de la méthode et de la machine choisies ; NVIDIA ne donne pas de tarif d’exploitation par heure dans la fiche.

Les poids sont proposés sous la licence [OpenMDW 1.1](https://openmdw.ai/license/1-1/). La licence autorise l’utilisation, la modification et la distribution sans frais de licence, sous réserve de ses conditions. Toute distribution doit conserver la licence et les mentions d’origine applicables. La licence ne restreint ni l’utilisation ni le partage des résultats générés ; elle confie aux utilisateurs la responsabilité d’obtenir les droits et consentements éventuellement nécessaires pour leurs enregistrements audio. NVIDIA indique que le modèle peut être utilisé à des fins commerciales et non commerciales.

## Ce qu’a mesuré NVIDIA

L’évaluation de la [fiche du modèle](https://huggingface.co/nvidia/Nemotron-3-Diarization) compare Nemotron 3 à son précédent modèle Sortformer v2.1 pour le traitement en continu, limité à quatre locuteurs. Sur l’ensemble d’évaluation DIHARD III, NVIDIA indique un taux d’erreur de diarisation de 13,18 % pour Nemotron 3 avec une mise en tampon de l’entrée de 1,04 seconde, contre 19,60 % pour l’ancien modèle avec le même réglage annoncé. À 0,32 seconde, le résultat de Nemotron 3 est de 13,55 %. Le taux d’erreur de diarisation combine la parole manquée, les fausses détections et les confusions entre locuteurs, puis divise le tout par la durée de référence de parole. Plus ce taux est bas, mieux c’est.

Ces chiffres correspondent à un protocole défini. NVIDIA indique que toutes ses évaluations prennent en compte le chevauchement des voix. DIHARD III utilise une marge de tolérance de zéro seconde aux frontières, tandis que CALLHOME-Part2 utilise une marge de 0,25 seconde. Pour AMI, AliMeeting et NOTSOFAR1, NVIDIA utilise des annotations de référence liées et alignées de force plutôt que les étiquettes de segments d’origine ; modifier ces étiquettes change les scores. Les [instructions d’évaluation](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) indiquent le script NeMo et exigent un fichier RTTM de référence, le réglage du chevauchement, la marge de tolérance, les paramètres de traitement en continu et les détails du post-traitement pour obtenir une exécution comparable. Les mesures de vitesse d’inférence de NVIDIA ont été réalisées en BF16 sur un RTX PRO 5000, avec et sans `torch.compile()`. Ce sont des tests rapportés par le fournisseur, et non une reproduction de BIG CHANGE.

La limite de huit locuteurs reste importante. Certains enregistrements de DIHARD III sont annotés avec jusqu’à neuf locuteurs, et la fiche précise que les voix au-delà des huit canaux du modèle peuvent être omises ou attribuées à un autre canal. Pour les enregistrements de test AMI, NVIDIA signale un taux d’erreur de diarisation inférieur avec Nemotron 3 par rapport à son ancien modèle, mais une précision exacte du nombre de locuteurs plus faible. La précision dépend donc de la tâche, de la mesure et de l’audio. Une équipe qui envisage d’intégrer le modèle peut partir des interfaces publiées par NVIDIA et tester l’ensemble de la chaîne, des locuteurs aux mots, sur des enregistrements représentatifs de son usage prévu.

## Sources

- [NVIDIA : fiche du modèle Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) —  Spécification principale concernant la date de sortie, la taille d’environ 100 millions de paramètres, les entrées, la sortie, les configurations de traitement en continu et les tableaux d’évaluation de NVIDIA. Les mesures de précision et de vitesse proviennent du fournisseur ; le réglage annoncé à 0,32 seconde correspond à la mise en tampon de l’entrée et exclut le calcul.
- [NVIDIA : article de lancement « Know Who Spoke When »](https://huggingface.co/blog/nvidia/nemotron-diarization) —  Le compte rendu daté du lancement explique l’ordre d’arrivée des canaux de locuteur et montre comment combiner des intervalles génériques de locuteurs avec la sortie d’un système ASR distinct. Dans l’exemple d’association par point milieu, les chevauchements sont signalés comme ambigus ; il s’agit d’une heuristique simple, et non d’un résultat de transcription validé.
- [NVIDIA : sous-fiche sur l’évaluation de la diarisation](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) —  Précise le script d’évaluation NeMo, l’exigence d’un fichier RTTM de référence, la sémantique du chevauchement et de la marge de tolérance, ainsi que les champs à communiquer pour présenter un taux d’erreur de diarisation comparable. C’est un document décrivant le protocole, pas une reproduction indépendante.
- [Contrat de licence OpenMDW, version 1.1](https://openmdw.ai/license/1-1/) —  Autorisations et obligations applicables : utilisation et redistribution gratuites des éléments du modèle selon les conditions, conservation de la licence et des mentions d’origine lors de la distribution, absence de restrictions sur les résultats générés et responsabilité de l’utilisateur concernant les droits et consentements nécessaires.
- [Guide de ligne de commande NVIDIA NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) —  Documente la diarisation en ligne de commande locale et la limite de quatre locuteurs de la version V2 précédente, contre huit pour la V3. La prise en charge de la ligne de commande ne démontre pas que cette rédaction a exécuté le modèle et n’établit pas la vitesse de référence NeMo indiquée dans la fiche.
