EL MUNDO NO SE DETIENE.RSS
BIG CHANGE.

Edición en Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# NVIDIA lanza Nemotron 3 Diarization para audio con hasta ocho hablantes

> El modelo de diarización de pesos abiertos de NVIDIA, anunciado el 23 de septiembre, etiqueta hasta ocho hablantes en audio grabado o en streaming. Su ajuste recomendado más breve, de 0,32 segundos, mide el audio almacenado en búfer; las cifras de precisión proceden de las propias pruebas de NVIDIA.

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA lanzó [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) el 23 de septiembre. El modelo de pesos abiertos, de unos 100 millones de parámetros, marca cuándo habla cada uno de hasta ocho interlocutores en audio grabado o en streaming. Ofrece a los desarrolladores actividad por hablante y marcas de tiempo de una conversación; para generar una transcripción con palabras también se necesita reconocimiento de voz.

## El gran cambio

- **Qué ha cambiado:** El punto de control anterior de Sortformer para streaming de NVIDIA admite cuatro hablantes. Esta versión ofrece ocho canales de hablante asignados en orden de aparición desde un único punto de control, compatible tanto con audio grabado como con fragmentos entrantes.
- **Por qué importa:** Un desarrollador que cree un sistema para transcribir reuniones o llamadas puede usar el modelo para asignar etiquetas genéricas de hablante a intervalos de tiempo, incluso cuando hay voces superpuestas, y después combinarlos con las palabras de un reconocedor independiente. El lanzamiento amplía el límite de hablantes documentado para esa tarea.
- **Qué conviene observar:** La decisión práctica es cuánto audio almacenar en búfer antes de cada resultado de streaming. El ajuste recomendado más breve de NVIDIA espera 0,32 segundos de audio antes de empezar el cálculo, y sus propias tablas de precisión muestran el coste de usarlo. Los equipos aún deben medir el flujo completo con sus grabaciones.

## Qué devuelve el modelo

La [ficha del modelo](https://huggingface.co/nvidia/Nemotron-3-Diarization) especifica audio mono a 16 kHz. Enumera archivos WAV, FLAC, Opus y MP3; la interfaz de NeMo acepta rutas de archivos, matrices de audio o un manifiesto JSON delimitado por líneas. Para las matrices de audio, hay que indicar la frecuencia de muestreo correcta para `diarize()`. La inferencia por fragmentos no tiene una duración máxima fija en la ficha.

El modelo convierte el audio en un tensor con forma `[T, 8]` que contiene probabilidades de actividad por hablante, con un intervalo de salida predeterminado de 10 milisegundos. Varios canales pueden estar activos al mismo tiempo si las voces se superponen. El posprocesamiento convierte esas probabilidades en intervalos con horas de inicio y fin, y etiquetas genéricas de hablante. Las etiquetas siguen el orden en que aparecen las voces por primera vez; no identifican a las personas por su nombre. NVIDIA usa una caché de hablantes para los fragmentos anteriores y una cola de primero en entrar, primero en salir para los fotogramas recientes, de modo que el modelo de streaming conserve el contexto.

Para quien desarrolla una transcripción con etiquetas de hablante, esa distinción es importante. La [guía de integración de NVIDIA](https://huggingface.co/blog/nvidia/nemotron-diarization) combina las marcas de tiempo de la diarización con el resultado de un sistema independiente de reconocimiento automático del habla. Su regla de ejemplo, basada en el punto medio, deja una palabra sin asignar cuando no hay ningún hablante activo y marca como ambigua la actividad simultánea. El modelo de diarización por sí solo no determina qué voz superpuesta produjo una palabra reconocida.

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## El tiempo de búfer no es el tiempo de respuesta

NVIDIA recomienda ajustes de búfer de entrada de 30,4, 1,04, 0,64 y 0,32 segundos. El ajuste de 0,32 segundos consta de tres tramas de procesamiento de 80 milisegundos y una trama de contexto futuro de 80 milisegundos. La [ficha define explícitamente la latencia](https://huggingface.co/nvidia/Nemotron-3-Diarization) como el audio retenido antes de la inferencia; no incluye el cálculo. Un sistema de transcripción añadiría también el tiempo de reconocimiento, transporte y aplicación.

La ruta documentada de NeMo requiere Python 3.12 o posterior, Cython, una versión reciente de PyTorch y NeMo Speech. NVIDIA ofrece, como ejemplo, la llamada `SortformerEncLabelModel.from_pretrained()`, y una llamada `diarize()` que devuelve segmentos de hablante y permite activar los tensores de probabilidades. La ficha indica que se necesita un token de Hugging Face para cargar el punto de control alojado mediante esa llamada de NeMo. También muestra interfaces de Transformers para uso local y en streaming, que requieren instalar desde el repositorio de origen de Transformers, además de una ruta de línea de comandos con [NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). Son interfaces documentadas; BIG CHANGE no las ha ejecutado. La ficha del modelo enumera Linux y las familias de GPU NVIDIA Ampere, Hopper y Blackwell para su integración con NeMo. Las necesidades de hardware y el coste de procesamiento de una carga concreta dependen de la ruta y el equipo elegidos; la ficha no da un precio de operación por hora.

Los pesos se ofrecen bajo la licencia [OpenMDW 1.1](https://openmdw.ai/license/1-1/). La licencia permite usar, modificar y distribuir el modelo sin pagar una tarifa de licencia, con sujeción a sus términos. Al distribuirlo hay que conservar la licencia y los avisos de origen pertinentes. La licencia no restringe el uso ni la difusión de los resultados y responsabiliza a los usuarios de obtener los derechos y consentimientos que pueda requerir su audio. NVIDIA describe el modelo como apto para usos comerciales y no comerciales.

## Qué midió NVIDIA

La [evaluación de la ficha del modelo](https://huggingface.co/nvidia/Nemotron-3-Diarization) compara Nemotron 3 con la versión anterior Sortformer v2.1 para streaming, que admite cuatro hablantes. En el conjunto completo de evaluación DIHARD III, NVIDIA informa de una tasa de error de diarización del 13,18 % para Nemotron 3 con un búfer de entrada de 1,04 segundos, frente al 19,60 % del modelo anterior con el mismo ajuste de búfer declarado. Con 0,32 segundos, el resultado de Nemotron 3 es del 13,55 %. La tasa de error de diarización combina el habla omitida, las falsas alarmas y la confusión entre hablantes, y la divide por el tiempo de referencia de los hablantes. Un valor menor es mejor.

Esas cifras corresponden a un protocolo definido. NVIDIA indica que todas sus evaluaciones puntúan el habla superpuesta. DIHARD III usa un margen de tolerancia de cero segundos en los límites, mientras que CALLHOME-Part2 usa uno de 0,25 segundos. Para AMI, AliMeeting y NOTSOFAR1, NVIDIA usa anotaciones de referencia vinculadas y alineadas de forma forzada, en vez de las etiquetas de segmentos originales; cambiar esas etiquetas cambia los resultados. Las [instrucciones de evaluación](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) identifican el script de NeMo y exigen un archivo de referencia RTTM, el ajuste de superposición, el margen de tolerancia, los parámetros de streaming y los detalles del posprocesamiento para que una prueba sea comparable. NVIDIA midió la velocidad de inferencia en precisión BF16 con una RTX PRO 5000, con y sin `torch.compile()`. Son pruebas comunicadas por el proveedor, no una reproducción de BIG CHANGE.

El límite de ocho hablantes sigue siendo importante. DIHARD III incluye grabaciones anotadas con hasta nueve hablantes, y la ficha indica que el habla que supere los ocho canales del modelo puede omitirse o asignarse a otro canal. En las grabaciones de prueba de AMI, NVIDIA informa que Nemotron 3 tiene un error de diarización menor que su referencia anterior, aunque su precisión exacta al contar hablantes es más baja. Por tanto, la precisión depende de la tarea y la métrica, además del audio. Un equipo que decida integrar el modelo puede partir de las interfaces publicadas por NVIDIA y probar el flujo completo de hablantes y palabras con grabaciones similares a las de su uso previsto.

## Sources

- [NVIDIA: ficha del modelo Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) — Especificación primaria de la fecha de lanzamiento, el tamaño de unos 100 millones de parámetros, las entradas y salidas, las configuraciones de streaming y las tablas de evaluación de NVIDIA. El proveedor informa las medidas de precisión y velocidad; el ajuste de 0,32 segundos corresponde al búfer de entrada y no incluye el cálculo.
- [NVIDIA: artículo de lanzamiento «Know Who Spoke When»](https://huggingface.co/blog/nvidia/nemotron-diarization) — El artículo de lanzamiento, fechado, explica los canales de hablante en orden de aparición y muestra cómo combinar intervalos genéricos por hablante con un resultado independiente de reconocimiento automático del habla. El ejemplo de correspondencia por punto medio marca la superposición como ambigua y es una heurística sencilla, no un resultado validado de transcripción.
- [NVIDIA: subficha de evaluación de diarización](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — Especifica el script de evaluación de NeMo, el requisito de contar con una referencia RTTM, el tratamiento de superposiciones y márgenes, y los campos necesarios para informar una tasa de error de diarización comparable. Es un documento sobre el protocolo, no una reproducción independiente.
- [Acuerdo de licencia OpenMDW, versión 1.1](https://openmdw.ai/license/1-1/) — Permisos y obligaciones aplicables: uso y redistribución gratuitos de los materiales del modelo según los términos, conservación de la licencia y los avisos de origen al distribuirlo, ausencia de restricciones sobre los resultados generados y responsabilidad del usuario de obtener los derechos y consentimientos necesarios.
- [Guía de línea de comandos de NVIDIA NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — Documenta la diarización mediante una interfaz local de línea de comandos y el límite anterior de cuatro hablantes en V2 frente al de ocho en V3. La compatibilidad con la línea de comandos no demuestra que esta redacción haya ejecutado el modelo ni establece la velocidad de referencia de NeMo indicada en la ficha.