A NVIDIA lançou o Nemotron 3 Diarization em 23 de setembro. O modelo de pesos abertos, com cerca de 100 milhões de parâmetros, marca os momentos em que até oito falantes conversam em áudio gravado ou transmitido. Ele fornece atividade dos falantes e marcações de tempo; para produzir também uma transcrição com as palavras, é necessário reconhecimento de fala.
A grande mudança
- O que mudou: O checkpoint Sortformer anterior da NVIDIA para transmissão suporta quatro falantes. Este lançamento oferece oito canais de falantes ordenados por chegada em um único checkpoint compatível tanto com áudio gravado quanto com blocos de áudio recebidos em tempo real.
- Por que isso importa: Um desenvolvedor que cria um sistema de transcrição de reuniões ou chamadas pode usar o modelo para atribuir rótulos genéricos de falantes a intervalos de tempo, inclusive quando há fala sobreposta, e depois combinar esses intervalos com as palavras reconhecidas por outro sistema. O lançamento amplia o limite documentado de falantes para essa tarefa.
- O que acompanhar: A escolha prática é quanto áudio manter no buffer antes de cada resultado transmitido. A configuração recomendada mais curta da NVIDIA aguarda 0,32 segundo de áudio antes de iniciar o cálculo, e as tabelas de precisão da própria empresa mostram o custo de usar essa configuração. As equipes ainda precisam medir o fluxo completo com suas próprias gravações.
O que o modelo retorna
O cartão do modelo especifica áudio mono a 16 kHz. Lista arquivos WAV, FLAC, Opus e MP3; a interface NeMo aceita caminhos de arquivos, matrizes de áudio ou um manifesto JSON delimitado por linhas. Para matrizes de áudio, é preciso passar a taxa de amostragem correta à função diarize(). Segundo o cartão, a inferência em blocos não tem duração máxima fixa de gravação.
O modelo converte o áudio em um tensor de formato [T, 8], com probabilidades de atividade dos falantes e intervalo de saída padrão de 10 milissegundos. Vários canais podem ficar ativos ao mesmo tempo quando há sobreposição de vozes. O pós-processamento converte essas probabilidades em intervalos com horários de início e fim e rótulos genéricos de falantes. Os rótulos seguem a ordem em que as vozes aparecem pela primeira vez; não identificam as pessoas pelo nome. A NVIDIA usa um cache de falantes para blocos anteriores e uma fila do tipo primeiro a entrar, primeiro a sair para quadros recentes, permitindo que o modelo transmitido retenha contexto.
Para quem desenvolve uma transcrição com identificação de falantes, essa distinção é importante. O guia de integração da NVIDIA combina as marcações de tempo da diarização com o resultado de um sistema separado de reconhecimento automático de fala. A regra de ponto médio do exemplo deixa uma palavra sem falante atribuído quando não há nenhum falante ativo e marca atividades simultâneas como ambíguas. O modelo de diarização, sozinho, não determina qual voz sobreposta produziu uma palavra reconhecida.

Tempo de buffer não é tempo de resposta
A NVIDIA recomenda buffers de entrada de 30,4, 1,04, 0,64 e 0,32 segundo. A configuração de 0,32 segundo contém três quadros de processamento de 80 milissegundos e um quadro de contexto à direita também de 80 milissegundos. O cartão define explicitamente a latência como o áudio mantido antes da inferência; ela não inclui o cálculo. Um sistema de transcrição também acrescentaria o tempo de reconhecimento, transporte e processamento pela aplicação.
O caminho documentado no NeMo requer Python 3.12 ou posterior, Cython, uma versão recente do PyTorch e NeMo Speech. A NVIDIA fornece como exemplo o método SortformerEncLabelModel.from_pretrained(), uma chamada diarize() que retorna segmentos de falantes e uma opção para incluir tensores de probabilidade. O cartão diz que é necessário um token do Hugging Face para carregar o checkpoint hospedado por meio dessa chamada do NeMo. Também apresenta uma interface offline e de transmissão no Transformers, que requer instalação a partir do repositório de código-fonte do Transformers, além de uma opção de linha de comando do NeMo-Speech.cpp. São interfaces documentadas; a BIG CHANGE não as executou. Para a integração com NeMo, o cartão do modelo lista Linux e GPUs das famílias NVIDIA Ampere, Hopper e Blackwell. As necessidades de hardware e o custo de processamento de uma carga de trabalho específica dependem da opção e da máquina escolhidas; o cartão não informa preço de operação por hora.
Os pesos são oferecidos sob a licença OpenMDW 1.1. A licença permite usar, modificar e distribuir o modelo sem taxa de licenciamento, sujeito a seus termos. A distribuição precisa manter a licença e os avisos de origem aplicáveis. A licença não restringe o uso nem o compartilhamento dos resultados gerados e atribui aos usuários a responsabilidade por obter direitos e consentimentos necessários para seus áudios. A NVIDIA descreve o modelo como disponível para uso comercial e não comercial.
O que a NVIDIA mediu
A avaliação no cartão do modelo da NVIDIA compara o Nemotron 3 com o Sortformer v2.1 anterior, da própria NVIDIA, com suporte a quatro falantes em transmissão. No conjunto completo de avaliação DIHARD III, a NVIDIA informa uma taxa de erro de diarização de 13,18% para o Nemotron 3 com o buffer de entrada de 1,04 segundo, contra 19,60% para o modelo anterior com a mesma configuração de buffer declarada. Com 0,32 segundo, o resultado do Nemotron 3 é 13,55%. A taxa de erro de diarização combina falas não detectadas, falsos alarmes e confusão entre falantes, divididos pelo tempo de fala de referência. Quanto menor, melhor.
Esses números se referem a um protocolo definido. A NVIDIA afirma que todas as avaliações pontuam falas sobrepostas. O DIHARD III usa uma tolerância de fronteira de zero segundo; o CALLHOME-Part2 usa 0,25 segundo. Para AMI, AliMeeting e NOTSOFAR1, a NVIDIA usa anotações de referência vinculadas e alinhadas à força, em vez dos rótulos originais dos segmentos; mudar esses rótulos altera as pontuações. As instruções de avaliação identificam o script do NeMo e exigem um arquivo RTTM de referência, a configuração de sobreposição, a tolerância, as definições de transmissão e detalhes do pós-processamento para uma execução comparável. Os testes de velocidade de inferência da NVIDIA usaram BF16 em uma RTX PRO 5000, com e sem torch.compile(). São testes relatados pelo fornecedor, não reproduzidos pela BIG CHANGE.
O limite de oito falantes ainda importa. Algumas gravações do DIHARD III são anotadas com até nove falantes, e o cartão diz que falas além dos oito canais do modelo podem não ser detectadas ou ser atribuídas a outro canal. Nas gravações de teste AMI, a NVIDIA relata menor taxa de erro de diarização do Nemotron 3 do que de seu modelo de referência anterior, mas uma precisão menor na contagem exata de falantes. Portanto, a precisão depende da tarefa e da métrica, além do áudio. Uma equipe que avalie integrar o modelo pode começar pelas interfaces publicadas pela NVIDIA e testar o fluxo completo de identificação de falantes e palavras em gravações semelhantes às do uso pretendido.



