A NVIDIA liberou o Nemotron 3 Diarization, um modelo de pesos abertos para diarização de fala — a tarefa de responder “quem falou quando” em qualquer conversa. Com 100 milhões de parâmetros, ele acompanha até 8 falantes simultaneamente, inclusive quando as vozes se sobrepõem, e um único checkpoint atende tanto gravações offline quanto streaming em tempo real.
Por que diarização importa
O reconhecimento automático de fala (ASR) entrega as palavras, mas não diz quem as disse. Sem atribuição de autoria, um resumidor de reuniões não consegue saber quem assumiu um compromisso ou quem levantou uma objeção. A diarização produz os intervalos de tempo em que cada falante está ativo e, combinada ao ASR, gera a transcrição com atribuição de voz. Ferramentas de reunião, análise de chamadas, pipelines de podcast e a memória de agentes de voz dependem dessa etapa.
O que mudou em relação à geração anterior
O checkpoint anterior da NVIDIA, o Streaming Sortformer, suportava 4 falantes. O Nemotron 3 Diarization dobra esse limite para 8, mirando áudio multipartidário bagunçado — aquele em que várias pessoas falam ao mesmo tempo. O modelo segue a abordagem Sortformer de ordenar os falantes por ordem de chegada: a primeira voz nova ocupa o canal 1, a próxima o canal 2, e assim por diante. Isso mantém os rótulos estáveis entre blocos de streaming, sem precisar re-casar falantes com canais a cada bloco.
Arquitetura e desempenho
O modelo aceita áudio de 16 kHz em canal único nos formatos .wav, .flac, .opus e .mp3, converte em espectrogramas de Mel com passo de 10 ms e processa com um encoder Transformer de 31 camadas com embeddings posicionais rotativos (RoPE). O design lida com sobreposição diretamente: se duas pessoas falam ao mesmo tempo, dois canais ativam no mesmo frame.
Nos benchmarks, ele ficou em primeiro lugar no Diarization-Bench inicial do Voice Arena, com 14,72% de DER (taxa de erro de diarização) contra 19,3% do segundo colocado — uma redução relativa de cerca de 24% em 139 conversas em inglês, totalizando ~22 horas. Em relação ao baseline de 4 falantes, a redução média de DER nas 8 condições avaliadas foi de 41%. O modelo oferece quatro pontos de latência, do offline (30,4 s) ao ultra-baixo (0,32 s), com throughput de até 15.113× em tempo real em modo compilado.
Como começar
O modelo roda no Linux via NVIDIA NeMo, em GPUs Ampere, Ada Lovelace, Hopper ou Blackwell, e os pesos usam a licença OpenMDW 1.1, que permite uso comercial. A instalação é direta:
uv pip install 'nemo-toolkit[asr]'
from nemo.collections.asr.models import SortformerEncLabelModel
diar_model = SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization")
diar_model.eval()
segments = diar_model.diarize(audio=["conversation.wav"], batch_size=1)Para obter também as palavras, o modelo pode ser pareado com o Parakeet TDT 0.6B v3 usando o guia de integração de ASR da NVIDIA. Há ainda um demo ao vivo no Hugging Face Space e suporte em produção listado via Baseten e DigitalOcean.
Limitações que você precisa conhecer
Gravações com mais de 8 falantes podem produzir fala perdida ou atribuída incorretamente. Ruído intenso, reverberação e captura de campo distante também elevam as taxas de erro. E há uma regressão pontual a observar: em um cenário de 2 falantes no CALLHOME a 30,4 s, o DER subiu de 5,68% para 5,98% — embora o conjunto completo do CALLHOME-Part2 tenha melhorado de 10,32% para 9,10%.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



