NVIDIA Nemotron 3 Diarization identifica oito vozes em áudio
A NVIDIA lançou o Nemotron 3 Diarization, modelo aberto de 100M parâmetros que distingue até oito vozes sobrepostas com 14,72% de DER na Voice Arena.

As ferramentas de reconhecimento automático de voz destacam-se na transcrição exata de palavras faladas, mas a simples conversão de áudio em texto deixa de fora informações contextuais críticas de uma conversa. Sem identificar quem falou em cada momento, os sistemas de software tornam-se incapazes de determinar que interveniente assumiu um compromisso, apresentou uma objeção ou interrompeu outro participante durante um debate. A diarização de locutores fornece as marcas temporais indispensáveis para cada interveniente, permitindo que modelos linguísticos e fluxos analíticos subsequentes atribuam cada afirmação com precisão. A NVIDIA expandiu o seu ecossistema de voz com o lançamento do Nemotron 3 Diarization, um modelo de pesos abertos com 100 milhões de parâmetros concebido para distinguir até oito locutores em ficheiros pré-gravados e transmissões de áudio em direto de baixa latência.
Arquitetura e rastreio de locutores por ordem de chegada
O Nemotron 3 Diarization processa áudio monocanal a 16 kHz nos formatos convencionais, incluindo .wav, .flac, .opus e .mp3. O sistema converte o sinal bruto em características de espetrograma Mel com um avanço de janela temporal de 10 ms, as quais são posteriormente agregadas por um fator de oito para gerar blocos de codificação de 80 ms. Estes blocos percorrem um codificador Transformer de 31 camadas equipado com representações posicionais rotativas (RoPE). Uma camada convolucional unidimensional (1D) restaura a resolução temporal das saídas do codificador para 10 ms, produzindo um tensor com a dimensão [T, 8] que quantifica a probabilidade de ativação para oito canais potenciais de locutores em cada instante temporal.
Esta estrutura multicanal acomoda de forma nativa a sobreposição simultânea de voz. Caso dois participantes falem ao mesmo tempo, dois canais distintos registam probabilidades positivas exatamente no mesmo intervalo de tempo. A arquitetura fundamenta-se na metodologia Sortformer, organizando os locutores rigorosamente pela respetiva ordem de chegada à conversa. A primeira voz identificada é atribuída ao canal um, a seguinte ao canal dois, e as intervenções subsequentes preenchem os canais livres restantes. Este procedimento assegura a estabilidade das etiquetas anónimas atribuídas aos intervenientes ao longo de fluxos contínuos de áudio, sem a necessidade de reavaliar permutações entre blocos de processamento sucessivos.
- Cache de locutores por ordem de chegada (AOSC): Preserva representações históricas de locutores provenientes de blocos anteriores, organizadas individualmente por canal.
- Fila First-In, First-Out (FIFO): Fornece de forma direta o contexto imediato dos blocos anteriores à janela ativa de codificação.
- Memória intermédia de contexto direito: Recebe o segmento áudio imediatamente seguinte ao bloco em curso para suavizar e delimitar as transições entre vozes.
- Atribuição de identidade anónima: Os sistemas a jusante mapeiam os canais numéricos para identidades reais através de verificação biométrica de voz ou de metadados da sessão.
Latências operacionais e resultados em avaliações de referência
O modelo suporta configurações flexíveis de latência na memória intermédia de entrada, calculadas com base na dimensão do bloco e no contexto direito multiplicados por 80 ms. A NVIDIA estabeleceu quatro regimes operacionais fundamentais: 30,4 segundos para processamento em diferido (offline), acompanhados por memórias intermédias para transmissão em direto de 1,04 segundos, 0,64 segundos e 0,32 segundos. Embora um limite extremo de 80 ms seja tecnicamente viável, a NVIDIA aponta os 0,32 segundos como o limiar mínimo recomendado para assegurar um processamento fiável do sinal. Estes valores referem-se exclusivamente ao armazenamento temporário do áudio de entrada, excluindo o tempo de execução no hardware, o transporte na rede e os cálculos do reconhecimento de fala.
Na avaliação inicial da Voice Arena Diarization-Bench, efetuada sobre 139 conversações em língua inglesa totalizando perto de 22 horas de gravação, o Nemotron 3 Diarization alcançou a primeira posição entre 12 sistemas e 17 configurações concorrentes. Testado em cenários com sobreposição de voz, deteção de atividade de fala gerada pelo próprio sistema e margem de tolerância zero (zero collar), o modelo obteve uma taxa de erro de diarização (DER) de 14,72%. Este resultado representa uma redução relativa de cerca de 24% face aos 19,3% de DER alcançados pelo segundo classificado, mantendo a liderança com margens de tolerância de 100 ms e 250 ms em áudios captados presencialmente e através da internet. A NVIDIA sublinha que estes indicadores de desempenho permanecem sujeitos a eventuais revisões com a conclusão da versão 1 definitiva da Voice Arena.
Em comparação com o modelo anterior da NVIDIA para quatro locutores (diar_streaming_sortformer_4spk-v2.1) com latência de 1,04 segundos, o Nemotron 3 Diarization diminuiu a taxa de erro em todas as oito condições avaliadas, registando melhorias relativas entre 9,0% no conjunto CALLHOME-Part2 e 65,2% no NOTSOFAR1 MHM. A redução média relativa não ponderada da DER nestas oito referências situou-se nos 41,0%. Registou-se apenas uma regressão pontual no conjunto CALLHOME com dois locutores e latência de 30,4 segundos, onde a taxa de erro subiu de 5,68% para 5,98%, muito embora a avaliação global no CALLHOME-Part2 tenha progredido positivamente de 10,32% para 9,10%. Adicionalmente, o rendimento de processamento compilado com lotes de tamanho 32 numa GPU NVIDIA RTX PRO 5000 com precisão BF16 atingiu um fator de tempo real (RTFx) de 15 113x a 30,4 segundos, superando substancialmente a marca base de 2 619x.
Dados de treino, implementação e limitações práticas
O treino da arquitetura de 100 milhões de parâmetros combinou cerca de 10 000 horas de áudio conversacional autêntico com 82 611 horas de misturas sintetizadas de múltiplos interlocutores. O conjunto simulado recorreu a ficheiros de áudio licenciados distribuídos por 21 idiomas, complementados por gravações reais com vários locutores fornecidas pela David AI. A integração dos dados da David AI permitiu diminuir a taxa de erro de diarização composta de 11,19% para 10,42% nas avaliações globais em modo diferido e de latência ultrarreduzida.
O Nemotron 3 Diarization encontra-se disponível no repositório Hugging Face sob a licença OpenMDW 1.1, que autoriza a sua exploração comercial. O modelo opera integrado no ambiente NVIDIA NeMo Speech em sistemas Linux com placas gráficas NVIDIA das gerações Ampere, Ada Lovelace, Hopper ou Blackwell, exigindo a versão 3.12 ou superior do Python. Para tarefas completas de transcrição com múltiplos locutores, pode ser conjugado com modelos de reconhecimento de voz como o Parakeet TDT 0.6B v3. A sua implementação em produção é suportada em plataformas como a Baseten e a DigitalOcean, bem como em dispositivos locais através do Argmax Pro SDK 3, não existindo ainda suporte nativo pelos fornecedores de inferência do Hugging Face.
As entidades que planeiam integrar o sistema devem considerar limitações técnicas inerentes. O modelo restringe estritamente o acompanhamento a um teto máximo de oito intervenientes simultâneos; interações que ultrapassem este número resultam na omissão de segmentos de fala ou em atribuições erróneas de canal. Paralelamente, condições acústicas adversas com reverberação excessiva, ruído de fundo intenso, captação por microfones distantes e desvios acentuados face à distribuição dos dados de treino podem degradar a precisão da diarização.
Impacto prático nos sistemas empresariais de voz
Para equipas de engenharia focadas no desenvolvimento de inteligência conversacional, monitorização analítica de centros de atendimento e assistentes para reuniões em direto, o Nemotron 3 Diarization surge como um componente de pesos abertos comercialmente viável e apto a analisar conversas complexas e sobrepostas. Ao duplicar a capacidade simultânea de quatro para oito participantes e manter a estabilidade de canais no processamento em direto, as organizações ganham a possibilidade de conceber infraestruturas de transcrição reativas que discriminam compromissos verbais com rigor, sem necessidade de recorrer a interfaces de programação proprietárias e opacas.
Fontes
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 23 de setembro de 2026
- Nemotron 3 DiarizationNVIDIA · 23 de setembro de 2026



