NVIDIA Nemotron 3 Diarization rastrea ocho voces en audio
NVIDIA lanza Nemotron 3 Diarization, un modelo abierto de 100M de parámetros que identifica hasta ocho voces simultáneas con 14,72 % de DER en Voice Arena.

Las herramientas de reconocimiento automático del habla destacan al transcribir palabras habladas, pero la transcripción por sí sola deja sin resolver un contexto conversacional crítico. Sin saber quién habló y en qué momento exacto, el software no puede determinar quién asumió un compromiso, quién planteó una objeción o quién interrumpió durante una discusión. La diarización de locutores proporciona las marcas de tiempo necesarias para cada participante, lo que permite que los modelos de lenguaje y las canalizaciones analíticas posteriores atribuyan cada frase con total precisión. NVIDIA ha ampliado su ecosistema de tecnologías de voz con el lanzamiento de Nemotron 3 Diarization, un modelo de pesos abiertos con 100 millones de parámetros diseñado para distinguir hasta ocho locutores en archivos sin conexión y en transmisiones de audio con baja latencia.
Arquitectura y seguimiento de locutores por orden de llegada
Nemotron 3 Diarization admite audio monocanal a 16 kHz en formatos estándar que incluyen .wav, .flac, .opus y .mp3. El sistema convierte el audio sin procesar en características de espectrograma de Mel con un paso de trama de 10 ms, las cuales se apilan posteriormente por un factor de ocho para producir tramas de codificador de 80 ms. Estas tramas pasan a través de un codificador Transformer de 31 capas equipado con incrustaciones posicionales rotatorias (RoPE). A continuación, una capa convolucional 1D realiza un sobremuestreo de las salidas del codificador para devolverlas a una resolución temporal de 10 ms, entregando un tensor con dimensiones [T, 8] que representa la probabilidad de activación para ocho canales potenciales de locutores en cada paso temporal.
Esta representación multicanal se adapta directamente al habla superpuesta. Si dos participantes conversan de manera simultánea, dos canales distintos registran probabilidades positivas dentro de la misma trama temporal exacta. La arquitectura se basa en la metodología Sortformer al ordenar a los locutores estrictamente según su hora de llegada. La primera voz detectada se asigna al canal uno, la siguiente al canal dos y las voces posteriores van ocupando las ranuras restantes. Este mecanismo garantiza un etiquetado anónimo y estable de los interlocutores a lo largo de las sesiones de transmisión en directo, sin necesidad de reevaluar permutaciones en bloques sucesivos.
- Caché de locutores por orden de llegada (AOSC): conserva las representaciones históricas de los locutores de fragmentos de audio anteriores organizadas por canal.
- Cola de tipo primero en entrar, primero en salir (FIFO): proporciona el contexto de las tramas inmediatamente precedentes a la ventana de codificación activa.
- Búfer de contexto derecho: ingiere el audio inmediatamente posterior al bloque actual para facilitar transiciones precisas en los límites de los locutores.
- Asignación de identidad anónima: los sistemas posteriores asignan las salidas numéricas de los canales a personas reales mediante verificación de locutor activo o metadatos.
Latencias operativas y rendimiento en bancos de pruebas
El modelo admite configuraciones de latencia de búfer de entrada variables calculadas a partir del tamaño del fragmento y del contexto derecho multiplicados por 80 ms. NVIDIA destaca cuatro puntos operativos principales: 30,4 segundos para cargas de trabajo sin conexión (offline), junto con búferes de transmisión de 1,04 segundos, 0,64 segundos y 0,32 segundos. Aunque un búfer extremo de 80 ms es técnicamente posible, NVIDIA señala 0,32 segundos como el umbral operativo mínimo recomendado para un procesamiento de voz fiable. Estas métricas representan de forma exclusiva el almacenamiento en búfer del audio de entrada, excluyendo la ejecución en hardware, el transporte por red y el cómputo del reconocimiento automático del habla.
En la evaluación inicial de Voice Arena Diarization-Bench sobre 139 conversaciones en inglés con un total aproximado de 22 horas, Nemotron 3 Diarization obtuvo el primer puesto entre 12 sistemas y 17 configuraciones evaluadas. Al ser calificado bajo condiciones con habla superpuesta, detección de actividad de voz generada por el sistema y un margen de tolerancia nulo (collar cero), el modelo registró una tasa de error de diarización (DER) del 14,72 %. Esto representa una reducción relativa de aproximadamente el 24 % frente al 19,3 % de DER obtenido por el sistema en segundo lugar, al tiempo que lideró con márgenes de tolerancia de 100 ms y 250 ms en grabaciones de audio en línea y presenciales. NVIDIA advierte de que estas cifras de referencia siguen sujetas a posibles revisiones tras completarse la revisión final de la Versión 1 de Voice Arena.
Al compararse con el punto de control anterior de NVIDIA para 4 locutores (diar_streaming_sortformer_4spk-v2.1) con una latencia de 1,04 segundos, Nemotron 3 Diarization redujo el DER en las ocho condiciones probadas, con mejoras relativas que oscilaron entre el 9,0 % en CALLHOME-Part2 y el 65,2 % en NOTSOFAR1 MHM. La reducción relativa media no ponderada del DER en estos ocho bancos de pruebas alcanzó el 41,0 %. Se produjo una única regresión aislada en CALLHOME de 2 locutores con 30,4 segundos de latencia, donde el DER subió del 5,68 % al 5,98 %, aunque la evaluación completa de CALLHOME-Part2 mejoró del 10,32 % al 9,10 %. Además, el rendimiento compilado con tamaño de lote 32 en una GPU NVIDIA RTX PRO 5000 utilizando precisión BF16 alcanzó un factor de tiempo real (RTFx) de 15.113x a 30,4 segundos, frente a los 2.619x del modelo base.
Datos de entrenamiento, despliegue y límites prácticos
El entrenamiento de esta arquitectura de 100M de parámetros requirió combinar cerca de 10.000 horas de audio conversacional real con 82.611 horas de mezclas simuladas con múltiples hablantes. El conjunto de datos simulado procedió de audios de origen con licencia que cubren 21 idiomas, junto con grabaciones reales de múltiples interlocutores licenciadas a través de David AI. La incorporación de los corpus de David AI redujo la tasa de error de diarización combinada del 11,19 % al 10,42 % en las evaluaciones fuera de línea y con latencia ultrabaja.
Nemotron 3 Diarization se distribuye bajo la licencia OpenMDW License 1.1 en Hugging Face, lo que autoriza su uso comercial. El modelo se ejecuta dentro del entorno NVIDIA NeMo Speech en sistemas Linux equipados con GPU NVIDIA de arquitecturas Ampere, Ada Lovelace, Hopper o Blackwell, y requiere Python 3.12 o superior. Para lograr una transcripción multilocutor de extremo a extremo, el sistema se combina con modelos de reconocimiento del habla como Parakeet TDT 0.6B v3. Su despliegue es compatible actualmente con plataformas como Baseten y DigitalOcean, mientras que la integración local en dispositivos es posible mediante el SDK Argmax Pro 3; los proveedores de inferencia de Hugging Face aún no son compatibles.
Las organizaciones que implementen este sistema deben tener en cuenta sus limitaciones arquitectónicas intrínsecas. El modelo limita de forma estricta el seguimiento simultáneo a un máximo de ocho personas; aquellas conversaciones que superen este umbral experimentarán pérdidas de voz o canales mal atribuidos. Asimismo, una reverberación acústica severa, un ruido de fondo intenso, la captura de audio en campo lejano con micrófonos distantes y los cambios en la distribución del dominio acústico pueden incrementar las tasas de error de diarización.
Implicaciones para las canalizaciones de voz empresariales
Para los equipos de ingeniería que desarrollan herramientas de inteligencia conversacional, analítica de centros de llamadas y asistentes de reuniones en tiempo real, Nemotron 3 Diarization ofrece un componente de pesos abiertos comercialmente viable capaz de procesar diálogos complejos con solapamientos. Al duplicar el límite de locutores simultáneos de cuatro a ocho y mantener asignaciones de canales coherentes en modo de transmisión, las organizaciones pueden crear sistemas de transcripción altamente reactivos que atribuyen compromisos verbales con precisión sin depender de interfaces de programación de aplicaciones (API) propietarias y cerradas.
Fuentes
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 23 de septiembre de 2026
- Nemotron 3 DiarizationNVIDIA · 23 de septiembre de 2026



