NVIDIA Nemotron 3 Diarization suit huit voix en direct
NVIDIA lance Nemotron 3 Diarization, un modèle ouvert de 100M de paramètres suivant jusqu'à huit voix superposées avec un DER de 14,72 % sur Voice Arena.

Les outils de reconnaissance automatique de la parole excellent aujourd'hui dans la transcription textuelle brute, mais la simple transcription laisse de côté une dimension essentielle de la conversation. Sans savoir précisément qui parle et à quel moment, les logiciels d'analyse ne peuvent pas déterminer qui a pris un engagement ferme, exprimé un désaccord ou interrompu un intervenant au cours d'un échange. La diarisation du locuteur fournit les repères temporels indispensables pour chaque participant, permettant aux modèles de langage et aux pipelines analytiques en aval d'attribuer chaque propos avec exactitude. NVIDIA enrichit son écosystème vocal avec le lancement de Nemotron 3 Diarization, un modèle à poids ouverts de 100 millions de paramètres conçu pour distinguer jusqu'à huit locuteurs distincts, aussi bien sur des fichiers préenregistrés que dans des flux audio en direct à faible latence.
Architecture et suivi des locuteurs par ordre d'arrivée
Sur le plan technique, Nemotron 3 Diarization traite des signaux audio monocanaux échantillonnés à 16 kHz dans des formats courants tels que .wav, .flac, .opus et .mp3. Le système transforme le signal audio brut en spectrogrammes de Mel avec un pas temporel de 10 ms, lesquels sont ensuite regroupés par facteur de huit pour constituer des trames d'encodage de 80 ms. Ces trames traversent un encodeur Transformer composé de 31 couches intégrant des plongements positionnels rotatifs (RoPE). Une couche de convolution unidimensionnelle rééchantillonne ensuite les sorties de l'encodeur vers la résolution temporelle initiale de 10 ms, générant un tenseur de dimensions [T, 8] qui indique la probabilité d'activation de huit canaux de locuteurs potentiels à chaque intervalle temporel.
Cette représentation multicanale gère nativement les situations de parole simultanée. Lorsque deux participants parlent en même temps, deux canaux distincts affichent des probabilités positives au sein de la même trame temporelle. L'architecture s'appuie sur la méthodologie Sortformer en classant rigoureusement les locuteurs selon leur ordre d'apparition dans le flux audio. La première voix détectée est assignée au canal un, la suivante au canal deux, et ainsi de suite pour les locuteurs ultérieurs. Ce mécanisme assure une attribution stable et cohérente des identifiants anonymes tout au long du streaming, sans exiger de réévaluation combinatoire des permutations entre les fragments audio successifs.
- Cache de locuteurs par ordre d'arrivée (AOSC) : conserve les représentations vectorielles historiques des locuteurs issues des fragments audio antérieurs, organisées par canal.
- File d'attente premier entré, premier sorti (FIFO) : transmet le contexte immédiat des trames précédentes directement à la fenêtre d'encodage active.
- Mémoire tampon de contexte droit : ingère les données audio situées immédiatement après le segment en cours pour affiner la détection des frontières de parole.
- Attribution d'identités anonymes : permet aux systèmes en aval d'associer les canaux numériques à des personnes réelles via la vérification vocale ou des métadonnées.
Latences opérationnelles et performances aux bancs d'essai
Le modèle prend en charge plusieurs configurations de mémoire tampon d'entrée, calculées à partir de la taille du fragment et du contexte droit multipliés par 80 ms. NVIDIA met en avant quatre paliers de fonctionnement principaux : 30,4 secondes pour les traitements hors ligne, ainsi que des tampons de streaming de 1,04 seconde, 0,64 seconde et 0,32 seconde. Bien qu'une latence minimale de 80 ms soit techniquement envisageable, NVIDIA désigne le seuil de 0,32 seconde comme la limite inférieure recommandée pour garantir un traitement fiable du signal. Ces métriques mesurent strictement la mise en mémoire tampon audio d'entrée, sans inclure le temps d'exécution matériel, le transport réseau ni le calcul de la reconnaissance vocale.
Lors de l'évaluation initiale sur le banc Diarization-Bench de Voice Arena, portant sur 139 conversations en anglais totalisant environ 22 heures d'enregistrement, Nemotron 3 Diarization s'est classé à la première place parmi 12 systèmes et 17 configurations. Testé dans des conditions réelles incluant chevauchements vocaux, détection automatique de l'activité vocale et tolérance temporelle nulle (zero collar), le modèle a obtenu un taux d'erreur de diarisation (DER) de 14,72 %. Ce score représente une réduction relative d'environ 24 % par rapport au deuxième système classé (19,3 % de DER), tout en conservant l'avantage avec des tolérances de 100 ms et 250 ms sur des flux distants et en présentiel. NVIDIA précise que ces résultats restent soumis à d'éventuelles révisions lors de la finalisation de la Version 1 de Voice Arena.
En comparaison avec l'ancien modèle NVIDIA pour 4 locuteurs (diar_streaming_sortformer_4spk-v2.1) configuré à une latence de 1,04 seconde, Nemotron 3 Diarization a réduit le DER sur l'ensemble des huit bancs de test évalués, avec des gains relatifs oscillant entre 9,0 % sur CALLHOME-Part2 et 65,2 % sur NOTSOFAR1 MHM. La réduction moyenne non pondérée du DER s'élève à 41,0 %. Une légère régression isolée a été relevée sur CALLHOME à 2 locuteurs avec 30,4 secondes de latence, où le DER est passé de 5,68 % à 5,98 %, bien que l'évaluation globale sur CALLHOME-Part2 se soit améliorée de 10,32 % à 9,10 %. De plus, le débit compilé par lots de 32 sur un GPU NVIDIA RTX PRO 5000 en précision BF16 a atteint 15 113 fois le temps réel (RTFx) à 30,4 secondes, contre 2 619 fois pour la version précédente.
Données d'entraînement, déploiement et contraintes pratiques
L'entraînement de cette architecture de 100 millions de paramètres a nécessité la combinaison d'environ 10 000 heures de conversations réelles et de 82 611 heures de mélanges synthétiques multi-locuteurs. Le jeu de données synthétiques s'appuie sur des enregistrements sous licence couvrant 21 langues, complétés par des données multi-locuteurs réelles concédées sous licence par David AI. L'intégration des corpus fournis par David AI a permis de faire baisser le taux d'erreur de diarisation combiné de 11,19 % à 10,42 % sur l'ensemble des tests hors ligne et à très faible latence.
Nemotron 3 Diarization est distribué sur Hugging Face sous licence OpenMDW 1.1, ce qui autorise son exploitation commerciale. Le modèle fonctionne au sein du framework NVIDIA NeMo Speech sur des environnements Linux équipés de processeurs graphiques NVIDIA d'architectures Ampere, Ada Lovelace, Hopper ou Blackwell, avec Python 3.12 ou supérieur. Pour bâtir un pipeline complet de transcription multi-locuteurs, il peut être associé à des modèles de reconnaissance vocale tels que Parakeet TDT 0.6B v3. Le déploiement est actuellement pris en charge sur des plateformes comme Baseten et DigitalOcean, ainsi qu'en local via le SDK Argmax Pro 3, tandis que les fournisseurs d'inférence de Hugging Face ne sont pas supportés à ce jour.
Les équipes techniques doivent toutefois prendre en considération les contraintes inhérentes au modèle. Le système plafonne strictement le suivi simultané à huit personnes ; toute conversation dépassant ce nombre engendre des omissions ou des erreurs d'attribution de canaux. Par ailleurs, une réverbération acoustique sévère, des bruits de fond prononcés, des prises de son lointaines ou des disparités importantes de distribution acoustique sont susceptibles d'augmenter significativement le taux d'erreur.
Ce que cela change pour les pipelines vocaux d'entreprise
Pour les organisations qui développent des outils d'intelligence conversationnelle, des plateformes d'analyse de centres de contacts ou des assistants de réunion en direct, Nemotron 3 Diarization constitue un composant à poids ouverts économiquement exploitable pour analyser des échanges complexes et superposés. En portant la capacité de suivi de quatre à huit interlocuteurs simultanés tout en garantissant la cohérence des canaux en continu, les entreprises peuvent concevoir des systèmes de transcription réactifs qui attribuent avec exactitude les engagements pris, sans dépendre d'API propriétaires opaques.
Sources
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 23 septembre 2026
- Nemotron 3 DiarizationNVIDIA · 23 septembre 2026



