엔비디아 네모트론 3 다이어라이제이션, 오디오 내 최대 8명 화자 분리 추적
엔비디아가 최대 8명의 중첩 음성을 추적하며 보이스 아레나에서 14.72% DER을 기록한 1억 파라미터 오픈 웨이트 모델 네모트론 3 다이어라이제이션을 출시했다.

자동 음성 인식(ASR) 도구는 발화된 단어를 텍스트로 변환하는 데 뛰어난 성능을 보이지만, 단순 전사 작업만으로는 대화의 핵심 맥락을 온전히 담아내기 어렵습니다. 누가 언제 발언했는지 알지 못하면 소프트웨어는 회의 중 누가 약속을 했는지, 반대 의견을 제시했는지, 혹은 대화에 끼어들었는지를 정확히 파악할 수 없습니다. 화자 다이어라이제이션(Speaker Diarization)은 각 참여자에게 필수적인 타임스탬프를 부여하여 후속 언어 모델과 분석 파이프라인이 모든 문장의 발화자를 정확하게 식별하도록 돕습니다. 엔비디아는 오프라인 오디오 파일과 저지연 스트리밍 환경에서 최대 8명의 화자를 구별하도록 설계된 1억 개 파라미터 규모의 오픈 웨이트 모델인 네모트론 3 다이어라이제이션(Nemotron 3 Diarization)을 공개하며 음성 생태계를 확장했습니다.
아키텍처 및 발화 순서 기반 화자 추적 메커니즘
네모트론 3 다이어라이제이션은 .wav, .flac, .opus, .mp3를 포함한 표준 형식의 16kHz 단일 채널 오디오 입력을 처리합니다. 시스템은 입력된 원시 오디오를 10ms 프레임 간격의 멜 스펙트로그램(Mel-spectrogram) 특징으로 변환한 뒤, 이를 8배로 적층하여 80ms 인코더 프레임을 생성합니다. 이 프레임들은 로터리 위치 임베딩(RoPE)이 적용된 31계층 트랜스포머 인코더를 통과합니다. 이후 1차원 합성곱(1D Convolutional) 계층이 인코더 출력을 다시 10ms 시간 해상도로 업샘플링하여, 각 시점별로 8개 잠재 화자 채널의 활성화 확률을 나타내는 [T, 8] 크기의 텐서를 출력합니다.
이러한 다중 채널 표현 방식은 여러 화자의 음성이 겹치는 상황을 직접적으로 처리할 수 있습니다. 두 명의 참여자가 동시에 발언하더라도 정확히 동일한 프레임 내에서 두 개의 서로 다른 채널에 양의 확률값이 기록됩니다. 본 아키텍처는 발화 시작 순서에 따라 화자를 엄격하게 정렬하는 소트포머(Sortformer) 방법론을 기반으로 구축되었습니다. 처음 감지된 음성은 채널 1에 할당되고, 그다음 음성은 채널 2에 할당되며, 이후 발화자들은 남은 슬롯을 순차적으로 채웁니다. 이 메커니즘은 연속된 청크 간에 순열 재평가를 수행할 필요 없이 스트리밍 세션 전반에서 안정적인 익명 화자 라벨링을 보장합니다.
- 발화 순서 화자 캐시(AOSC): 채널별로 구성된 이전 오디오 청크의 과거 화자 임베딩 표현을 보존합니다.
- 선입선출(FIFO) 큐: 현재 활성화된 인코딩 윈도우에 직전 프레임의 맥락 정보를 직접 제공합니다.
- 우측 컨텍스트 버퍼: 현재 청크 바로 뒤에 이어지는 오디오를 수집하여 정확한 화자 전환 경계 설정을 지원합니다.
- 익명 식별자 할당: 후속 시스템이 능동적 화자 검증이나 메타데이터를 활용하여 숫자 채널 출력을 실제 개인에게 매핑합니다.
작동 지연 시간 및 벤치마크 평가 성과
해당 모델은 청크 크기와 우측 컨텍스트에 80ms를 곱하여 계산되는 가변 입력 버퍼 지연 설정을 지원합니다. 엔비디아는 오프라인 워크로드를 위한 30.4초 버퍼와 함께 1.04초, 0.64초, 0.32초의 세 가지 스트리밍 버퍼를 주요 작동 지점으로 제시합니다. 기술적으로는 80ms의 극단적인 버퍼 설정도 가능하지만, 엔비디아는 안정적인 음성 처리를 위한 최소 권장 운영 임계값을 0.32초로 명시하고 있습니다. 이러한 지표는 하드웨어 연산, 네트워크 전송, 자동 음성 인식 연산 시간을 제외한 순수 오디오 입력 버퍼링 시간만을 의미합니다.
총 22시간 분량의 영어 대화 139건으로 구성된 초기 보이스 아레나 다이어라이제이션 벤치(Voice Arena Diarization-Bench) 평가에서, 네모트론 3 다이어라이제이션은 12개 시스템 및 17개 구성 중 1위를 차지했습니다. 음성 중첩, 시스템 생성 음성 활동 감지(SAD), 칼라(collar) 0초 조건에서 진행된 평가에서 해당 모델은 14.72%의 화자 분류 오류율(DER)을 기록했습니다. 이는 2위 시스템이 기록한 19.3% DER 대비 약 24%의 상대적 오차 감소를 나타내며, 온라인 및 대면 오디오 전반에서 100ms 및 250ms 칼라 조건에서도 선두를 유지했습니다. 엔비디아는 보이스 아레나의 최종 버전 1 검토가 완료되면 이 벤치마크 수치가 일부 수정될 수 있다고 덧붙였습니다.
1.04초 지연 지점에서 엔비디아의 기존 4화자 체크포인트(diar_streaming_sortformer_4spk-v2.1)와 비교했을 때, 네모트론 3 다이어라이제이션은 테스트된 8개 조건 모두에서 DER을 낮췄으며, 상대적 개선 폭은 CALLHOME-Part2의 9.0%부터 NOTSOFAR1 MHM의 65.2%에 달했습니다. 8개 벤치마크 전반에 걸친 비가중 평균 상대 DER 감소율은 41.0%를 기록했습니다. 30.4초 지연 시간의 2화자 CALLHOME 조건에서 DER이 5.68%에서 5.98%로 소폭 상승하는 단일 회귀가 나타났으나, 전체 CALLHOME-Part2 평가는 10.32%에서 9.10%로 개선되었습니다. 또한 BF16 정밀도를 사용한 엔비디아 RTX PRO 5000 GPU 환경에서 배치 크기 32 기준 컴파일 처리량은 30.4초 지연 조건에서 기준 모델의 2,619배를 크게 상회하는 실시간 대비 15,113배(RTFx) 속도를 달성했습니다.
학습 데이터, 배포 환경 및 실무적 제약 조건
1억 파라미터 아키텍처를 훈련하기 위해 약 10,000시간 분량의 실제 대화 오디오와 82,611시간 분량의 다중 화자 합성 음향 믹스가 결합되었습니다. 합성 데이터셋은 21개 언어에 걸친 라이선스 음원과 David AI로부터 라이선스를 취득한 실제 다중 화자 녹음 데이터를 활용했습니다. David AI 말뭉치를 통합함으로써 오프라인 및 초저지연 평가 전반의 복합 화자 분류 오류율은 11.19%에서 10.42%로 감소했습니다.
네모트론 3 다이어라이제이션은 상업적 이용을 허용하는 OpenMDW 라이선스 1.1에 따라 허깅페이스(Hugging Face)를 통해 배포됩니다. 이 모델은 엔비디아 암페어(Ampere), 에이다 러브레이스(Ada Lovelace), 호퍼(Hopper) 또는 블랙웰(Blackwell) GPU가 탑재된 리눅스 환경의 엔비디아 NeMo Speech 프레임워크 내에서 실행되며 파이썬 3.12 이상을 요구합니다. 엔드투엔드 다중 화자 전사를 위해 이 모델은 파라키트(Parakeet) TDT 0.6B v3와 같은 음성 인식 모델과 결합될 수 있습니다. 현재 베이스텐(Baseten)과 디지털오션(DigitalOcean) 같은 플랫폼을 통한 배포가 지원되며, 아그맥스 프로(Argmax Pro) SDK 3를 통한 온디바이스 통합도 지원되지만, 허깅페이스 인퍼런스 프로바이더(Hugging Face Inference Providers)는 아직 지원되지 않습니다.
시스템을 도입하려는 조직은 모델 고유의 아키텍처적 제약 사항을 고려해야 합니다. 이 모델은 동시 화자 추적을 최대 8명으로 엄격히 제한하므로, 이 임계값을 초과하는 대화에서는 발화가 누락되거나 채널이 잘못 지정될 수 있습니다. 또한 심한 음향 잔향, 강한 배경 소음, 원거리 마이크 수음 환경, 도메인 분포 차이는 화자 분류 오류율을 높이는 요인이 될 수 있습니다.
기업 음성 처리 파이프라인에 미치는 실질적 영향
대화 인텔리전스, 콜센터 분석, 실시간 회의 보조 도구를 개발하는 엔지니어링 팀에게 네모트론 3 다이어라이제이션은 복잡하게 얽힌 다중 발화를 정밀하게 파싱할 수 있는 상용 가능한 오픈 웨이트 컴포넌트를 제공합니다. 동시 추적 가능한 화자 수를 기존 4명에서 8명으로 두 배 늘리고 스트리밍 모드에서 일관된 채널 할당을 유지함으로써, 기업들은 폐쇄형 블랙박스 다이어라이제이션 API에 의존하지 않고도 발언 주체를 정확하게 식별하는 고반응성 전사 파이프라인을 자체적으로 구축할 수 있게 되었습니다.
출처
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 2026년 9월 23일
- Nemotron 3 DiarizationNVIDIA · 2026년 9월 23일



