NVIDIA Nemotron 3 Diarization 发布:精准追踪八位说话人与重叠语音
NVIDIA推出开源权重模型Nemotron 3 Diarization,拥有1亿参数,支持最多8位重叠说话人,在Voice Arena基准测试中取得14.72%的DER。

自动语音识别工具在转录口述内容方面表现优异,但仅凭转录本身无法解决关键的对话上下文问题。如果无法获知具体是谁在何时发言,软件就无法判断是谁做出了承诺、提出了异议,或是在讨论过程中进行了打断。说话人日志(Speaker Diarization)能够为每位参与者提供精确的时间戳,从而使下游语言模型和数据分析流程可以准确归属每一句话。NVIDIA通过推出拥有1亿(100M)参数的开源权重模型Nemotron 3 Diarization扩展了其语音生态系统,该模型旨在离线音频文件以及低延迟流式音频中精准区分多达八位说话人。
架构设计与基于到达顺序的说话人追踪
Nemotron 3 Diarization支持16 kHz单声道音频输入,兼容包括.wav、.flac、.opus和.mp3在内的多种标准格式。该系统以10毫秒的帧移将原始音频转换为梅尔频谱图(Mel-spectrogram)特征,随后按8倍因子进行堆叠,生成80毫秒的编码器帧。这些帧随后送入一个配备旋转位置编码(RoPE)的31层Transformer编码器中。随后,一维卷积层将编码器的输出上采样恢复至10毫秒的时间分辨率,最终输出一个维度为[T, 8]的张量,代表在每个时间步长下8个潜在说话人通道的激活概率。
这种多通道表示形式天然契合重叠语音的处理需求。当两位参与者同时开口说话时,两个不同的通道会在完全相同的帧内记录正概率。该架构基于Sortformer方法论,严格按照说话人的到达时间顺序进行排列。系统将检测到的第一个声音分配至通道一,紧接着的声音分配至通道二,后续的声音则依次填入剩余的通道槽位。这一机制确保了在整个流式传输会话中能够拥有稳定的匿名说话人标签,无需跨越连续的音频块重复进行置换重估。
- 到达顺序说话人缓存(AOSC):按通道组织并保留来自先前音频块的历史说话人表征。
- 先进先出(FIFO)队列:直接为当前处于激活状态的编码窗口提供紧邻的前序帧上下文。
- 右上下文缓冲区:摄取紧跟当前音频块之后的音频片段,以协助实现精准的说话人边界过渡。
- 匿名身份分配:下游系统可通过主动说话人验证或元数据,将数字通道输出映射至具体的真实个体。
运行延迟与基准测试表现
该模型支持可变的输入缓冲延迟设置,具体数值由音频块大小与右上下文乘以80毫秒计算得出。NVIDIA重点指出了四个主要运行节点:面向离线工作负载的30.4秒,以及面向流式处理的1.04秒、0.64秒和0.32秒缓冲区。尽管80毫秒的极端缓冲在技术上可行,但NVIDIA将0.32秒确定为实现可靠语音处理的最低推荐操作阈值。需要说明的是,这些指标仅代表输入音频的缓冲时间,不包含底层硬件执行、网络传输以及自动语音识别模型的计算耗时。
在覆盖139场英语对话(总计约22小时)的初始Voice Arena Diarization-Bench评估中,Nemotron 3 Diarization在12个系统和17种配置中拔得头筹。在包含重叠语音、系统生成语音活动检测(SAD)以及零容差窗口(zero collar)的严苛评测条件下,该模型录得了14.72%的说话人日志错误率(DER)。与第二名系统的19.3% DER相比,这实现了约24%的相对降低;同时在在线与面对面音频测试中,配合100毫秒和250毫秒容差窗口时同样保持领先。NVIDIA指出,随着Voice Arena最终第1版(Version 1)审查的推进,这些基准测试数据仍可能存在修订。
在1.04秒延迟节点下与NVIDIA先前的4说话人检查点(diar_streaming_sortformer_4spk-v2.1)对比时,Nemotron 3 Diarization在全部8项测试条件下均降低了DER,相对改善幅度从CALLHOME-Part2上的9.0%到NOTSOFAR1 MHM上的65.2%不等。这8项基准测试的非加权平均相对DER降幅达到了41.0%。评测中仅出现了一处孤立的性能退步:在30.4秒延迟的2说话人CALLHOME测试中,DER从5.68%微升至5.98%,但完整的CALLHOME-Part2评估指标依然从10.32%改善至9.10%。此外,在NVIDIA RTX PRO 5000 GPU上采用BF16精度并经过编译的Batch-32吞吐量在30.4秒延迟下达到了15,113倍实时率(RTFx),远超基线模型的2,619倍。
训练数据、部署方式与实际限制
训练这一拥有100M参数的架构结合了大约10,000小时的真实对话音频以及82,611小时的模拟多说话人混合音频。模拟数据集源自涵盖21种语言的授权音频源,以及从David AI获得授权许可的真实世界多说话人录音。通过引入David AI语料库,模型在离线与超低延迟评估中的综合说话人日志错误率从11.19%显著下降至10.42%。
Nemotron 3 Diarization通过Hugging Face在OpenMDW License 1.1许可协议下公开发布,授权用于商业用途。该模型依托NVIDIA NeMo Speech框架运行在配备NVIDIA Ampere、Ada Lovelace、Hopper或Blackwell GPU的Linux系统上,且环境需满足Python 3.12或更高版本。若要实现端到端的多说话人语音转录,该模型可与Parakeet TDT 0.6B v3等自动语音识别模型配合使用。目前该系统支持通过Baseten和DigitalOcean等云平台进行部署,设备端集成可通过Argmax Pro SDK 3实现,而Hugging Face Inference Providers当前暂不支持。
在部署该系统时,企业和技术团队必须充分考虑其固有的架构限制。该模型将同时追踪的说话人上限严格设定为八人;若对话中的发言人数超出此限制,将导致部分语音遗漏或通道归属错误。此外,强烈的声学混响、严重的背景噪声、远场麦克风拾音以及领域分布漂移等现实因素,都可能导致说话人日志错误率上升。
对企业级语音处理流程的实际影响
对于正在研发对话智能系统、呼叫中心质检分析平台以及实时会议助手的工程团队而言,Nemotron 3 Diarization提供了一个具备商业可行性且表现强劲的开源权重组件,能够有效解析复杂的重叠对话。通过将并发说话人上限从四人提升至八人,并在流式模式下保持高度一致的通道分配,企业组织能够构建出响应迅速的本地化或云端转录系统,准确归属口头责任与讨论要点,而无需继续受制于专有的黑盒商业API服务。
信息来源
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 2026年9月23日
- Nemotron 3 DiarizationNVIDIA · 2026年9月23日



