NVIDIA Nemotron 3 Diarization:最大8人の重複音声を高精度に分離追跡
NVIDIAが公開したNemotron 3 Diarizationは1億パラメータのオープンウェイトモデルで、最大8人の重複音声を追跡しVoice ArenaでDER 14.72%を記録した。

自動音声認識(ASR)ツールは話された言葉を文字に起こす処理において優れた性能を発揮しますが、単なる文字起こしだけでは会話の極めて重要な文脈が抜け落ちてしまいます。「誰がいつ発言したのか」という時間情報がなければ、ソフトウェアは誰が合意を示し、誰が異議を唱え、誰が議論を遮ったのかを特定できません。話者分離(ダイアライゼーション)は各参加者の発言タイムスタンプを提供し、下流の言語モデルや分析パイプラインがすべてのフレーズを正確な話者に紐付けることを可能にします。NVIDIAは音声エコシステムの拡充として、オフラインファイルおよび低遅延ストリーミング音声の両方で最大8人の話者を識別できるよう設計された、1億パラメータのオープンウェイトモデル「Nemotron 3 Diarization」をリリースしました。
アーキテクチャと発言順による話者追跡機能
Nemotron 3 Diarizationは、.wav、.flac、.opus、.mp3などの標準形式における16 kHzのシングルチャネル音声を入力として受け取ります。システムは生の音声データを10ミリ秒(ms)のフレームステップを持つメルスペクトログラム特徴量に変換し、これを8倍にスタックすることで80 msのエンコーダフレームを生成します。これらのフレームは、回転位置埋め込み(RoPE)を備えた31層のTransformerエンコーダを通過します。その後、1次元畳み込み層がエンコーダ出力を元の10 msの時間解像度へとアップサンプリングし、各タイムステップにおける8つの潜在的話者チャネルの活性化確率を表す[T, 8]の次元テンソルを出力します。
このマルチチャネル表現は、複数の話者が同時に発声するオーバーラップ音声を直接処理することが可能です。2人の参加者が同時に発言した場合、全く同じフレーム内で2つの異なるチャネルが正の確率を記録します。このアーキテクチャはSortformer手法をベースにしており、話者を厳密に登場順(発言開始順)で並べ替えます。最初に検出された声にはチャネル1が割り当てられ、次の声にはチャネル2が割り当てられ、以降の声も順次残りのスロットを埋めていきます。このメカニズムにより、連続するチャンク間で順列の再評価を行う必要がなく、ストリーミングセッション全体を通じて一貫した匿名の話者ラベリングが保証されます。
- 登場順話者キャッシュ(AOSC):チャネルごとに整理された、以前の音声チャンクからの過去の話者表現を保持します。
- 先入れ先出し(FIFO)キュー:アクティブなエンコードウィンドウに対して、直前のフレームコンテキストを直接供給します。
- ライトコンテキストバッファ:現在のチャンクの直後に続く音声を読み込み、正確な話者境界の遷移を支援します。
- 匿名アイデンティティの割り当て:下流のシステムが、アクティブ話者照合やメタデータを介して数値チャネル出力を実際の個人へとマッピングします。
動作レイテンシとベンチマーク性能
本モデルは、チャンクサイズとライトコンテキストに80 msを掛け合わせて算出される、可変の入力バッファ遅延設定に対応しています。NVIDIAは4つの主要な動作ポイントを提示しています。オフライン処理向けの30.4秒に加え、ストリーミング用の1.04秒、0.64秒、0.32秒のバッファです。技術的には極限となる80 msのバッファ設定も可能ですが、NVIDIAは信頼性の高い音声処理のための推奨下限値を0.32秒としています。これらの指標は音声の入力バッファリング時間のみを示しており、ハードウェアの実行時間、ネットワーク転送、自動音声認識の計算時間は含まれていません。
合計約22時間に及ぶ139件の英語会話を対象とした初期のVoice Arena Diarization-Bench評価において、Nemotron 3 Diarizationは12のシステムおよび17の設定の中で第1位を獲得しました。重複発話を含み、システム生成の音声活動検出(VAD)を使用し、カラー許容誤差ゼロの条件下で評価された本モデルは、14.72%のダイアライゼーションエラー率(DER)を記録しました。これは2位となったシステムの19.3%というDERと比較して約24%の相対的なエラー削減を示しており、100 msおよび250 msのカラー幅を設けたオンライン音声や対面音声の評価でも首位を維持しています。なおNVIDIAは、これらのベンチマーク数値はVoice Arenaの最終的なVersion 1レビューの完了時に改定される可能性があると付記しています。
1.04秒のレイテンシ設定においてNVIDIAの従来モデルである4話者チェックポイント(diar_streaming_sortformer_4spk-v2.1)と比較した際、Nemotron 3 Diarizationはテストされた8つの全条件でDERを削減し、CALLHOME-Part2の9.0%からNOTSOFAR1 MHMの65.2%に及ぶ相対的な改善を達成しました。これら8つのベンチマークにおける非加重平均の相対的DER削減率は41.0%に達しました。30.4秒のレイテンシにおける2話者のCALLHOMEでのみ、DERが5.68%から5.98%へとわずかに上昇する単独の後退が見られたものの、CALLHOME-Part2全体の評価では10.32%から9.10%へと改善しました。さらに、NVIDIA RTX PRO 5000 GPU上でBF16精度を用いたバッチサイズ32のコンパイル済みスループットは、30.4秒設定においてリアルタイム係数(RTFx)がベースラインの2,619倍から15,113倍へと大幅に向上しました。
学習データ、デプロイ、実用上の制約
この1億パラメータアーキテクチャの学習には、約1万時間の実会話音声と8万2,611時間の合成複数話者混合音声の組み合わせが必要とされました。合成データセットは21言語にわたるライセンス済みソース音声から構築され、これに加えてDavid AIからライセンス提供を受けた実環境の複数話者録音データが活用されました。David AIのコーパスを組み込んだことで、オフラインおよび超低遅延評価全体における複合ダイアライゼーションエラー率は11.19%から10.42%へと低下しました。
Nemotron 3 DiarizationはHugging Face上でOpenMDW License 1.1のもとで配布されており、商用利用が認められています。本モデルはNVIDIA Ampere、Ada Lovelace、Hopper、またはBlackwell GPUを搭載しPython 3.12以降を備えたLinuxシステム上のNVIDIA NeMo Speechフレームワーク内で動作します。エンドツーエンドの複数話者文字起こしを実現するには、Parakeet TDT 0.6B v3などの音声認識モデルと組み合わせて利用します。デプロイは現在BasetenやDigitalOceanなどのプラットフォームを通じてサポートされており、Argmax Pro SDK 3によってオンデバイス統合も可能となっていますが、Hugging Face Inference Providersには現時点で対応していません。
システムを導入する組織は、モデル固有のアーキテクチャ上の制約を考慮する必要があります。本モデルは同時追跡可能な話者数を厳密に8人までに制限しており、この上限を超える会話では音声の脱落やチャネルの誤割り当てが発生します。また、激しい音響反響、強い背景ノイズ、遠隔マイクによる集音、ドメイン分布の乖離などもダイアライゼーションエラー率を上昇させる要因となります。
企業の音声パイプラインへの実際の影響
会話インテリジェンス、コンタクトセンター分析、リアルタイム会議アシスタントを開発するエンジニアリングチームにとって、Nemotron 3 Diarizationは複雑に重複する対話を解析できる商用利用可能なオープンウェイトコンポーネントを提供します。同時話者数の上限を4人から8人へと倍増させ、ストリーミングモードでも安定したチャネル割り当てを維持できるため、企業はプロプライエタリなブラックボックスの話者分離APIに依存することなく、発言された決定事項を正確に紐付ける応答性の高い文字起こしシステムを構築することが可能になります。
出典
- NVIDIA Releases Nemotron 3 DiarizationMarkTechPost · 2026年9月23日
- Nemotron 3 DiarizationNVIDIA · 2026年9月23日



