Nvidiaが、会話の中で「誰がいつ話しているか」を識別する音声ダイアライゼーション(話者識別)モデル「Nemotron 3 Diarization」を無料公開した。パラメータ数は約1億とコンパクトながら、最大8人までの発話者をリアルタイムで識別できる。モデルはオープンウェイトでHugging Face上に公開されており、開発者は自由にダウンロードして自社のアプリケーションに組み込める。

会話文字起こしの精度を左右する「話者識別」という課題

音声認識(ASR)は「何を話したか」をテキスト化する技術だが、複数人が参加する会議やポッドキャストでは「誰が話したか」を区別できなければ、実用的な文字起こしにはならない。この「誰が・いつ話したか」を特定する処理がダイアライゼーションであり、ASRと組み合わせることで初めて発言者付きの議事録が作れる。Nemotron 3 Diarizationは、Nvidiaの音声認識モデル「Parakeet」などと組み合わせて使うことを想定しており、会議の自動議事録やコールセンターの通話分析、ポッドキャストの編集作業といった用途を見据えている。

前世代比41%のエラー削減、8人の同時発話にも対応

Nemotron 3 Diarizationは、対応可能な話者数を前世代の4人から8人に拡張したほか、複数人が同時に発話する重複音声の検出にも対応する。録音済み音声の一括処理だけでなく、ライブ配信のようなストリーミング音声にも対応しており、レイテンシーは0.32秒から30.4秒まで4段階で調整できる。

性能面では、話者識別の精度を競う「VoiceArena Diarization Benchmark」でエラー率14.72%を記録し、公開されているモデルの中で首位に立った。次点のモデルのエラー率は19.3%で、Nvidiaによれば1.04秒のレイテンシー設定において前世代モデル比で平均41%のエラー率削減を達成しているという。処理速度についても、バッチサイズ32の条件下でリアルタイムの15,113倍という速度を記録しており、大量の音声データをまとめて処理する用途でも実用的な速度を確保している。

オープンウェイトという選択が広げる用途

商用の音声文字起こしサービスの多くは話者識別機能をクラウドAPI経由でしか提供していないが、Nemotron 3 Diarizationはオープンウェイトモデルのため、開発者は自前のサーバーやエッジデバイス上でモデルを動かせる。医療機関の診察記録や法律相談の議事録など、音声データを外部サービスに送りたくない用途でも導入しやすくなる点は、企業や自治体のシステム担当者にとって実務上の利点になる。100Mパラメータという小型サイズも、GPUリソースが限られた環境での運用を後押ししそうだ。