英伟达发布了 Nemotron 3 Diarization。The Decoder 9 月 27 日报道,这个模型判断一段对话里此刻是谁在说话,大约 1 亿参数,权重可以免费取得。它能分开至多八名说话人,也能发现多人同时开口。人再多、背景噪声大,或者房间有混响,错误率会升高。

和 Parakeet 这类语音识别接在一起,它可以给转写加上说话人标签。标签是匿名的,例如 speaker_2。录音和实时音频都能用。本篇没有另行打开排行榜,数字来自 The Decoder,文末注明来源是 Hugging Face。

[1]
铜版:八把空椅子,只有一把落着更深的影子。
八把椅子里只有一把影子更重。它对应至多八名说话人里正在开口的那一个,不是会议照片。, AI 生成插画,不是新闻照片

VoiceArena 的 Diarization-Bench 上,报道写道,这个免费模型目前排第一,错误率 14.72%,下一名是 19.3%。基准把重叠说话算进去,说话人切换处很小的时间错位也算错。和前代 Streaming Sortformer 比,在 1.04 秒缓冲、八个测试场景上,错误率平均下降 41%。同一篇里还有一处写成 DER 14.7%,并说在这项基准上领先前代 41%。两处都保留:14.72% 是榜上的错误率,41% 对应的是 1.04 秒缓冲下八个场景的平均降幅,不是任意房间里的降幅。

音频缓冲有四档,从 30.4 秒收到 0.32 秒。缓冲越短,准确率一般越低。

[1]

这些数字没有说清测试音频是会议、电话还是演播室,也没有说八名说话人是否就是日常会议的上限之外还能不能用。报道已经写了边界:人再多、噪声大、混响重,错误率上去;缓冲缩短,准确率一般下降。因此不能把「榜上第一」读成任何现场都能分清谁在说话。权重免费,也不等于已经接到某一家产品的转写服务里。本篇没有另做评测。

[1]

要点

  • Nemotron 3 Diarization 约 1 亿参数,权重免费,至多区分八名说话人。
  • VoiceArena 榜上错误率 14.72%,下一名 19.3%;1.04 秒缓冲下八个场景平均降 41%。
  • 缓冲从 30.4 秒到 0.32 秒,越短一般越不准。
  • 人更多、噪声或混响会抬高错误率。标签是匿名的。