NVIDIA 开源 Nemotron 3 Diarization,登顶说话人分离基准
NVIDIA 于 9 月 23 日发布并开源 Nemotron 3 Diarization 说话人分离模型。该模型参数量仅 100M,可在多人重叠语音中追踪「谁在何时说话」,支持批处理与流式两种输出模式,最多跟踪 8 个说话人,已在 Hugging Face 上提供并采用商业友好许可证。它在 voicearena.ai 首轮 Diarization-Bench 的 12 个系统中排名第一,分离错误率 14.72%,比第二名低约 24%。
已确认
- Nemotron 3 Diarization 由 NVIDIA 官方发布并开源,已上架 Hugging Face,参数量 100M,支持最多 8 个说话人,输出为说话人标签而非转写文本。
- 官方基准成绩:在 voicearena.ai 首轮 Diarization-Bench 的 12 个系统中排名第一,错误率 14.72%,比第二名低约 24%。
- 模型支持批处理与流式两种模式。
开发者实测与评价
- @futterneid 用 1 秒流式分块做本地语音 agent 实测,认为该模型解决了「谁在说话」这一痛点,可用于让机器人记忆不同说话人(新面孔)。
- @andimarafioti 指出当前语音 agent 的关键缺口正是分不清说话人身份,各类电话演示掩盖了这一点;Nemotron 3 Diarization 采用商业友好许可证,适合实际落地。
- @Sam Witteveen 发布视频介绍该模型,称其在「谁在什么时候说话」的任务上大幅超越同类模型。
为什么重要
- 说话人分离是实时语音 agent(会议转录、客服、家庭机器人等场景)的长期短板,此前开源方案在重叠语音下表现不佳。
- 小参数量(100M)+ 流式输出 + 商业友好许可的组合意味着本地部署门槛低,个人开发者(如 @futterneid 的实践所示)也能直接接入自己的语音 agent 管线。
2026-09-23 ~ 2026-09-23 · 6 条相关
- 第 1 集:NVIDIA 开源 Nemotron 3 Diarization,登顶说话人分离基准(2026-09-23,6 条)
- 第 2 集:Baseten 上线 NVIDIA 说话人分离模型,单卡 500 路(2026-09-24,2 条)
一手来源
- NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI ·
- Nemotron 3 说话人分离登顶 Diarization-Bench:错误率低 24% — NVIDIAAI ·
- Nemotron 3 Diarization 实测:流式识别 8 说话人,接入机器人记忆新面孔 — futterneid ·
- 【源头】NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI · 2026-09-23
- 【源头】Nemotron 3 说话人分离登顶 Diarization-Bench:错误率低 24% — NVIDIAAI · 2026-09-23
- NVIDIA 开源 Nemotron 3 Diarization,补上语音 agent 认人短板 — andimarafioti · 2026-09-23
- 【源头】Nemotron 3 Diarization 实测:流式识别 8 说话人,接入机器人记忆新面孔 — futterneid · 2026-09-23
- NVIDIA发布Nemotron 3说话人分离模型,性能大幅领先 — Sam Witteveen · 2026-09-23
另有 1 条近重复转述:NVIDIAAI