专题 · FULL STORY

NVIDIA 开源说话人分离模型 Nemotron 3

9 月 23 日 NVIDIA 发布并开源参数量仅 100M 的 Nemotron 3 Diarization 说话人分离模型,登顶 Diarization-Bench 榜单;次日 Baseten 即以 day 0 支持上线,单卡可实现 500 路实时分离。

2026-09-23 ~ 2026-09-24 · 2 集 · 9 条

第 1 集 · NVIDIA 开源 Nemotron 3 说话人分离模型并登顶 Diarization-Bench(2026-09-23,7 条)

NVIDIA 于 9 月 23 日发布并开源 Nemotron 3 Diarization 说话人分离模型。该模型参数量仅 100M,可在多人重叠语音中追踪「谁在何时说话」,支持批处理与流式两种输出模式,最多跟踪 8 个说话人,已在 Hugging Face 上提供并采用商业友好许可证,可用于为现有 ASR 工作流加入实时说话人归属能力而无需替换转写模型。它在 voicearena.ai 首轮 Diarization-Bench 的 12 个系统中排名第一,分离错误率 14.72%,比第二名低约 24%。

已确认

  • Nemotron 3 Diarization 由 NVIDIA 官方发布并开源,已上架 Hugging Face,@alexcovoeth 转发称其也上架 ModelScope;参数量 100M(转发帖称 99.2M),支持最多 8 个说话人,输出说话人标签与时间戳而非转写文本。
  • 官方基准成绩:在 voicearena.ai 首轮 Diarization-Bench 的 12 个系统中排名第一,错误率 14.72%,比第二名低约 24%。
  • 模型支持批处理与流式两种模式,可搭配任意 ASR 使用。

开发者实测与评价

  • @futterneid 用 1 秒流式分块做本地语音 agent 实测,认为该模型解决了「谁在说话」这一痛点,可用于让机器人记忆不同说话人(新面孔)。
  • @andimarafioti 指出当前语音 agent 的关键缺口正是分不清说话人身份,各类电话演示掩盖了这一点;Nemotron 3 Diarization 采用商业友好许可证,适合实际落地。
  • @Sam Witteveen 发布视频介绍该模型,称其在「谁在什么时候说话」的任务上大幅超越同类模型。

为什么重要

  • 说话人分离是实时语音 agent(会议转录、客服、家庭机器人等场景)的长期短板,此前开源方案在重叠语音下表现不佳。
  • 小参数量(100M)+ 流式输出 + 商业友好许可的组合意味着本地部署门槛低,个人开发者(如 @futterneid 的实践所示)也能直接接入自己的语音 agent 管线,且可作为插件与任意 ASR 组合而不必更换转写模型。

第 2 集 · Baseten 上线 NVIDIA 说话人分离模型,单卡 500 路(2026-09-24,2 条)

NVIDIA 开源的端到端实时说话人分离模型 Nemotron 3 Diarization 以 day 0 支持上线 Baseten Model Library,单张 GPU 即可支持 500 路实时分离流,定位为替代传统分离方案的高性能选择。Baseten 同时提供了部署入口,用户可在平台上一键部署该模型。