NVIDIA 开源 99.2M 参数流式说话人分离模型,可搭配任意 ASR 使用
alexcovo_eth · x · 2026-09-24
NVIDIA Nemotron 3 Diarization 上架 ModelScope,为现有 ASR 工作流加入实时说话人归属能力,无需替换转写模型。
要点:
- 处理流式音频,单次会话最多支持 8 个说话人槽位,输出说话人标签与时间戳
- 端到端流式架构,免去了传统方案中 VAD、说话人嵌入、聚类与后处理的分别拼接
- 99.2M 参数,31 层 Transformer 编码器 + RoPE,基于 NVIDIA Streaming Sortformer 架构
- 可与 Nemotron ASR、Parakeet、Canary、Whisper 等 ASR 系统组合,生成带说话人归属的转写
- 面向会议、客服中心、临床对话、实时字幕、媒体分析与多方语音 agent 场景
- 支持 Ampere、Hopper、Blackwell GPU
所属事件:NVIDIA 开源 Nemotron 3 说话人分离模型,登顶 Diarization-Bench(10 条相关)→
「模型」频道最新
- Qoder 宣布 Qwen3.8-Flash 限时免费,9 月 30 日前所有账户可用 — alifcoder · 2026-09-24
- 网友调侃:OpenAI 后训练团队在憋「Opus 4-5」级模型 — sloppenheimer · 2026-09-24
- Claude Opus 5.5 登顶 VoxelBench,GPT-6 Sol 排第三 — legit_api · 2026-09-24
- 用户实测 GPT 6 电脑操作:一口气驱动 15 个网站改银行信息 — altryne · 2026-09-24
- 10 个月从 28% 到 80%:宜家组装测试暴露多模态跃进 — emollick · 2026-09-24
- Anthropic 工程师回应「Opus 5.5 早期体验」:超出预期 — felixrieseberg · 2026-09-24