NVIDIA 发布仅 0.1B 的实时说话人分离模型,登顶基准榜
udmrzn · x · 2026-09-25
- NVIDIA AI 官方发布 Nemotron 3 Diarization 说话人分离模型,仅 100M 参数,却在说话人分离基准上大幅领先,已在 Hugging Face 开源。
- 传统方案需要 VAD、说话人 embedding、聚类等多阶段流水线,又慢又复杂;该模型直接从音频输出说话人标签,本地运行接近实时,支持最低 320 毫秒间隔的超低延迟流式分析。
- 可处理最多 8 人同时说话的重叠对话,适合会议转写、播客分析等多种场景接入。
所属事件:NVIDIA 开源 Nemotron 3 说话人分离模型登顶基准(13 条相关)→
「模型」频道最新
- Opus 5.5 一条提示词复刻 Minecraft:1 小时约 20 美元搞定 — amasad · 2026-09-25
- 用户实测:Opus 新版 Medium 推理档表现佳,High 反显多余 — rudrank · 2026-09-25
- PINNACLE 评测:GPT-6 Sol 拉满思考力错误降 2.5 倍,Claude Opus 5.5 无效 — ryanshrout · 2026-09-25
- 4B 开源小模型登顶 JevBench,靠更快更便宜击败大模型 — airesearch12 · 2026-09-25
- Terminal-Bench-Science 榜单上线:GPT-6 Astra 与 Claude Opus 5.5 领跑 — scaling01 · 2026-09-25
- 用户晒 Opus 5.5 文风进化:终于能删掉「别写得像二货」自定义指令 — generativist · 2026-09-25