Nvidia 开源 1 亿参数说话人分离模型,可实时识别 8 人
The Decoder · rss · 2026-09-27
Nvidia 发布了 Nemotron 3 Diarization,一个免费的说话人分离模型:仅约 1 亿参数,可实时识别一段对话中最多 8 个不同说话人,判断每个时刻是谁在讲话。
这类模型对会议转录、字幕生成、语音分析等下游应用是关键组件,小参数量意味着低成本部署和实时运行的可行性。
「模型」频道最新
- rasbt 与 marlene_zw 对谈:Claude 水印与推理模型技术拆解 — marlene_zw · 2026-09-27
- Anthropic Opus 5.5 惊人高效:能力顶级,费率还出奇便宜 — kimmonismus · 2026-09-27
- 本地 AI 社区喊话 Qwen:回归 35B 级 MoE,救活 4-16GB 显存用户 — julianharris · 2026-09-27
- Grok 4.7 跑分升至 38%,输出 token 多耗 125% — dl_weekly · 2026-09-27
- TypeSafe 推出决策专用模型 Jev:返回类型化决策而非生成文本 — Rahulstark2 · 2026-09-27
- Codex 团队频繁暗示「速度」,传 GPT-6 Astra 或登 Cerebras — haider1 · 2026-09-27