Nvidia 开源 1 亿参数说话人分离模型,可实时识别 8 人

The Decoder · rss · 2026-09-27

Nvidia 发布了 Nemotron 3 Diarization,一个免费的说话人分离模型:仅约 1 亿参数,可实时识别一段对话中最多 8 个不同说话人,判断每个时刻是谁在讲话。

这类模型对会议转录、字幕生成、语音分析等下游应用是关键组件,小参数量意味着低成本部署和实时运行的可行性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →