NVIDIA 系统研究流式多说话人 ASR,梳理四种架构权衡入选 Interspeech 2026

alexcovo_eth · x · 2026-09-12

NVIDIA 研究团队(Taejin Park、Ivan Medennikov、Boris Ginsburg 等)在 arXiv 发布论文《Pushing the Boundaries of Streaming Multi-Speaker ASR》,已被 Interspeech 2026 接收。

论文将流式多说话人 ASR 按 diarization 与 ASR 的集成方式归纳为四种架构策略:是否使用多模型实例、是否微调、或两者兼用。以同一对开源流式 ASR 与说话人分离模型为基础,作者构建了四个系统,并在多说话人准确率、单说话人准确率退化、内存占用与训练复杂度四个维度上评估。

结论:论文厘清了流式多说话人 ASR 的设计空间,给出了在不同部署约束(延迟、算力、内存)下选择合适架构的实用指南。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →