MOSS-TD 可转写 90 分钟多人音频并标注说话人
udmrzn · x · 2026-07-21
这篇文章介绍了一种面向长音频转写的 speaker-aware ASR 系统 MOSS-TD:
- 目标场景是 90 分钟级别的多说话人音频,而不是短句式语音识别。
- 它不只是把语音转成文字,还会同时判断 谁在什么时候说话。
- 这意味着它更适合会议、播客、访谈等长、杂乱、多人轮流发言的场景,因为说话人归属和转写准确性同样重要。
所属事件:OpenMOSS发布多人长音频转写模型MOSS-TD(2 条相关)→
「研究」频道最新
- Google DeepMind 分享 Project Genie 的创作者协作幕后 — alexanderchen · 2026-07-21
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21
- 线程称 GPT-5.6 Sol 帮忙构造出 Jacobian 猜想反例工厂 — LucaAmb · 2026-07-21
- TimeLens2 以 4B 和 8B 模型拿下 7 项视频定位 SOTA — _akhaliq · 2026-07-21
- 真实数学进展常靠推翻旧直觉 — LucaAmb · 2026-07-21
- EPO 用边缘对齐同时优化 3D 模型位姿与深度 — ducha_aiki · 2026-07-21