Meta发布实时语音模型Muse,支持20人说话人分离

bowenc0221 · x · 2026-09-02

Meta 发布了 Muse Voice Transcribe,这是其首个流式音频感知模型,集成了 ASR、说话人分离和端点检测功能。该模型支持 70+ 种语言训练(首发 25 种)、长时音频(1小时+)、20+ 说话人以及句内语码转换。其核心贡献是通过强化学习实现了“自适应延迟”,仅在处理困难词汇时增加延迟,从而在速度和准确性上达到新的帕累托前沿。目前已通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 提供使用。

所属事件:Meta 发布 Muse Voice Transcribe 实时语音转录模型(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →