Meta发布实时语音模型Muse,支持20人说话人分离
bowenc0221 · x · 2026-09-02
Meta 发布了 Muse Voice Transcribe,这是其首个流式音频感知模型,集成了 ASR、说话人分离和端点检测功能。该模型支持 70+ 种语言训练(首发 25 种)、长时音频(1小时+)、20+ 说话人以及句内语码转换。其核心贡献是通过强化学习实现了“自适应延迟”,仅在处理困难词汇时增加延迟,从而在速度和准确性上达到新的帕累托前沿。目前已通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 提供使用。
所属事件:Meta 发布 Muse Voice Transcribe 实时语音转录模型(8 条相关)→
「模型」频道最新
- Anthropic 发布 Claude 5.1 编程与知识工作新模型 — kieranklaassen · 2026-09-02
- Every 实测 Anthropic Fable 5.1:接棒最佳编码模型 — every · 2026-09-02
- 实测:Claude 5.1 编码能力极强,可从单一提示重建应用 — every · 2026-09-02
- 开发者评测:Claude 5.1 适合各阶段开发者,合作感极强 — every · 2026-09-02
- Fable 5.1 评测暴涨:Terminal/Science 跳升巨大 — kimmonismus · 2026-09-02
- Anthropic Fable 5.1 上线 Claude Code v2.1 — BLUECOW009 · 2026-09-02