Meta 发布 Muse Voice Transcribe:流式语音转写 SOTA
9 月 2 日,Meta Superintelligence Labs 正式发布首个实时音频感知模型 Muse Voice Transcribe,在流式语音转文字(ASR)任务上达到 SOTA 水平。据 Artificial Analysis,该模型在 AA-WER Streaming 基准上以 3.1% WER 夺得最终转录准确率第一。这是 Meta 从语音转录切入实时音频感知的第一款产品,Scale AI 创始人 Alexandr Wang 同日发文介绍,多位独立观察者(如 @rohanpaulai、@bowenc0221)密集转发,该发布被视为 Scale AI 与 Meta 整合后的标志性成果。
已确认
- 模型核心能力由 Meta 官方账号 @AIatMeta 确认:低延迟实时流式 ASR、说话人分离(支持 20+ 说话人)、端点检测(endpointing),三者原生集成于单一模型
- 训练覆盖 70+ 种语言,首发支持 25 种,具备多语言无缝语码转换能力,可处理句内语码转换
- 支持长达 1 小时以上的长时音频处理
- 支持通过语言、关键词、上下文进行偏置(biasing)以提升识别准确率
- @AIatMeta 补充技术细节:模型在速度与准确性的权衡上达到帕累托最优,采用自适应延迟机制——简单词汇快速输出、困难词汇等待更久,该特性通过结合词错误率和延迟奖励的强化学习训练实现
- 据 @testingcatalog,模型已上线 Meta 模型 API,提供零数据保留(zero data retention)层级,并可在 Meta 桌面应用和 Muse Code 中使用
为什么重要
- 实时 ASR + 说话人分离 + 端点检测三项能力原生集成在单一模型中,省去传统流水线拼接,对实时翻译、会议记录、语音助手等场景有直接应用价值
- 20+ 说话人分离和句内语码转换是此前同类模型的常见短板,Meta 此举直接瞄准多语言、多人对话的真实场景
- 自适应延迟与 RL 训练范式为流式 ASR 的速度-精度权衡提供了新解法
- 零数据保留层级降低企业隐私合规门槛,显示 Meta 面向商业 API 服务的布局
2026-09-02 ~ 2026-09-02 · 10 条相关
一手来源
- Meta 发布 Muse Voice Transcribe:支持 20+ 人声分离 — AIatMeta ·
- Scale AI 发布 Muse Voice:实时语音转文字 SOTA — alexandr_wang ·
- Meta 推出 Muse 语音转写:准确率登顶 — ArtificialAnlys ·
- Meta 发布 Muse Voice: 70+ 语言实时语音转录模型 — bowenc0221 · 2026-09-02
- Meta Muse Voice 模型登陆 API,支持零数据保留 — testingcatalog · 2026-09-02
- Muse Voice Transcribe:自适应延迟平衡速度与精度 — AIatMeta · 2026-09-02
- 【源头】Meta 发布 Muse Voice Transcribe:支持 20+ 人声分离 — AIatMeta · 2026-09-02
- Meta发布实时语音模型Muse,支持20人说话人分离 — bowenc0221 · 2026-09-02
- MSL 发布 Muse Voice Transcribe:实时流式语音感知模型 — bowenc0221 · 2026-09-02
- 【源头】Scale AI 发布 Muse Voice:实时语音转文字 SOTA — alexandr_wang · 2026-09-02
- 【源头】Meta 推出 Muse 语音转写:准确率登顶 — ArtificialAnlys · 2026-09-02
另有 2 条近重复转述:bowenc0221 · rohanpaul_ai