Meta 推出 MuseVoiceTranscribe:支持 20+ 说话人的实时语音感知
智东西 · wechat · 2026-09-02
Meta 发布了首个实时音频感知模型 MuseVoiceTranscribe,该模型旨在将语音转写升级为 AI 系统的实时感知层。主要能力与特性包括:
- 多语言与长音频:支持 70+ 种语言训练(25 种已验证),可原生处理超过 1 小时的长音频,支持无缝语码切换(如中英夹杂)。
- 多人说话人分割:原生支持超过 20 位说话人的语音分割,无需后处理,能精准识别说话人切换。
- 流式处理与自适应延迟:采用自回归多模态架构,以 80ms 为单位处理音频。通过强化学习(RL)实现“自适应延迟”,模型可根据单词难度动态决定监听时长,在速度和准确率间实现帕累托最优。
- 端点检测:引入特殊 token 标记语音开始和结束,实现精准的语音端点检测。
该模型已集成至 Meta AI、MuseCode 及 MetaModelAPI,定价约为每 1000 分钟 3 美元。
所属事件:Meta 发布 Muse Voice Transcribe 实时语音转写模型(15 条相关)→
「多模态」频道最新
- World Labs Atlas 或加速人形机器人 real2sim2real 训练 — CyberRobooo · 2026-09-02
- Opus 5 模型展示呼吸练习:不仅会说话,还会控制节奏 — repligate · 2026-09-02
- Fable 5 与 5.1 自画像对比:移除新系统提示词后重测 — repligate · 2026-09-02
- Field Life 展示 3D 生成能力 — BertChakovsky · 2026-09-02
- ReFlowSET:潜空间流匹配实现高保真 SAR 到光学图像翻译 — KAIST · 2026-09-02
- 解析原生统一多模态模型:理解与生成如何真正协同 — Penghao Wu · 2026-09-02