Meta 发布 Muse Voice: 70+ 语言实时语音转录模型
bowenc0221 · x · 2026-09-02
Meta 发布了首个实时音频感知模型 Muse Voice Transcribe。该模型在流式语音转文字方面达到 SOTA,支持 70 多种语言,并原生支持说话人分离和端点检测。
所属事件:Meta 发布 Muse Voice Transcribe 实时语音转录模型(8 条相关)→
「多模态」频道最新
- 商汤 U1.5 Lite 开源:支持复杂指令与 4K 原生生成 — HeyToha · 2026-09-02
- Midjourney v8.2 生成「最后的雨之王」漫步洪涝之城 — tisch_eins · 2026-09-02
- 求助:ComfyUI 中 Flux2-dev 的 ControlNet 无法工作 — External-Orchid8461 · 2026-09-02
- 具备全相机控制与 3D 一致性的视频模型亮相 — drfeifei · 2026-09-02
- OpenGPEX:集成 ComfyUI 的开源浏览器图像编辑器 — only1onely · 2026-09-02
- 研究员解读 Atlas:结合生成与重建两大视觉任务 — georgiagkioxari · 2026-09-02