MSL 发布 Muse Voice Transcribe:实时流式语音感知模型
bowenc0221 · x · 2026-09-02
MSL(Muse 项目团队)发布 Muse Voice Transcribe,这是其首个流式音频感知模型,可实时完成 ASR(语音识别)、说话人分离(diarization)和端点检测(endpointing)。模型支持长达一小时的音频、20+ 说话人、多语言及无缝语码转换,并提供上下文偏置(contextual biasing)能力。团队表示多模态是人机交互的核心层,Muse Voice Transcribe 是把其实时语音交互模型带给公众的第一步,后续将继续迭代并构建完整的语音交互系统。
所属事件:Meta 发布 Muse Voice Transcribe 实时语音转录模型(9 条相关)→
「多模态」频道最新
- vLLM-Omni 把 MiniMax H3 做到生成快于播放:10.1 秒视频 8.7 秒出片 — vllm_project · 2026-09-02
- vLLM+FastVideo 实现视频生成快于播放,10.1s 视频仅用 8.7s — vllm_project · 2026-09-02
- NVIDIA 发技术报告:DLSS 5 靠生成突破重建式渲染上限 — ctnzr · 2026-09-02
- 商汤 U1.5 Lite 开源:支持复杂指令与 4K 原生生成 — HeyToha · 2026-09-02
- Midjourney v8.2 生成「最后的雨之王」漫步洪涝之城 — tisch_eins · 2026-09-02
- 求助:ComfyUI 中 Flux2-dev 的 ControlNet 无法工作 — External-Orchid8461 · 2026-09-02