MSL 发布 Muse Voice Transcribe:实时流式语音感知模型

bowenc0221 · x · 2026-09-02

MSL(Muse 项目团队)发布 Muse Voice Transcribe,这是其首个流式音频感知模型,可实时完成 ASR(语音识别)、说话人分离(diarization)和端点检测(endpointing)。模型支持长达一小时的音频、20+ 说话人、多语言及无缝语码转换,并提供上下文偏置(contextual biasing)能力。团队表示多模态是人机交互的核心层,Muse Voice Transcribe 是把其实时语音交互模型带给公众的第一步,后续将继续迭代并构建完整的语音交互系统。

所属事件:Meta 发布 Muse Voice Transcribe 实时语音转录模型(9 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →