Meta 详解 Muse 实时语音架构:VQ token 流驱动音视频双解码

alex_conneau · x · 2026-09-24

Meta 的 Muse Realtime Voice 持续生成 VQ token:由语音解码器重建音频,一个 audio2video 解码器生成视频分块,实现约 870ms 延迟的实时对话 Avatar。作者称用扩散视频生成做 Avatar 虽是「暴力解法」,但核心在于这套高度优化的架构未来可扩展到更丰富的语音驱动交互世界——实时视频生成让 AI 不仅有声音,还有表情、身体和上下文。

所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →