Meta 详解 Muse 实时语音架构:VQ token 流驱动音视频双解码
alex_conneau · x · 2026-09-24
Meta 的 Muse Realtime Voice 持续生成 VQ token:由语音解码器重建音频,一个 audio2video 解码器生成视频分块,实现约 870ms 延迟的实时对话 Avatar。作者称用扩散视频生成做 Avatar 虽是「暴力解法」,但核心在于这套高度优化的架构未来可扩展到更丰富的语音驱动交互世界——实时视频生成让 AI 不仅有声音,还有表情、身体和上下文。
所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→
「模型」频道最新
- Opus 擅长做 IK 骨架,也擅长用 IK 骨架做动画 — andrew_n_carr · 2026-09-26
- o1-preview 两周年:推理模型从孤例变成前沿标配 — ArtificialAnlys · 2026-09-26
- 开源评测 JevBench 推出付费优先通道:$49/$99 一项,48 小时出结果 — airesearch12 · 2026-09-26
- 8B 模型跑在 2017 年老笔记本上:端侧智能时代悄然临近 — netherreddit · 2026-09-26
- 好side 晒名场面:Claude Opus 5.5 一口气画出 100 张 matplotlib 图 — goodside · 2026-09-26
- 网传「Opus 5.5」出人意料,用户称生成视频几乎零成本零努力 — chaumian · 2026-09-26