Meta 发布 Muse Realtime Avatar 研究博客:任意图片实时化为可对话化身
AIatMeta · x · 2026-09-24
Meta 发布 Muse Realtime Avatar 研究博客。核心要点:
- 能力:基于参考媒体(照片/插画/动物/物品)将任意形象带入实时对话,生成富有表现力的面部、手势与全身动作,外观与举止跨轮次保持连贯。
- 统一流式架构:Muse Realtime Voice 提供对话智能并产出携带内容与韵律的 speech token(VQ)流;音频解码器转成语音,Avatar 消费同一 token 流生成对应视觉表演,天然保持声画同步。
- 模型:音频驱动的 Diffusion Transformer,以语音 token 流、参考媒体和滚动窗口的近期视频 latent 为条件,以短因果块生成视频;每块生成的最新 latent 成为下一块的运动上下文,计算量有界,对话可无限延续。
- 配套推文串还披露 2 步蒸馏学生模型与盲测胜出商用系统的结果。
所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→
「多模态」频道最新
- Opus 5.5 二十分钟纯代码产出动画配乐配音的启动视频 — cedric_chee · 2026-09-26
- 空歌词喂给音乐模型 YuE 2,竟唱出一堆听不懂的歌词 — SteveLittleFish · 2026-09-26
- 网传「Opus 5.5」出人意料,用户称生成视频几乎零成本零努力 — chaumian · 2026-09-26
- 「视频模型越来越强了」:Reddit 用户分享惊艳生成视频 — we_are_mammals · 2026-09-26
- VLM 网关用 Gemma 从像素直接玩贪吃蛇,端到端延迟低于 240ms — spillai · 2026-09-26
- 用 Opus 编排 Krea MCP 与 Hyperframes,自动导演阿雷西博信息科幻短片 — angrypenguinPNG · 2026-09-26