Meta 发布 Muse Realtime Avatar:语音驱动实时数字人,延迟约 870ms
alex_conneau · x · 2026-09-24
Meta AI Research 发布 Muse Realtime Avatar,将 Muse Realtime Voice 的对话智能扩展为可实时交互的具身形象,响应延迟约 870ms,即将上线 Muse 与 Muse Charm 产品。
技术要点:
- 语音与形象共享同一条语音 token(VQ)流:Muse Realtime Voice 生成携带内容与情感的语音 token,音频解码器合成语音,Avatar 模型消费同一条流生成画面,保证语音、口型、表情天然同步。
- Avatar 是音频驱动的 Diffusion Transformer,以语音 token 流、参考媒体和近期视频 latent 的滚动窗口为条件,按因果短块生成视频;每块生成的最新 latent 成为下一块的运动上下文,使外观与举止在多轮对话间保持连贯,生成时长可随对话无限延续。
- 不只让肖像开口:全身插画会配合说话做手势、动物与日常物品也能获得表情化表现,且不失去各自特色。
- 只需参考图即可让任意形象进入实时对话。
所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→
「模型」频道最新
- Opus 擅长做 IK 骨架,也擅长用 IK 骨架做动画 — andrew_n_carr · 2026-09-26
- o1-preview 两周年:推理模型从孤例变成前沿标配 — ArtificialAnlys · 2026-09-26
- 开源评测 JevBench 推出付费优先通道:$49/$99 一项,48 小时出结果 — airesearch12 · 2026-09-26
- 8B 模型跑在 2017 年老笔记本上:端侧智能时代悄然临近 — netherreddit · 2026-09-26
- 好side 晒名场面:Claude Opus 5.5 一口气画出 100 张 matplotlib 图 — goodside · 2026-09-26
- 网传「Opus 5.5」出人意料,用户称生成视频几乎零成本零努力 — chaumian · 2026-09-26