Meta 发布 Muse Realtime Avatar:语音流驱动的实时交互化身
alex_conneau · x · 2026-09-25
Meta AI 发布 Muse Realtime Avatar,把 Muse Realtime Voice 的对话能力扩展到实时视觉化身。
- 能力:以参考媒体为条件让任意形象开口——照片呈现细腻表情,全身插画配合手势与姿态变化,动物和日常物品也能富有表现力,且跨对话轮次保持外观与举止连贯
- 架构:Voice 与 Avatar 共享同一条语音 token(VQ)流,保证语音、唇动与表情同步;Avatar 是音频驱动的 Diffusion Transformer,以语音 token 流、参考媒体和近期视频隐变量的滚动窗口为条件,按短因果分块生成,计算量有界,对话可持续多久生成就持续多久
- 项目由 Amaury Sabran 在 Waveforms AI 期间发起、历时近两年,解决了唇同步、蒸馏、长时程一致性、模型效率、手势与多风格支持等问题;前 Meta 语音负责人 Alexandre Conneau 亦公开力挺
所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→
「多模态」频道最新
- Opus 5.5 二十分钟纯代码产出动画配乐配音的启动视频 — cedric_chee · 2026-09-26
- 空歌词喂给音乐模型 YuE 2,竟唱出一堆听不懂的歌词 — SteveLittleFish · 2026-09-26
- 网传「Opus 5.5」出人意料,用户称生成视频几乎零成本零努力 — chaumian · 2026-09-26
- 「视频模型越来越强了」:Reddit 用户分享惊艳生成视频 — we_are_mammals · 2026-09-26
- VLM 网关用 Gemma 从像素直接玩贪吃蛇,端到端延迟低于 240ms — spillai · 2026-09-26
- 用 Opus 编排 Krea MCP 与 Hyperframes,自动导演阿雷西博信息科幻短片 — angrypenguinPNG · 2026-09-26