专题 · FULL STORY
Meta Muse 实时数字人:从发布到实测
Meta 在 Connect 大会官宣 Muse Realtime Avatar,实现 870ms 实时音画同步的交互数字人。随后前 Meta 研究员指出这只是起点,将融合 LLM 与世界模型,竞品 LemonSlice 也发布对比实测,产品从演示走向实用。
2026-09-24 ~ 2026-09-26 · 3 集 · 23 条
第 1 集 · Meta Connect 发布 Muse Realtime Avatar,870ms 实时音画同步数字人(2026-09-24,18 条)
9 月 24 日,Meta 在 Connect 大会上由扎克伯格亲自官宣 Muse Realtime Avatar,Alexandr Wang、语音团队负责人 Alex Conneau 等人同步扩散:该技术把 Muse Realtime Voice 的语音流实时转化为可对话的数字化身,说话时同步生成动画,语音与视频同步,响应延迟约 870ms,支持无限时长持续对话,即将上线 Muse 与 Muse Charm 产品,用户可自建角色。官方同期发布研究博客披露能力与底层技术,并组织盲测称用户偏好显著优于 Runway 与 HeyGen 的同类产品。
已确认
- Muse Realtime Avatar 与 Muse Realtime Voice 配套,可在对话时实时驱动用户的 Muse 数字形象。
- 能力覆盖人像照片的细腻表情、全身插画角色的手势与姿态变化,动物和日常物品也能被驱动;外观与举止跨轮次保持连贯。
- 响应延迟约 870ms,支持无限时长持续对话;Conneau 称该模型达到 SOTA 水平,并针对延迟与并发深度优化以支撑 Meta 规模的服务。
- 架构方面,Meta 官方介绍统一流式架构:Muse Realtime Voice 持续生成 VQ speech token 流,由语音解码器重建音频,audio2video 解码器生成视频分块,通过共享 speech token 流连接对话智能、语音与视频化身,实现实时同步。
- 视频生成技术方案:将带 3 路 CFG、每视频块需 120 次评估的 40 步扩散教师模型,蒸馏为无引导的 2 步因果学生模型,并使用固定长度 KV cache 与 self-forcing,使评估次数减少 60 倍;Conneau 指出用扩散视频生成做实时 Avatar 是关键工程挑战。原 Waveforms 创始人 kakemeister 介绍,团队过去两年在 Meta 重建了实时 AI 推理栈,同时支撑实时语音与视频对话。
- Conneau 表示该项目由语音、视频生成、Infra 与产品等多团队协作完成,并将其视为「实时交互视频生成」愿景的起点,是 #SeeTheAGI 研究旅程的延续。
盲测对比
- Meta 团队将 Muse Realtime Avatar 与 Runway Characters、HeyGen LiveAvatar 做同角色直播对话对比:评分者进行 2–3 分钟匹配形象的真人对话,比较视觉质量、口型同步、角色一致性与举止自然度,结果显示用户更偏好 Muse,端到端人类评测整体胜率达 88%。该对比由 Meta 自身组织,结论为官方口径。
为什么重要
- 实时音画同步的数字人直接对标 HeyGen、Runway 等商业化产品,且官方盲测 88% 胜率,显示 Meta 在该赛道的竞争意图;统一 speech token 流架构为多模态实时交互提供了可复用技术路径,而将 40 步扩散教师蒸馏为 2 步因果学生的方案(评估次数减少 60 倍)展示了实时视频生成的工程化思路,约 870ms 的亚秒级响应与无限时长对话进一步降低了实时虚拟人的落地门槛。
- Meta 发布 Muse Realtime Avatar:亚秒级音画同步数字人 — alexandr_wang · 2026-09-24
- 官方盲测:用户更偏好 Muse 数字人,胜过 HeyGen 与 Runway — alexandr_wang · 2026-09-24
- Meta 发布 Muse Realtime Avatar,语音驱动实时数字人对话 — alexandr_wang · 2026-09-24
- Meta 发布 Muse 实时数字人:语音视频同步,响应不到一秒 — Scobleizer · 2026-09-24
- Muse 发布实时数字人 Avatar:音视频同步,亚秒级响应 — mrjonfinger · 2026-09-24
- 扎克伯格发布 Muse Realtime Avatar:语音模型实时驱动任意形象开口说话 — AIatMeta · 2026-09-24
- Meta 揭秘 Muse 流式架构:语音与视频化身共享 speech token 流实现实时同步 — AIatMeta · 2026-09-24
- Muse 实时视频生成核心技术:40 步扩散教师蒸馏为 2 步因果学生 — AIatMeta · 2026-09-24
- Meta 实测 Muse Realtime Avatar:盲测偏好胜两大商用数字人系统 — AIatMeta · 2026-09-24
- Meta 发布 Muse Realtime Avatar 研究博客:任意图片实时化为可对话化身 — AIatMeta · 2026-09-24
- Muse 实时 Avatar 人评 88% 胜率,延迟压至约 870ms — alex_conneau · 2026-09-24
- Meta 发布 Muse Realtime Avatar:870ms 实时对话数字人 — alex_conneau · 2026-09-24
- Meta 发布 Muse Realtime Avatar:语音驱动实时数字人,延迟约 870ms — alex_conneau · 2026-09-24
- Meta 详解 Muse 实时语音架构:VQ token 流驱动音视频双解码 — alex_conneau · 2026-09-24
- Meta 研究者勾勒实时交互视频生成愿景:与 AI 面对面交谈 — alex_conneau · 2026-09-24
- Meta 推出 Muse 实时数字人,迈向实时交互视频生成 — alex_conneau · 2026-09-24
- Meta 发布 Muse Realtime Avatars,实时视频生成推理栈成核心难点 — ukhndlwl · 2026-09-25
- Meta 发布 Muse Realtime Avatar:语音流驱动的实时交互化身 — alex_conneau · 2026-09-25
第 2 集 · 前Meta研究员:实时交互视频生成将融合LLM与世界模型(2026-09-25,2 条)
前 Meta 研究员 Alexandre Conneau 在转发 #SeeTheAGI 话题时阐述了其研究路线:刚发布的 v1 版 Avatar 只是起点,更大的目标是实时交互式视频生成。他认为这一方向正在把当下两类新兴智能——LLM 与视频生成世界模型——结合起来,被视为迈向 AGI 的重要路径。
- Meta 研究员谈 SeeTheAGI:目标是实时交互式视频生成 — alex_conneau · 2026-09-25
- 前Meta研究者:实时交互视频生成正融合LLM与世界模型两大智能 — alex_conneau · 2026-09-26
第 3 集 · Meta Muse 上线实时 AI 头像,LemonSlice 随即发对比实测(2026-09-25,3 条)
Meta 宣布其产品 Muse 正式支持实时交互式 AI 数字人头像,被外界视为 AI 头像从演示走向实用的标志。竞品数字人方案 LemonSlice 随即发布与 Muse 的对比视频,展示自家实时头像能力与 Meta 方案的差异,自称在效果上不落下风,凸显「实时化」已成数字人赛道的竞争焦点。
- Meta Muse 上线实时数字人头像,LemonSlice 发对比实测 — hey_abusiddik · 2026-09-25
- Meta 官宣实时 AI 数字人,主打实时化竞品 LemonSlice 现场对比 — Aiden_Tech_Ai · 2026-09-25
- Meta 宣布 Muse 支持实时 AI 头像,LemonSlice 立即发起对比 — nikola_mr64990 · 2026-09-25