Muse 实时视频生成核心技术:40 步扩散教师蒸馏为 2 步因果学生

AIatMeta · x · 2026-09-24

Meta 公布 Muse 实时视频流的技术方案:将带 3 路 CFG、每视频块需 120 次评估的 40 步扩散教师模型,蒸馏为无引导的 2 步因果学生模型,并使用固定长度 KV cache,使评估次数减少 60 倍;self-forcing 机制帮助学生模型抵抗漂移,在长对话中保持接近教师模型的质量与视觉一致性。

所属事件:Meta 发布 Muse Realtime Avatar 实时数字人(18 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →