LeapTalk 单步生成说话头视频,速度最高达 200 FPS
Shanghai-Jiao-Tong-University-SAI · hf · 2026-08-04
LeapTalk 用单步推理打破说话头生成的延迟-质量权衡
这篇工作提出 LeapTalk,目标是在保持画质稳定的同时,实现实时说话头生成,并且只需一次前向计算。
- 方法核心是把任务改写为基于 Brownian bridge 的数据到数据传输,并用持久参考帧缓解身份漂移。
- 为了把扩散教师模型的能力迁移到桥式学生模型,作者设计了 heterogeneous distillation,并引入 SNR 对齐的时间变换。
- 另外加入音频驱动的 classifier-free guidance,以便在极端压缩步数下仍保持唇形同步。
- 论文称该方法可在最高 200 FPS 下生成高保真、时序一致的视频,并在效率和稳定性上优于现有方案。
「多模态」频道最新
- MiniMax H3 开源权重发布,ComfyUI 节点同步上线 — petewoodbridge · 2026-08-04
- MiniMax高管回顾海螺AI成长史,宣布将推进开源 — VoidAsuka · 2026-08-04
- 用 Hailuo AI 制作海报动画:提示词与实测效果 — LudovicCreator · 2026-08-04
- 实测 Qwen3.8-Max:用 Three.js 生成高保真布加迪引擎 — cedric_chee · 2026-08-04
- RTX 3060 12G 实测:17 分钟本地生成 10 秒竖屏视频 — merica420_69 · 2026-08-04
- 告别乱连线:ComfyUI 节点输出可视化调试工具发布 — niknah · 2026-08-04