KAIST 提出 LongTake:长时程教师强制让长视频不再变成静态
kaist-ai · hf · 2026-10-09
KAIST AI 发布 LongTake,针对自回归视频扩散在长时程生成中画面趋于静止、质量下降的问题。
方法
- 两阶段训练,核心是「长时程教师强制」(Long-Horizon Teacher Forcing):用精选真实长视频,让模型在长真值前缀条件下预测后续帧,把直接监督延伸到短视频训练窗口之外
- 该初始化直接强化了 DMD(分布匹配蒸馏)在自滚动下的表现,无需标准流程中的中间少步蒸馏阶段
结果
- 相同 5 秒 DMD 训练配置下,30 秒自滚动的动态程度显著高于短时程 TF 初始化,美学质量相当
- Hybrid DMD 进一步用教师扩展对自滚动后段的监督,在 30s 与 60s 滚动中取得所评方法中最高的动态程度,整体位于动态程度-美学质量的 Pareto 前沿
「多模态」频道最新
- Speridlabs 开源 Iris-3B:像素空间生成模型可替代 DINOv2 — Apprehensive_Sky892 · 2026-10-09
- 实测:GPT-6 Luna 可识别 AI 生成图像,但仍有漏网 — Angaisb_ · 2026-10-09
- GPT-6 Image 2.5 复刻 1940 年代中国乡村新闻片质感 — DeryaTR_ · 2026-10-09
- 8GB 显存跑 Wan/Hunyuan 视频角色替换:640x480 渲染 10 分半 — big-boss_97 · 2026-10-09
- 谷歌 SynthID Detector 全球开放,Vidu Q4 视频生成 0.09 元/秒起 — 创业邦 · 2026-10-09
- Vigglorious Studio:分块+引导关键帧,让长视频角色一致性大幅提升 — Tablaski · 2026-10-09