ViRDM:免教师免评论家的视频蒸馏,16 A100 小时刷新少步生成纪录
Zichong Meng · hf · 2026-09-25
ViRDM 提出一种仅需训练生成器的视频后训练配方,摆脱了对大型教师模型与在线评论家的依赖。
- 动机:现有少步自回归视频扩散后训练依赖 DMD,需要教师-评论家双网络估计分布差异,资源消耗大
- 方法:将一步图像生成的表征分布匹配(RDM)迁移到少步因果视频生成,逐一解决梯度路径显存不可行、视频优化域差异、时间动态欠约束三大障碍,结合随机截断的 clean-exit 监督、轻量 VAE 解码器与分阶段向量-雅可比积,并引入轻量动态正则
- 效果:把三网络蒸馏变成生成器单独训练,仅 20 次生成器更新、16 A100 GPU 小时即在 VBench 达 84.87,超过此前最佳少步因果基线 0.36;还展示了 1/2/4 步双向生成的探索结果
「多模态」频道最新
- 用户用 Opus 5.5 为旧素材生成音乐视频,效果获好评 — repligate · 2026-09-25
- 同一 prompt 复测:Opus 5.5 一次生成完整视频,博主称真·one shot — drrickio · 2026-09-25
- 给 Claude Agent 接 Runway MCP,一条提示词产出 Netflix 风格纪录片 — CurieuxExplorer · 2026-09-25
- Seedance 2.5 携手 GPT Image 2.5,一镜搞定科幻经典对决 — CurieuxExplorer · 2026-09-25
- Opus 5.5 纯代码写歌做 MV,开发者做成 13 曲风选歌游戏 — pbaylies · 2026-09-25
- 研究:推理并非总有用,15.7% 案例反而拉近难负样本 — _reachsumit · 2026-09-25