SGF+分离去噪与上下文写入梯度,5秒训练支持24小时连续视频生成

Zihan Su · hf · 2026-10-08

该工作针对自回归视频生成中「去噪当前帧」与「写入 KV 上下文供未来预测」两角色共享参数导致的梯度系统性负对齐问题。

方法:SGF+ 为上下文写入与去噪分配独立参数,同时通过因果注意力保留两者交互;仅用原始生成目标联合优化,无辅助损失,上下文写入由其对未来预测的贡献监督。

效果:在逐帧与分块生成下均超越基线的视觉质量与长时程一致性,且无需额外视频训练数据或更长训练周期;仅用 5 秒 rollout 训练,即可支持最长 24 小时的连续生成,无需长视频微调。

结论:角色特定参数化是高质量自回归视频生成与原生长时程外推的有效设计原则。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →