SGF+分离去噪与上下文写入梯度,5秒训练支持24小时连续视频生成
Zihan Su · hf · 2026-10-08
该工作针对自回归视频生成中「去噪当前帧」与「写入 KV 上下文供未来预测」两角色共享参数导致的梯度系统性负对齐问题。
方法:SGF+ 为上下文写入与去噪分配独立参数,同时通过因果注意力保留两者交互;仅用原始生成目标联合优化,无辅助损失,上下文写入由其对未来预测的贡献监督。
效果:在逐帧与分块生成下均超越基线的视觉质量与长时程一致性,且无需额外视频训练数据或更长训练周期;仅用 5 秒 rollout 训练,即可支持最长 24 小时的连续生成,无需长视频微调。
结论:角色特定参数化是高质量自回归视频生成与原生长时程外推的有效设计原则。
「多模态」频道最新
- 阿拉斯加渡鸦夫妇「交谈」视频走红,AI 生成引围观 — ZeroStateReflex · 2026-10-08
- 用 Claude 把 198 页 Erdős 猜想证明变成 2 分钟 3D 动画讲解 — imjustnewatai · 2026-10-08
- Reddit 用户用 ComfyUI 加 agent 驱动制作 AI 短片 — TheHollywoodGeek · 2026-10-08
- WorldSonus为世界模型补声:实时空间立体声生成RTF仅0.41 — NoizAI · 2026-10-08
- AdSpark:30万条电商广告视频三元组数据集与六维评测基准 — Zhifei Yang · 2026-10-08
- Freeform Motion Transfer LoRA 与工作流发布 — CQDSN · 2026-10-08