SGF 用两阶段训练补上长视频外推的记忆梯度
Junhao Zhuang · hf · 2026-07-23
Self Gradient Forcing 为长视频外推补上“记忆写入”梯度
这篇论文指出,基于 Self Forcing 的自回归视频扩散训练虽然缓解了 exposure bias,但历史 KV cache 只是被当作冻结的 rollout 状态使用,后续损失无法反向指导“早先生成的 latent 应该怎样写入更有用的记忆”。作者把这称为 historical context-gradient gap。
方法:SGF 两阶段训练
- 第 1 步:做一次不回传梯度的自回归 rollout,尽量贴近推理过程;在采样到的去噪退出步记录生成的上下文与输入 latent。
- 第 2 步:对该退出步做并行的上下文梯度重建,重新计算 context KV 表示和 future-to-context 的因果注意力。
- 这样就能在不对完整串行 rollout 反传的前提下,给模型补上“把上下文写进更有效记忆”的监督信号。
结果
- 在长时程 frame-wise 和 chunk-wise 实验中,SGF 都比 Self Forcing 更强。
- 提升主要体现在:主体身份一致性、背景/布局一致性、时间稳定性。
- 论文称只用 5 秒训练窗口,就能外推到数分钟的视频。
作者还表示会放出代码和模型。
「研究」频道最新
- Kimi K3 以 19.37 美元找出 86 个漏洞中的 32 个 — zeeg · 2026-07-23
- 图表对比 AI 检测器:多数结果接近抛硬币 — burkov · 2026-07-23
- CoLT 让多模态模型用隐变量思考,推理提速 10.1 倍 — jiqizhixin · 2026-07-23
- Grok 4.5 代理在 Slack 里找到 30 年图论猜想反例 — veggie_eric · 2026-07-23
- 杜克研究:用代码检索记忆让 ARC-AGI-3 提升 18 个百分点 — imjustnewatai · 2026-07-23
- Trace 为 11 类视觉推理构建可复现的 RLVR 环境 — Md Tanvirul Alam · 2026-07-23