LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
Yixuan Ding, Jiahao Kong, Wei Huang, Ruijie Quan, Yi Yang
cs.CV
2026-08-28
浙大与港大给自回归视频DiT加上按层记忆路由,历史K/V只注入10个敏感层。100条多镜头提示上MemoBench 0.548、MovieBench 0.578,高于MemFlow,VBench-Long与骨干持平。
自回归视频扩散按块往前滚,KV cache只留最近一段。镜头一切走,人物衣服、场景物件、数量关系就被挤出窗口。再入画时模型只能靠提示词硬猜,身份漂、颜色漂、布局漂一起出现。
已有工作会塞压缩全局状态、检索历史帧,或把更长的历史KV直接摊开。看得到历史,不等于用得上。对LongLive-2.0做注意力剖析后,各层对当前块、近邻块、远历史的偏好差得很开,记忆敏感层还随骨干而变。要把两件事拆开:取哪段历史,以及打进哪几层。
LayerRecall加在冻结的chunk自回归DiT上,骨干是LongLive-2.0(Wan2.2-TI2V-5B架构)。物理KV cache按sink加滑窗更新,一共80帧、10个chunk。
取什么:每层把历史chunk的pre-RoPE key做成摘要,用当前块隐状态生成查询,按余弦相似度硬选最多两个历史chunk。前向走硬选择,训练用带温度的软混合当straight-through梯度代理。
打到哪:只向剖析出的10层注入历史K/V,索引是[4, 9, 10, 12, 13, 15, 16, 17, 18, 26]。其余20层继续原来的sink加滑窗,不去碰远历史。记忆敏感层的可见上下文是8帧sink、最多16帧检索历史、当前8帧,一共32帧。
监督叫Cross-Horizon Prediction Matching(CHPM)。师生共用冻结骨干,老师看满384帧,学生只有有界cache加路由器。在若干anchor上对齐去噪后的潜变量预测,不需要长视频真值,也不需要记忆分配标签。路由器大约165万参数,16张H100跑1个epoch,约128 GPU小时。训练用1600条多镜头提示,评测另用100条held-out三镜头提示。
100条提示生成的视频上:
| 方法 | VBench-Long | MemoBench | MovieBench |
| LongLive-2.0 | 0.978 | 0.513 | 0.546 |
| MemFlow | 0.981 | 0.531 | 0.542 |
| SkyReels-V2 | 0.992 | 0.466 | 0.508 |
| LayerRecall | 0.978 | 0.548 | 0.578 |
记忆向指标最高,本地连贯与骨干持平。MemoBench物体重现0.571,高于LongLive-2.0的0.519。把历史打进全部层会伤时间一致性:邻帧DINO从全层路由的0.8795升到0.9212,帧变能量高频比从0.60降到0.38。CHPM相对随机初始化路由器,把MemoBench从0.519拉到0.548。剖析出的10层相对随机10层,在另一组对照里overall从0.538到0.570。H100上端到端305.9秒/视频变成309.4秒,额外开销可以忽略。
路由器参数直接搬到LongLive和Self-Forcing的1.3B骨干上仍能抬MemoBench;换目标骨干自己的层策略后overall最好。质化上还有记忆引导的自我纠正:镜头3里衣服先画错花纹,后续帧会拉回镜头1的纯色内衣,动作和场景结构不重来。
长视频生成里,远距一致性经常被滑窗牺牲掉。LayerRecall给出一个很工程的答案:骨干冻结,只训小路由器,历史只进少数层。做多镜头、角色再入画、物体再出现时,这比把KV无限拉长更省。可迁移性说明「按当前状态检索」能跨骨干复用,但「打进哪几层」要按骨干剖析,不能直接抄allowlist。
这是渐进改进,不是新的生成范式。收益集中在记忆诊断基准,VBench-Long没有超过SkyReels-V2那种本地质量尖子。
层策略是剖析后冻住的,不会随内容自适应。跨骨干结果写成「在测过的模型上可迁移」,不是零样本万能。随机10层在身份维还高于剖析策略(0.507对0.495),allowlist不是每一维都赢。评测是100条三镜头提示,训练只有200次优化步。CHPM对齐的是预测,不对齐老师的注意力,路由器学到的是行为近似。自我纠正目前是质化观察,没有单独量化。