浙大港大开源LayerRecall:165万参数路由模块修复长视频遗忘
青稞AI · wechat · 2026-09-11
自回归视频模型生成一段段画面、用KV缓存保留上下文时,早期身份与场景线索常被挤出缓存,导致角色离场再返回时换脸换装。浙江大学杨易团队与香港大学提出并开源 LayerRecall:只训练约1.65M参数的记忆路由模块(约为5B骨干的0.033%),生成骨干保持冻结,同时回答「该想起什么」与「该在哪些层使用」两个问题。
核心做法
- What to Retrieve:为历史chunk建紧凑摘要做检索打分,但送入注意力的仍是完整K/V,不是摘要。
- Where to Use:逐层分析发现不同DiT层对远期历史注意力差异很大,只把记忆注入少数「记忆敏感层」,其余层维持局部滑窗;全层注入反而导致突变与抖动(高频功率比0.60→0.38可证)。
- CHPM训练:用同一冻结骨干构造「384帧历史的老师」与「32帧预算的学生」,通过去噪预测差距学路由,无需记忆分配标签。
结果:100个三镜头评测prompt上,MemoBench Overall 0.548、MovieBench 0.578 均领先最佳基线;VBench-Long 0.978与骨干持平。路由器零再训练迁移到LongLive(0.4985→0.5430)与Self-Forcing(0.3270→0.4965)。额外路由开销仅约3.5秒。
训练推理链路、CHPM训练代码与评测prompt bank均已开源,但用户仍需自备Wan2.2-TI2V-5B与LongLive-2.0基础权重,默认配置需两张GPU。
「多模态」频道最新
- 博主分享 4 个 Midjourney V6 最爱风格码 --sref 直接可用 — michaelrabone · 2026-09-11
- AI 音乐视频《Parfumu pe Piele》实现照片级真实感 — Smart-Proof-1861 · 2026-09-11
- 6 组高难度提示词对比 GPT Image 2.0 与 2.5,纹理差距明显 — FinanceYF5 · 2026-09-11
- ComfyUI 真 10bit 视频输出的隐藏 8bit 瓶颈 — robertwellesley · 2026-09-11
- MiniMax H3 实测:首帧图 1:2 出 1:2 视频,时间凝滞效果惊艳 — Hailuo_AI · 2026-09-11
- 用Codex生成Remotion动效再喂给MiniMax H3出片 — Hailuo_AI · 2026-09-11