浙大港大LayerRecall:选择性回忆解决长视频「换脸失忆」
新智元 · wechat · 2026-09-06
自回归视频模型用 KV 缓存保存上下文,但缓存优先保留近期片段,导致「出现—离场—返回」场景中角色换脸、换装、物体消失等远期记忆丢失。浙江大学与香港大学团队提出 LayerRecall,同时解决「该想起什么(What to Retrieve)」与「记忆该送进哪些层(Where to Use)」两个问题:
- 检索:为历史 chunk 建立摘要索引,路由器读取当前隐藏状态形成动态查询,选出最相关历史;但送入注意力的仍是完整 K/V,不只给摘要。
- 层路由:对 LongLive-2.0 逐层分析发现记忆敏感层只占少数;把检索记忆只注入这些层,其余层维持局部滑窗。对照实验显示全层注入反而引发突变和时间抖动。
- 训练:提出 Cross-Horizon Prediction Matching(CHPM),用可见 384 帧的「老师」监督只有 32 帧预算的「学生」,无需人工标注;仅训练约 165 万参数路由模块(约占 5B 骨干 0.033%),骨干冻结。
结果:100 个三镜头评测上,MemoBench Overall 0.548(最佳基线 0.531),MovieBench 0.578;VBench-Long 0.978 与骨干持平;高频帧变化功率比从 0.60 降到 0.38,端到端仅增加约 3.5 秒。路由器可零再训练迁移到 LongLive 与 Self-Forcing,MemoBench 分别从 0.4985→0.5430、0.3270→0.4965。6.6MB 权重、训练与评测 prompt 已开源,但需自行准备 Wan2.2-TI2V-5B 与 LongLive-2.0 基础权重。
「多模态」频道最新
- 用 Minimax H3 玩转图片+音频生成视频,实测 Sol-attn — Organic-Thought8662 · 2026-09-06
- MiniMax H3 电影感剪辑实测:「Coffee」视频效果展示 — Jeffu · 2026-09-06
- 博主用 GPT 6 Astra 2 小时做出 3D 钢琴手,琴指真的跟着音符弹 — nptacek · 2026-09-06
- Midjourney 8.2 两个新 sref 风格码,附完整出图参数 — michaelrabone · 2026-09-06
- 40 次实测摸清 Trellis.2 双简化器:Cumesh+Meshlib 串联才是最优解 — Tamerygo · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06