浙大港大LayerRecall:选择性回忆解决长视频「换脸失忆」

新智元 · wechat · 2026-09-06

自回归视频模型用 KV 缓存保存上下文,但缓存优先保留近期片段,导致「出现—离场—返回」场景中角色换脸、换装、物体消失等远期记忆丢失。浙江大学与香港大学团队提出 LayerRecall,同时解决「该想起什么(What to Retrieve)」与「记忆该送进哪些层(Where to Use)」两个问题:

结果:100 个三镜头评测上,MemoBench Overall 0.548(最佳基线 0.531),MovieBench 0.578;VBench-Long 0.978 与骨干持平;高频帧变化功率比从 0.60 降到 0.38,端到端仅增加约 3.5 秒。路由器可零再训练迁移到 LongLive 与 Self-Forcing,MemoBench 分别从 0.4985→0.5430、0.3270→0.4965。6.6MB 权重、训练与评测 prompt 已开源,但需自行准备 Wan2.2-TI2V-5B 与 LongLive-2.0 基础权重。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →