事件当检索单元,浙大长视频记忆省63.7%推理token

EM^2Mem: Event-Centric Multimodal Memory for Large Language Models

Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng

EMNLP 2026 findings

cs.CL, cs.AI, cs.LG, cs.MM

2026-09-01

浙大与联想把长视频记忆建成事件单元,构建时对齐多模态证据。相对最强记忆基线,三套问答平均准确率高2.0、2.4、3.7分,推理token少63.66%。

这篇在解决什么

长视频问答的证据又稀又散,画面、语音、OCR、物体、习惯行为可能隔好几分钟才对得上。现有多模态记忆和视频RAG多半按模态切:字幕、关键帧、摘要、三元组、图谱各存各的。能搜,但搜出来的是碎片。模型必须在上下文已经很紧的时候,自己把跨模态和时间对齐补回来,出处也难标。

这篇把检索单元从碎片换成事件。灵感来自事件认知:人用事件组织感知、语言和动作边界。问句也多半在问一件事、一种情境、一种反复出现的行为,很少在问单独一帧或一条边。

方法

EM2Mem走align-then-retrieve。视频先切成约30秒的基础段,每段一个事件锚点,只是时间地址不是内容。锚点下绑一条多模态记录:关键帧字幕、对话、代表帧、结构化字段(动作、物体、话题、场景、实体)。再叠多层时间上下文,3分钟、10分钟、1小时的块摘要,每条事件细胞挂上覆盖自己的那些视图。

跨事件用两张轻图。情景图连人物、物体、地点、话题和相邻时间转移;语义图存习惯、偏好、稳定关系,每条都指回支持它的事件锚点。推理时按局部记录、多尺度上下文和图线索选出事件细胞,做一次轻量扩展,LLM选择器再筛,编译成问句专用的证据视图再生成答案。关键帧只当检索之后的轻量核对,不是主证据。

对照覆盖基座MLLM、长视频LLM、RAG和记忆系统。最强相关基线是WorldMM,论文同时报原始数字和同一评测设定下的复现WorldMM†。Ego-R1 Bench上WorldMM没有复现,因为要给六名被试各建一遍超长记忆,成本太高。

结果

三套基准上,相对最强记忆对照的平均准确率分别高2.0、2.4、3.7分。

基准EM2Mem对照分差
EgoLifeQA66.0WorldMM† 64.0+2.0
Ego-R1 Bench67.7WorldMM 65.3+2.4
Video-MME (L)76.8WorldMM† 73.1+3.7

相对WorldMM原文,平均分仍略高,但习惯、时间和合成推理若干子类WorldMM更强。EgoLifeQA上,去时间上下文掉到60.4(-5.6),去语义记忆61.4,去情景图61.6;只检索30秒局部记录还有64.0,说明短事实题局部细胞已经够用,关系和任务题才吃跨事件聚合。

效率在EgoLifeQA上测:单查询延迟459.00秒到98.21秒,4.67倍;端到端墙钟229,502秒到6,138秒;总推理token 42.03M到15.27M,少63.66%。WorldMM推理期还要增量建HippoRAG图,EM2Mem读的是预先建好的事件细胞,并用8 worker并行。离线构建更贵,墙钟成本大约23到24次查询打平。

严格30秒事件级Top-5召回30.8,比WorldMM五轮迭代检索高7.0分;Top-1是23.0,接近WorldMM五轮的23.8。前250道EgoLifeQA上,结构化事件字段加构建期对齐到71.2,高于原始帧和扁平字幕。三张关键帧把准确率从无关键帧的63.2拉到66.0。

为什么重要

对做长视频Agent记忆的人,这是一次检索单元的换挡:构建时对齐,推理时取整事件,别指望生成阶段再缝。准确率是渐进的两到四分,更硬的数字是延迟和token。适合「视频处理一次、反复问」的场景,不适合实时流。代码计划并进LightMem。

局限与存疑

结构化字段换可检索性,细小物体、颜色、布局、微妙视觉状态会丢,作者自己说了。最终答题仍靠选中的关键帧补视觉细节,跨模态对齐没有在构建期做完。上游MLLM字幕和抽对象的错误会写进细胞和图。构建成本要问二十多次才摊平,token摊平更慢。Ego-R1的对照是WorldMM发表分不是复现分。事件切分固定约30秒,真实事件边界未必落在这个钟上。习惯洞察对关键帧不敏感,说明长期模式仍主要靠语义图,不是局部视觉核对。

术语

原文与代码

相关论文

全部论文解读