记忆让Gemini平均掉14分,相关回忆也会锁死推理

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang

cs.AI, cs.CL, cs.CY, cs.DB, cs.LG

2026-08-21

正确且相关的记忆也会带偏当前推理。1050条样本上五种记忆方案全低于无记忆,Gemini最强仍掉14分,一条提示能补回11–15分。

这篇在解决什么

给语言模型加长期记忆,现有基准几乎都在问:信息有没有被抽对、存对、取对。过期记忆、抽错、取到无关片段,这些管理事故已经被单独拿出来打过。这篇问的是下一层:记忆本身是对的、也和当前问题语义相关,会不会反而把推理策略或信念拧歪,让这道题做得比完全不读记忆更差。

一个24点例子能说明问题。历史里全是用加减乘除做成24的题,新题[4,1,1,1]必须用阶乘。不读记忆,Gemini-3-Flash能想到4!;读了记忆,它反复在四则运算里打转。先前的解法没有写错,只是把搜索空间钉死了。

方法

MemTrapBench按这个失败定义来造:带记忆的得分s(yM)低于不带记忆的s(y∅)。两条大类、四个场景。

推理固化(Reasoning Fixation)有三种。Cognitive Bias:题没变类,但新实例需要另一种策略,模型把旧成功策略用过头。Trauma:历史里对某个正确策略有过严厉负反馈,模型在新的、本该用它的实例上回避。作者把Trauma只当行为类比,不声称模型有情绪。Task Boundary:任务已经切换,旧规则还在用。信念扭曲(Belief Distortion)目前只有Safety:历史里种下的沙盒或反事实前提,被错误套到真实安全判断上。

构造是人工写种子(领域、陷阱机制、标准答案、埋入的先验),再用GPT-5.4扩成18–40轮对话:先种陷阱,再掺无关轮次,最后抛出条件已变、但语义仍相关的终问。对话里故意不写「忽略之前的规则」。质检是自动过滤加专家审,看主题连贯、可独立作答、情境切换是否清楚。终稿1050条:Cognitive Bias 350、Task Boundary 350、Safety 200、Trauma 150。评判四维:正确、格式、相关、效率,主裁判GPT-5.2,Claude Sonnet 4.6做一致性。

对照记忆方案包括整段历史(FullText)、LightMem、MemOS、SimpleMem、EverMemOS,底座是Gemini-3-Flash-Preview和Qwen3-30B-A3B-Instruct-2507。缓解方法AdaptiveMem是一条推理时系统提示,让模型先检查取回的记忆是否仍适用于当前条件,不改存储和检索结构。

结果

无记忆时Gemini平均85.16,Qwen平均81.83。五种记忆方案全部低于这条线。Gemini上最好的是EverMemOS 71.17(相对无记忆−14.0),最差SimpleMem 54.69。Qwen上最好的是LightMem 70.13(−11.7)。掉点集中在Cognitive Bias和Safety:Gemini的Cognitive Bias从70.95掉到46.66–65.48,Safety从95.90掉到56.15–69.70。

消融把锅从「多了上下文」挪到「陷阱语义」。同一道题,历史都写着肾上腺素只对上一名患者禁忌;加上辱骂式负反馈,模型就拒绝对另一名无禁忌儿童用一线药,正确率从91.07掉到66.40,均分从84.33掉到69.43。Task Boundary子集上,无陷阱记忆94.39,略高于无记忆的92.29;种上陷阱掉到31.05。记忆长度从25%加到100%,均分从36.03再降到31.05,相对无记忆的92.29,最大一跳发生在「开始有记忆」的那一下。两个裁判方向一致:GPT-5.2均分从92.29掉到31.05,Claude从95.57掉到40.07。

AdaptiveMem在每基准随机200条上,给FullText / LightMem / EverMemOS分别加11.8 / 14.9 / 11.3分(Gemini)和4.2 / 2.5 / 2.6分(Qwen)。LongMemEval上六组里四组上升、两组持平,最高+4.0,没有把常规记忆能力打坏。

为什么重要

记忆系统不能只报召回率。取得越「相关」,越可能把过期策略、一次责骂或沙盒设定写进当前答案。对做助手和agent记忆的人,这是一张该加的回归测试:至少要保证加上记忆不比裸模型差。AdaptiveMem几乎是零成本的推理时补丁,能补回十几分,但也说明现有框架默认不会自己做「这条记忆现在还适用吗」的检查。

和MemSyco-Bench的差别要说清。那边盯的是该更新的用户偏好和谄媚;这边记忆可以仍然正确,例如旧的24点解法,只是不该当当前策略。识别出「题已经换了」仍然掉点,才算进这张表。

局限与存疑

这是压力测试,不是记忆效用的平均分。种子和陷阱机制是人为设计的,对话由GPT-5.4生成,真实用户日志里这类陷阱有多密,没有估计。Safety把明显荒谬的沙盒前提当攻击面,和线上安全策略不是同一件事。AdaptiveMem只在200条子集上测,主表1050条没有重跑。底座只有两家模型、五个记忆框架,没有参数记忆或model editing。主裁判是GPT-5.2,绝对分数和Claude差一截,虽然方向一致,仍是LLM-as-judge。Trauma场景用医疗急救当载体,数字说明的是反馈回避,不能外推成临床建议。

术语

原文与代码

相关论文

全部论文解读