The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents
Jundong Hu, Shekar Ramachandran
NeurIPS 2026 workshop
cs.AI, cs.CL
2026-09-02
PayPal 用冻结的动作评分基准沿 Qwen3 0.6–8B 测量:Benefit 套件里过期值依赖率高达 0.92–1.00;Safety 套件把过期笔记标新后,8B 的净伤害 Δmem 掉到 −1.00。
个性化 agent 靠持久记忆才能代劳,比如「常坐那家航司」或「会议室还是 A」。记忆过期之后,模型仍可能按旧值行动,哪怕当前权威工具已经给出正确答案。STALE 一类基准已经证明过期记忆会造成伤害,但没说伤害从哪一档能力开始,也没拆开是标签、时间戳、来源还是位置在触发。
PayPal AI 把「没有记忆」拆成两种不可兼容的含义,做成冻结、闭集、动作评分的两套件,沿着 Qwen3 0.6/1.7/4/8B 同一家族梯子问三件事:伤害何时出现、哪类表面特征在骗模型、补救是不是也随规模变。
300 条基础场景,每套件 150,SHA-256 钉死。评分是对构造时 ground-truth 的精确、正则或规范化匹配,不用 LLM judge;选项做循环置换平均,机会水平约 0.33。
四个条件:无记忆、干净记忆、过期记忆、显式冲突(过期值和正确值并存)。Reliance 是模型选出过期值的概率。Safety 上再扫 L0–L3 陷阱,把过期笔记打扮得越来越像「当前」。特征用 2×2×2×2 全因子拆标签(去掉 [NOTES])、新旧日期、来源权威、位置先后。补救比三种表征:原文并置、带时间戳和来源的 metadata、事先删掉过期项的 oracle。
Benefit 上过期值依赖在四档都接近饱和:0.92 / 0.99 / 1.00 / 1.00,Δmem 为 −0.33 / −0.35 / −0.35 / −0.37。无记忆基线 0.35–0.37,置信区间含机会水平,套件是真的贴地。显式冲突里,0.6B 和 1.7B 仍有一半跟过期值,4B / 8B 掉到 0.01 / 0.00。
Safety 上无记忆准确率 ≥0.98。不加陷阱时只有 0.6B 出现净伤害(Δmem −0.18,reliance 0.19),更大模型几乎不跟。把过期笔记标新之后,排序反过来:L3 上 8B reliance 1.00、Δmem −1.00;L2 上 4B 已到 0.83。能力阈值 ρ(Δmem 置信区间上沿首次小于 0 的陷阱档)是 0/1/1/1,分开的是 0.6B 和其他三档,不是单调能力序。
因子主效应:去标签在每档都加依赖(+0.23 到 +0.39),大小组对比不显著。把过期笔记标新,4B / 8B 吃得更狠(主效应 +0.52 / +0.56,8B−0.6B = +0.302)。来源权威弱且跨尺度平坦(约 +0.11 到 +0.14)。位置从 0.6B 的 +0.22 翻到 4B / 8B 的 −0.14 / −0.11。日期效应是阶跃:过期笔记只要比当前项新至少 1 天,依赖就跳起来然后饱和。
补救也随能力变。Metadata 相对原文的准确率增益:+0.30 / +0.28 / +0.53 / +0.54。Oracle(事先消解)在四档都拉回来:+0.46 / +0.57 / +0.63 / +0.59。小模型只有冲突被预先裁掉才恢复。
外部集 RGB、MisBench 上过期依赖 0.81–0.94;RGB 的 Δmem 同样随规模变负,8B 到 −0.32,自由文本臂 −0.37。Llama-3.2/3.1 的 1B/3B/8B 在能力够用的档上复现标签和日期方向;0.6B 那种「放前面更信」的角落没有跨家族。把同一条错信息标成记忆、文档或更早消息:三个小尺度更信过期文档,8B 差异不显著。开 thinking 关不掉缺口,0.6B 的 Benefit 依赖还从 0.924 升到 0.991。
给做 agent 记忆的人一条反直觉的设计约束:把模型做大,不会自动更会「以权威工具为准」。大模型把时间戳读得更准,于是一条标新的过期笔记杀伤力更大。保留 [NOTES] 这类标签在每档都降依赖;来源写得官样文章几乎不顶用。4B 以上给条目挂时间戳和出处就够用,0.6B / 1.7B 需要检索后先做确定性新鲜度裁决,别把冲突丢给生成。
这不是记忆专属病。同一条过期证据换成文档,小模型信得更狠。任何会把检索结果塞进上下文的系统都在同一条坑里。
Benefit 套件的无记忆基线在机会水平,显式冲突的 Δmem 不能当净伤害读,净伤害主张全靠 Safety。评分是闭集动作匹配,开放生成只在 RGB 自由文本臂上补了一刀。主梯子只有 Qwen3 一条家族,Llama 只覆盖能力够用的档,没有家族×尺度网格。ρ 绑在他们自定义的 L0–L3 序列上。测的是消费记忆的那一刻,不是写、更新、检索的端到端系统。探索性分解,未预注册。