作者自建 membench:不过期的记忆层对 41.7% 已更新事实自信返回旧值
Initial_Orange2985 · reddit · 2026-09-08
一位开发者发布 membench 基准,专门测量 AI 记忆系统的「陈旧事实」问题:当事实的真值随时间改变时,记忆层应该返回新值、保持沉默或承认过时,而不是继续给出旧答案。
核心发现
- 语料库含 104 条合成事实(稳定、衰减、过期、被取代、强化、从未出现),共 832 个问题、8 个随机种子、可离线运行。
- 绝大多数记忆产品采用的「永不遗忘」设计在 41.7% 已被更新的事实上自信返回过时值,且置信度分数毫无变化。
- 加入 45 天半衰期 + 111 天后拒绝回答,可将该数字降到 0.000、精度 0.995——但代价是过期事实的回答率归零,覆盖率从 0.754 跌到 0.496。
- 真正的难点是「只说过一次、几个月后悄悄失效」的过期事实:没有任何更新的记录可供近因排序利用,正确答案只能是沉默或带日期。
- 控制实验显示置信度分数衡量的是内部一致性而非与世界的一致性:对乱序语料分数几乎不变。
作者还给出无需用其仓库的自查方法:统计「被写入两次后系统返回旧值的频率」(陈旧率)和「半年前说过一次、现已过时的事实得到自信无日期答案的频率」。基准以 MIT 协议开源,离线约一分钟可跑完。
「编程与Agent」频道最新
- 开发者实测:GitHub 与 Foundry 模型价格相近,VS 订阅可借 Azure 额度救急 — unixterminal · 2026-09-08
- Jeff Dean 发布一小时 AI 工程讲座:从 LLM 到百人智能体协作 — Roger_M_Taylor · 2026-09-08
- 编码 Agent 新基准:Claude Opus 5 仅过 23.9%,人类专家 82.2% — dair_ai · 2026-09-08
- Codex 用户实测:gpt-6-astra 开实验性上下文管理,40 万 token 更实用 — brandon_galang · 2026-09-08
- tscircuit 发布首个面向 Astra 的版本,一发生成开发板 — debreuil · 2026-09-08
- 观点:agent 时代也需要一句「你不是 Google」,别堆 40 个自主 agent — feregri_no · 2026-09-08