90天实测:记忆层让Agent上下文token省23-62倍,召回率反超全量历史
No_Advertising2536 · reddit · 2026-09-16
一位记忆 API 开发者在 Reddit 发布了一份少见的带数据对照实验:用三个带 ground truth 的合成对话语料(陪伴、客服、编码助手),在 7/30/90 个模拟日下,对比「记忆层」与「每次发送全部历史」两种策略,答案模型统一用 gpt-4o-mini。
核心数据
- 上下文 token:全量历史随天数线性膨胀(90 天约 6-7.5k/请求),记忆层稳定在 120-330 token,压缩 9-62 倍
- 成本:按 $0.15/M 输入价,1000 用户×20 请求/天,90 天全量历史 $630/月 vs 记忆 $19/月
- 旧事实召回:90 天时记忆在陪伴场景 1.00 vs 0.88、客服 0.75 vs 0.38 反而更好——「全发上去」也会随长度退化
三个反直觉发现
- 客服场景 30 天时记忆惨败(召回 0.25):抽取器把「会员号 LR-11560」存成了「有会员号」,标识符/具名实体正是记忆层的弱项
- 全量历史不是免费午餐,长上下文里答案模型找一个月前的事实只有 38% 命中
- 作者自己的 salience 过滤器把转述句「服务固定在 Python 3.12」误判为闲聊丢掉,修复后编码召回 0.75→0.88
基准、语料生成器(固定种子)、成本报告全部开源可复现。
「编程与Agent」频道最新
- 编程 agent 写码更快了,但排查 bug 反而更繁琐怪异 — tengyanAI · 2026-09-16
- 两年对比:2023 年做分类器要靠 function calling 迂回技巧 — _ScottCondron · 2026-09-16
- Agent 记忆要拆四层:会话、Wiki、程序与被漏掉的判断记忆 — sujingshen · 2026-09-16
- 开发者分享:把所有服务商接进 MCP 让 Agent 自动排障 — DanielLockyer · 2026-09-16
- Agent 记性差不可怕,权限全开才是真风险:最小授权四条军规 — sujingshen · 2026-09-16
- 研究发现:Agent 记忆笔记越堆越多,表现反而越用越慢 — sujingshen · 2026-09-16