实测 4 个 agent 记忆 SDK:矛盾更新与实体解析全军覆没
Dismal-Account-1151 · reddit · 2026-09-25
作者为自建 agent 测试了 4 个记忆 SDK 和 4 个记忆工具,用同一套测试:第 1 轮告诉 agent 偏好深色模式,第 5 轮改说切成浅色模式,第 8 轮问它用哪个模式。
结果全部失败:没有一个能在新事实进来时删掉旧事实。有的把新事实加在旧的旁边,有的把两者分开存且毫无关联,有的多数时候给新的但换个问法旧的就回来了,最后一个完全不处理矛盾、需要手动改。模型只是挑与查询更匹配的那个答案,所以答案随问法变化。
实体解析同样糟糕:分别提到 vansh、vansh from india、VS,有的存成三条独立记录,有的连上前两个但漏了缩写,有的认为三者是不同的人,有的根本不做实体解析。
作者建议:测试任何记忆工具时,给它一个跨会话变化的事实,并用三种方式提同一个人;如果两者都搞不定,那它只是在旧对话里做相似度检索。
「编程与Agent」频道最新
- 肿瘤数据实战:用 Jev 做小调用路由,给大模型省时间 — Ubunta · 2026-09-26
- DSPy 3.4.0 发布:原生支持 Jev 与 System one 模型,新优化器 ReAnchor 上线 — dbreunig · 2026-09-26
- 用 AI agent 查无人认领财产,用户几分钟真找回了 100 美元 — brandon_galang · 2026-09-26
- 微软基于开源项目 OpenClaw 发布产品,作者确认大规模部署合作 — pswider · 2026-09-26
- HF 开源 SmolDataEnvs:5000 个可验证 RL 任务训练小模型 — marktenenholtz · 2026-09-26
- Stripe 上线机器支付:AI Agent 可自主按次付费调用 API — jeff_weinstein · 2026-09-26