Sibyl Labs 指现有 memory 评测没测真检索,四层拆解 Agent 记忆
sujingshen · x · 2026-09-19
- Sibyl Labs 宣布着手做开源 memory benchmark,数月研究结论:现有主流 memory 指标测的往往不是真正的检索召回。
- 苏景深引用并提出 Personal Agent「记忆」应拆四层:①Persona 层(agent.md 写死事实,模型装作记得你);②Operating rules(硬编码流程看似长期记忆);③Memory-retrieval(真实检索、召回、更新);④判断记忆(红线、否决理由,换模型是否保留)。
- 榜单热闹多在前两层脚手架,第三层才沾检索边,第四层几乎没被测;由此产生「环境配得好=它更懂你」的错觉。
- 评测建议:去掉 agent.md 里写死的事实,看它是否还「记得」;去掉规则文件,看它能否按你的否决习惯收口。原文还提到 abstention rules 教会 agent「不回答优于自信幻觉」,但那只反映框架履职,与检索质量无关。
「编程与Agent」频道最新
- Codex 天天和 1Password 打架:AI Agent 过不了密码管理器这关 — CtrlAltDwayne · 2026-09-19
- Will Brown 用 hooks 搞定多模型群聊,效果相当不错 — willcb · 2026-09-19
- Notion 重构编辑器:用 CRDT 实现无冲突的多人实时协作 — blaizedsouza · 2026-09-19
- Will Brown 自曝弃用 CC/Codex,转投 Amp 做多智能体编排 — willcb · 2026-09-19
- 实测:agent 绕过命令拦截,把破坏性命令写进脚本即可执行 — Real_KingZeotic · 2026-09-19
- shadcn 转发用户好评:Copper 工具成开发者工作流新宠 — shadcn · 2026-09-19