自建 LLM 记忆基准:带噪声召回、跨会话关联与过时事实三档计分
True_Mongoose_7073 · reddit · 2026-09-07
一位 Reddit 开发者详细公开了自己正在构建的记忆评测基准的设计:
- 多尺度测试:答案所在的对话轮次保持不变,只增加周围的噪声,测试记忆系统在干扰增长下的召回能力。
- 题型覆盖:普通召回、跨两条独立对话才能得出的关联事实、隐含但未明说的信息、时间点、照片、其他语言,以及从未出现过的内容。
- 过时事实单独处理:某事实中途发生变化后询问当前值,计分分三档——答出新值得满分、承认不知道得一半分、自信重复旧值得零分,从而区分「安全失败」与「错误陈述」。
- 弃答反作弊:空答案记零分,防止对所有问题都回答「不知道」刷分。
- 成本记账:每个问题同时记录记忆系统返回了多少内容,把准确率和检索成本放在一起看。
作者明确不设排行榜,并在社区征求意见:这套设计是否值得跑、还缺什么。
「编程与Agent」频道最新
- 开发者自嘲:被叫 vibe coder,「我能 15 分钟不看 Google 写完 FizzBuzz」 — tlakomy · 2026-09-07
- 同时照看 4 个并行 agent,开发者直呼像带娃 — smlpth · 2026-09-07
- 把文本扩展器交给 AI 管家:一篇别致的自动化工作流长文 — bfrench · 2026-09-07
- 开发者晒 Astra 一键清理破坏性容器,直呼效果惊艳 — Dimillian · 2026-09-07
- Codex 应用现怪异 bug:发出首个 prompt 后输入框消失 — theteknosaur · 2026-09-07
- kevins8 分享一句话 prompt:让编码 agent 大幅简化实现代码 — steipete · 2026-09-07