开发者实测记忆层:关键词检索追平召回,向量 RAG 随历史增长掉点
Initial_Orange2985 · reddit · 2026-09-29
一位开发者为自己的助手记忆层做了检索基准测试,只问一个问题:模型需要的事实是否真的被注入。设置是每个规模 180 道题,用户历史分别含 104/208/416 条事实,同一语料、同一归一化,各方案 k=6,零 LLM 调用。
结果:向量 RAG(FAISS,与产品同款 embedding)得分为 0.889、0.850、0.839,随历史增长而下降;关键词 top-k 在三个规模都是 1.000;他的记忆层也是 1.000。也就是说关键词检索在召回上追平了他。
他复盘:第一版关键词只有 0.672,他以为碾压了,后来发现是没拆分关系名里的下划线导致无法匹配,修好后差距消失——这是关于 baseline 的教训。
记忆层真正的优势在体积:每题注入 134177 字符,而关键词约 380 字符,同样召回下上下文少 23 倍;且无相关内容时会明确说「记忆里没有」,而不是硬塞 6 条半相关结果。
他坦承局限:合成语料、法语、字面键、仅检索未端到端。下一步要构造更难的测试:用户陈述一个事实后,导入文档重复相反内容 8 次,k=6 时副本可能占满所有槽位,并向社区请教如何处理。
所属事件:开发者实测:关键词检索召回追平甚至超越向量 RAG(2 条相关)→
「编程与Agent」频道最新
- 养五个孩子的父亲谈跑多 Agent 的心得:并行与复核才是瓶颈 — rschu · 2026-09-29
- Stanford AI 课程要点:agents 只能看到公司 10% 的信息 — le_james94 · 2026-09-29
- Deedy 10 小时打磨 Claude Code 视频生成全流程,附完整工具链 — deedydas · 2026-09-29
- 开发者开源 SEC 财报 MCP 服务器,agent 可查 2009 年以来全部 XBRL 数据 — Effective-Catch-1332 · 2026-09-29
- 一个 Prompt 把 Claude Opus 5.5 变成专业动效设计工作室 — socialwithaayan · 2026-09-29
- Skills 用途分布:15% 的 skills 用于教 agent 规划与自动化浏览器 — zainhas · 2026-09-29