开发者实测记忆层:关键词检索追平召回,向量 RAG 随历史增长掉点

Initial_Orange2985 · reddit · 2026-09-29

一位开发者为自己的助手记忆层做了检索基准测试,只问一个问题:模型需要的事实是否真的被注入。设置是每个规模 180 道题,用户历史分别含 104/208/416 条事实,同一语料、同一归一化,各方案 k=6,零 LLM 调用。

结果:向量 RAG(FAISS,与产品同款 embedding)得分为 0.889、0.850、0.839,随历史增长而下降;关键词 top-k 在三个规模都是 1.000;他的记忆层也是 1.000。也就是说关键词检索在召回上追平了他。

他复盘:第一版关键词只有 0.672,他以为碾压了,后来发现是没拆分关系名里的下划线导致无法匹配,修好后差距消失——这是关于 baseline 的教训。

记忆层真正的优势在体积:每题注入 134177 字符,而关键词约 380 字符,同样召回下上下文少 23 倍;且无相关内容时会明确说「记忆里没有」,而不是硬塞 6 条半相关结果。

他坦承局限:合成语料、法语、字面键、仅检索未端到端。下一步要构造更难的测试:用户陈述一个事实后,导入文档重复相反内容 8 次,k=6 时副本可能占满所有槽位,并向社区请教如何处理。

所属事件:开发者实测:关键词检索召回追平甚至超越向量 RAG(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →