实测打脸:关键词搜索召回 100%,向量 RAG 反而掉到 0.839
Initial_Orange2985 · reddit · 2026-09-29
一位正在为助手构建记忆层的开发者公开了检索基准的实测结果:记忆层、向量 RAG 与关键词搜索三方案对比,结论反直觉。
实验设置:
- 每档 180 个问题,用户历史含 104/208/416 条事实,k=6,零 LLM 调用,只测注入内容是否包含答案事实
- 向量 RAG(FAISS,同产品嵌入)随历史增长从 0.889 掉到 0.839
- 关键词 top-k 与作者的记忆层均为全档 1.000 召回
关键发现与反思:
- 最初版记忆层测出关键词只有 0.672,以为遥遥领先,后来发现是没切分关系名里的下划线导致关键词根本匹配不上——修完差距消失,作者自嘲关于基线的教训
- 记忆层相对关键词的真正优势是体积:每问注入 134-177 字符 vs 约 380,同等召回下上下文少 2-3 倍;且查不到时会明说,而不是塞 6 条半相关内容误导模型
- 局限:合成语料、法语、键值过于字面化,只测检索未测端到端问答
- 下一阶段计划测试「用户陈述事实后,导入文档重复相反说法 8 次」的场景——k=6 时重复内容可占满所有槽位,向社区征集 dedup、chunk 来源标注等应对方案
所属事件:开发者实测:关键词检索召回追平甚至超越向量 RAG(2 条相关)→
「编程与Agent」频道最新
- 神经科学研究者用 Claude 与 GPT 当研究助理,产出了成果却愁没处发 — neuroecology · 2026-09-30
- 不给音频只给结构:Jev 零样本预测 2029 通电话,AUC 达 0.78 — alexcovo_eth · 2026-09-30
- Replicas V3 发布:VM 里跑 Claude Code 与 Codex,可自带订阅 — KlausCodes · 2026-09-30
- Agno 智能体框架支持将组件一等公民式发布为 MCP — pritisinghhhh · 2026-09-30
- 开发者谈AI编程:不必为编码手艺哀悼,时间才是真正的瓶颈 — jh3yy · 2026-09-30
- Perplexity 发布 Automations:事件触发与定时执行持续任务 — perplexity_ai · 2026-09-30