六个月评测实证:别让模型改写原文,BM25 加权检索召回大增
Cryvixx · reddit · 2026-08-24
作者介绍自建的 Silica harness:LLM 对 markdown 笔记库的写入经过门控——模型提议编辑、解析器和状态机校验、写后回读,失败即回滚;读取路径(搜索、回忆)完全不用模型。以下是基于 50+ 篇论文和真实评测(样本量小,数字仅看方向)的发现:
- 唯一复现的结论:不要让模型改写原文。 保留会话原句 vs 写摘要,verbatim 在两组对话中全面胜出(0.592 vs 0.428;0.840 vs 0.693),摘要组在每个问题类别都垫底。
- BM25 加权共现图替代原始计数:recall@10 从 0.51 升至 0.86。 且该腿加权正确后,融合权重和 RRF 常数不再影响结果——之前调参只是在补偿一个坏腿。
- 看似有用的检索腿实际零收益: 笔记间派生边在融合中没找回任何 embedding 未覆盖的对,去掉后 recall 反而从 0.8233 升到 0.8815,成本从 5ms 降到 1.7ms。
- 0.669 的 FActScore 原来是 harness bug: 修复判定参照后三个库的成绩为 0.999/0.991/0.961(5855 条事实)。
- 没有坏行的榜单表是营销资产: 自动重组器与人工文件夹仅 0.32 一致等差结果原样保留,runner 拒绝跨配置比较。
应用层:指向 200 个 PDF 就是 200 笔可恢复、可单独回滚的事务;笔记关系走 wikilink+概念图最短路径;整个库可聚类为社区和语义区域;日历即按日期读取的笔记库。
「编程与Agent」频道最新
- Cloudflare 开源 AI OS,用安全模型解决数据隐私风险 — irvinebroque · 2026-08-24
- Agent 不是聊天,而是带任务队列的调度器 — andreisavu · 2026-08-24
- Stripe Link 推出 CLI,让 Agent 安全完成代理支付 — jeff_weinstein · 2026-08-24
- 如何优化 Agent 记忆检索策略与时机? — Bobsthejob · 2026-08-24
- Claude Opus 严重翻车:无视指令且工具调用乱飞 — taylorwilsdon · 2026-08-24
- Agent工具参数会「编造」:一份输入消毒清单防注入 — blaizedsouza · 2026-08-24