RAG 修复只在测试题上有效?790 份临床 PDF 检索的过拟合之惑

Overall_Judge8086 · reddit · 2026-10-02

作者在 790 份临床 PDF 上搭建混合检索系统(本地 FAISS + BM25 融合 Google Gemini File Search,加 rerank 层),用 60 道按页生成的 LLM 测试题评估(每题跑 3 次,因 File Search 每次结果不同)。

整体效果:MRR 从 0.56 提到 0.67,正确论文进 top10 从 61% 升至 83%,正确页命中率 70%→94%。

问题:上周针对 20 题做的两项修复(为无页码的 chunk 定位原文、放弃同义词扩展改为仅作分数加权)让这 20 题 MRR 从 0.59 升至 0.72,但留出的 40 题几乎没变(0.66→0.65);Top-3 准确率倒是普遍从 68% 升至 75%。

作者提出三个开放问题:这是过拟合还是 40 题样本太少?既然答案模型本来就读 top5-8 论文,该不该改用 hit@3/hit@5 而非 MRR?以及比“每页一道 LLM 题”更好的测试集构建方式?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →