RAG 修复只在测试题上有效?790 份临床 PDF 检索的过拟合之惑
Overall_Judge8086 · reddit · 2026-10-02
作者在 790 份临床 PDF 上搭建混合检索系统(本地 FAISS + BM25 融合 Google Gemini File Search,加 rerank 层),用 60 道按页生成的 LLM 测试题评估(每题跑 3 次,因 File Search 每次结果不同)。
整体效果:MRR 从 0.56 提到 0.67,正确论文进 top10 从 61% 升至 83%,正确页命中率 70%→94%。
问题:上周针对 20 题做的两项修复(为无页码的 chunk 定位原文、放弃同义词扩展改为仅作分数加权)让这 20 题 MRR 从 0.59 升至 0.72,但留出的 40 题几乎没变(0.66→0.65);Top-3 准确率倒是普遍从 68% 升至 75%。
作者提出三个开放问题:这是过拟合还是 40 题样本太少?既然答案模型本来就读 top5-8 论文,该不该改用 hit@3/hit@5 而非 MRR?以及比“每页一道 LLM 题”更好的测试集构建方式?
「编程与Agent」频道最新
- GitHub 1.8 万星免费 Harness Engineering 课程:14 讲+8 实战项目 — Hesamation · 2026-10-02
- 安全通告里的 void* 指针:AI 正在翻 Linux 内核旧代码 — mircomusolesi · 2026-10-02
- A2A 协议声量高落地少:多数团队仍停留在评估阶段 — Diarnstinc_Crew_6510 · 2026-10-02
- Cloudflare Sandbox SDK 1.0 发布:Durable Object 直接管控沙箱容器 — threepointone · 2026-10-02
- 录课口误喊暗号,让 Codex 自动剪掉重录片段 — JeremyNguyenPhD · 2026-10-02
- 开源 ComfyUI 插件:一键加载 Civitai 工作流并自动补齐缺失模型 — Zealousideal-Bee-300 · 2026-10-02