RAG 检索该不该做多样化?论文给出按查询自适应的判定规则
_reachsumit · x · 2026-10-08
魁北克大学三河城团队研究 RAG 检索多样化(diversification)何时有效。通过受控注入近似重复文本与生产式重叠切块实验,发现其效果主要取决于候选池冗余度与查询所需证据数:
- 在干净(无冗余)候选池上,多样化反而损害相关性、证据覆盖与答案质量
- 在多证据查询且 top-k 被重复段落占据时,多样化有益
论文提出一条按查询自适应规则:当最近邻 top-k 中有效文档数低于查询证据需求时才启用多样化,仅用现有 embedding 计算,跨数据集与编码器可迁移,对单证据查询自动退化为普通最近邻检索。另提出带精确最近邻回退的几何重排器 RNG-Score,其 margin 可指示重复结构。结论:多样化应基于可观测的冗余度与证据需求选择性使用。
「研究」频道最新
- MarODE 论文入选 TMLR:用 Markovian ODE 给 LLM 推理链打分 — Tanmoy_Chak · 2026-10-08
- 实测显示 AI 写的单元测试无助于提升 agent 成功率 — GabGarrett · 2026-10-08
- OpenAI 研究员猜想:AI 数学或率先证明 P≠NP — markjeffrey · 2026-10-08
- 密码学家反驳:AI 数学进展威胁椭圆曲线安全毫无逻辑 — markjeffrey · 2026-10-08
- temperature 设 0 也不稳定:千次生成竟出 80 种不同输出 — lmoroney · 2026-10-08
- 用预测市场训练LLM模拟个体行为,零样本迁移提升15.5分 — youjiaxuan · 2026-10-08