SetwiseEvalKit 评估的是文档集合而非单篇结果
Kailin Jiang · hf · 2026-07-23
这篇论文在解决什么
作者认为,当 LLM 和 AI agents 直接消费搜索结果时,真正决定下游生成质量的,不是单篇文档相关性,而是整个文档集合的质量。
- 现有评估方法大多只给单文档打分并聚合,忽略了文档之间的 冗余、冲突、互补 关系。
- 论文提出 SetwiseEvalKit:一个三层、九维的文档集合评估基准,包含约 28K 条高质量 rubric。
- 他们系统评测了 12 个 reranker,结果显示即便最好方法也只能覆盖 45% 的 rubric,跨文档协同能力普遍偏弱。
- 在此基础上,作者提出 Rubric4Setwise,把 rubric 评价标准直接转成文档集合选择信号,且无需训练。
- 这个方法在更少文档和更少检索轮次下实现了最好的下游生成效果,并且在短文本和长文本场景都保持 SOTA。
「研究」频道最新
- MICCAI FLARE 2026 试图验证统一 AutoML 医疗影像系统 — yuyinzhou_cs · 2026-07-23
- 1.7 万例泛癌 CT 标注数据集发布并开启挑战赛 — yuyinzhou_cs · 2026-07-23
- SIGIR 2026 论文研究:QPP 能否先选出最佳查询变体再付 RAG 成本 — mrdrozdov · 2026-07-23
- Kepler v0.1 把机器人视觉触觉位姿合成一体 — freelerobot · 2026-07-23
- GPT-5.5 参与生成五个 Banach 空间新结果 — ChrSzegedy · 2026-07-23
- MCP 官方注册表里 1/7 源仓库已无法公开访问 — mcpindex · 2026-07-23