证据不够才继续拆问,Hi-Q全库检索平均EM达52.3

Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering

Jueun Kim, Sungho Park, Wook-Shin Han

cs.CL, cs.IR

2026-08-31

Hi-Q只在阅读器答不出时按依赖关系把问句一分为二,不必预建语料图谱。全库三套基准平均52.3 EM,比迭代检索基线IRCoT高出15.1。

这篇在解决什么

多跳问答的句子粒度和语料里能检索到的证据粒度经常对不上。问句太粗,检索会命中「III」「战役」这种表面词,整条证据链对不齐;拆太细又丢掉约束。Graph RAG 在语料侧预先建图,粒度与当前问题无关,HotpotQA 全库 520 万段上光构图就要超过 2500 美元。IRCoT 一类迭代改写会观察证据,却不检查「刚才那句已经能不能检到」,错的桥接实体会一路传下去。

POSTECH 的 Hi-Q 把多跳 RAG 写成「可检索粒度发现」:每个查询节点先问证据是否撑得住,撑不住再按依赖关系一分为二。

方法

状态是当前子问、交互历史和递归深度。解析器先按历史改写指代、取 top-5 段落,再让阅读器作答。有答案就停;没答案且未到深度上限 4,就做一次二叉展开。左支是桥接事实,必须先解;右支用左支结果改写后再检索。语义覆盖校验器检查「先左后右」是否还覆盖父问意图,不一致最多修一次,再失败就标成不可再拆。两支都返回后做综合,用支路一致性消歧,而不是只信最高分段落。

停或展开被写成代价敏感阈值:展开一个本可回答的节点有代价,停在一个其实没证据的节点也有代价。实现上用阅读器是否交白卷当硬分类器,不另训路由。论文证明只看问句、不看证据的策略会有无法消去的遗憾,因为同一问句在不同证据暴露下最优动作可以相反。

检索器是 NV-Embed-v2,阅读器默认 GPT-4o-mini,温度 0。

结果

主评测是全库检索:MuSiQue 13.9 万段、2Wiki 43.0 万段、HotpotQA 523 万段,各 1000 题。

方法MuSiQue EM/F12Wiki EM/F1HotpotQA EM/F1
PropRAG25.8 / 38.652.1 / 59.3
IRCoT24.4 / 34.935.0 / 38.952.0 / 63.6
Hi-Q37.4 / 50.662.0 / 71.457.4 / 69.9

三套平均 52.3 EM / 64.0 F1,比 IRCoT 高 15.1 / 18.2。受限的 supporting/distractor 池上平均 57.9 / 69.3,比 PropRAG 高 5.6 / 3.9。去掉依赖顺序掉到 47.1 EM,静态一次分解掉到 51.5,无条件全拆在 100 题子集上比失败感知触发低 3.4 EM。

根检索失败时,叶子并集在同等 top-5 预算下把全金段落覆盖从 7.9% 拉到 42.7%。人工看 100 次触发,明确误触发约 10%。成本对齐配置把递归深度封到 1,LLM 调用数与 IRCoT 几乎相同(2.93 对 2.92),输入 token 少 9.4 倍,API 费用少 8.6 倍,平均还高 10.4 EM。

为什么重要

多跳检索常被做成「多搜一点」。Hi-Q 把粒度当成控制变量:已经能答的节点不拆,拆的时候先解前提。全库增益大于受限池,说明开放域干扰越大,这种控制越值钱。成本对齐配置比 IRCoT 又便宜又准,完整配置大约是 IRCoT 三分之一的 token 费用再换 3.3 EM。

不需要语料级知识图谱,这对百万到千万段的索引更现实。

局限与存疑

实验限于英文维基、短答案、无环依赖。互相卡住的前提、必须联合优化的支路,当前状态表示覆盖不了。阅读器拒答会过拆,胡答会早停;二元信号表达不了部分证据或冲突桥接实体。触发分析带人工,规模有限。代码执行基线是受控改编,不是原论文配置复现。长文、多语、表格或多模态问答都还没测。

术语

原文与代码

社区讨论

相关论文

全部论文解读