自适应推理树随证据量长高,MoNaCo检索召回50.8对39.3

A Tree-based RAG Framework for Evidence-Intensive QA via Adaptive Planning and Topology-Aware Evidence Gathering

Songeun Lee, Kyungjin Min, Injae Na, Suyeong Lee, Chiyoung Kim, Woohwan Jung

EMNLP 2026

cs.AI, cs.IR

2026-09-04

APT-RAG按节点决定复用兄弟答案、直接检索或继续拆题,并沿树汇证据。MoNaCo上Qwen3-30B的答案F1为50.84,Plan*RAG为47.03,检索召回50.79对39.28,平均延迟约105秒。

这篇在解决什么

多跳 QA 平均只需两三页,HotpotQA 大约 2.0 页。证据密集型 QA 要把几十上百篇里的碎片拼成答案:MoNaCo 平均 43.3 页,QAMPARI 平均 13.0 页。现成的结构化 RAG 在这个尺度上露出两处硬伤。

结构刚性:PlanRAG 一类方法事先铺好固定图,一个节点可能被迫吞下十几个实体条目,拆错标准就整枝错。拓扑无知:ToQ 一类方法建了树,却只在根上收证据,子节点已经算出的实体属性到不了父节点。基线检索量几乎不随金标页数涨,题越难、覆盖越不够。

方法

APT-RAG 用深度优先递归长树,不预先画完整结构。每个节点四步。

语境化:子问题里的 <Qj> 占位符用已完成的兄弟问答对换成自含问题。

自适应规划:可答性检查器先看能否只用已有兄弟问答对解决,能就走横向汇集,不再检索、不再拆。否则交给分解器:原子问题改写成检索查询;还不够细就拆成子问题,挂成孩子。

拓扑感知汇集三条。横向:复用同层兄弟问答,挡住对已探索信息的重复拆解。外部:对查询和文档做余弦检索,取 top-20。纵向:孩子的问答对汇总给父节点,把广撒网拆成窄范围。树上每个节点只用自己的子树和兄弟子树;祖先那一层留给祖先自己收,避免全树重复聚合。

证据引导的批量作答用来砍延迟。一批互不依赖、都走外部检索的孩子,按证据 Jaccard 聚类,共享段落的子问题一次生成。聚类松弛成补图着色,再加上下文长度约束。相似度阈值 τS=0.0(至少一篇重叠),窗口预算 4B 为 15 万 token、30B 为 5 万。

骨干是 Qwen3-4B-Instruct 和 Qwen3-30B-A3B-Instruct,嵌入 Qwen3-Embedding-0.6B,k=20。MoNaCo 主结果用 GPT-5.4 当裁判。对照:无检索 LLM、NaiveRAG、PlanRAG、LogicRAG、ToQ。RT-RAG 太贵,只在 300 条子集上跑,放进附录。

结果

MoNaCo、Qwen3-30B:APT-RAG 答案精确率/召回/F1 为 55.32/50.75/50.84,检索召回 50.79。PlanRAG 是 47.03 F1 和 39.28 检索召回。ToQ 46.66 / 31.91,NaiveRAG 46.64 / 31.68。LogicRAG 精确率最高(55.70),检索召回最低(21.64),F1 落到 46.41。相对 PlanRAG 的 F1 增益约 8%,全部相对基线的 F1 提升 p≤0.001。

4B 上多数基线掉得更狠,PlanRAG 的 F1 只有 27.02,低于 NaiveRAG 的 34.98;APT-RAG 仍有 40.69 F1 和 40.12 检索召回。QAMPARI、30B:F1 23.28 对 ToQ 的 21.37,检索召回 19.61 对 11.42。

金标页数从 1–10 涨到 31+,基线检索量几乎一条平线,APT-RAG 的树深和树宽一起涨,取回的维基页跟着加。21–30 页档的答案 F1 接近基线在 11–20 页档的水平。

消融把模块分成提质和提速。去掉纵向汇集就退化成 NaiveRAG,F1 46.64。树宽钉死为 2:F1 49.61,召回 37.48,延迟 46.56 秒。钉成平均宽度 6:召回 51.60,延迟 314.97 秒。完整系统 50.84 F1、50.79 召回、104.59 秒。横向汇集和证据聚类分别把延迟砍 41.4% 和 8.2%,95 分位长尾延迟下降更明显。代价也清楚:去掉这两项效率模块,F1 升到 53.96。完整配方是在用大约 3 个 F1 换延迟。

为什么重要

证据密集型 QA 的瓶颈是覆盖,不是把单跳检索再叠一层。这篇把「题有多难,树就长多大」做成可运行的递归,并证明基线的固定结构在 30 页以上会明显掉队。批量作答是工程补丁,但 95 分位延迟才是这种系统能不能上线的那条线。

换约 3 个 F1 换近一半延迟,值不值取决于产品能不能等一分半。

局限与存疑

作者承认推理又贵又慢。完整系统平均 104.59 秒,去掉效率模块更到 184 秒。证据一多,合并后的长上下文会把聚类省下的时间吃回去,31+ 档平均延迟收益甚至反转。规划错了会多长废枝或把错误传上去,分解器和可答性检查都还是提示,没有单独训练。评测只有 MoNaCo 和 QAMPARI 两个基准,DeepSearchQA 这类更新的集合没进主表。RT-RAG 因成本只跑子集,和全文主结果不对齐。

术语

原文与代码

社区讨论

相关论文

全部论文解读