更强检索胜过加推理步数,DRAG按查询挑选检索器与生成器

One Size Does Not Fit All! Dynamic Retriever and Generator Selection for RAG

Neeraj Anand, Payel Santra, Partha Basuchowdhuri, Debasis Ganguly, Sumit Bhatia

cs.IR, cs.AI

2026-09-16

升级检索比加长思考更划算,最强档不是处处最优。监督路由在热点问答精确匹配五十三点二、三点一秒,超过固定最强的五十一点六与四点四秒。

这篇在解决什么

多数RAG对所有查询用同一套检索器和生成器。查询难度差得很远:有的是单文档事实题,有的要跨文档搭桥、组合、时间或数值约束。一律上「分解查询加交叉编码器再开高思考」,简单题浪费时延;一律用BM25加短解码,难题拿不到证据。检索适应当前多在「检不检索、检几轮」,生成适应当前多在固定检索上调思考步数。两者一起怎么配,缺少端到端对照。

这篇把检索复杂度和生成复杂度摊开,做成可选组合,再按查询挑一对。

方法

检索四档,越往后越贵:

生成三家开源模型,用测试时计算当档位。GPT-OSS-20B有低/中/高思考;Qwen3-8B和Gemma-4-26B是思考开关。GPT-OSS一共12个组合,另外两家各8个。上下文一律5条。

免训练的DRAG-QPP分两步。先用语料上的Average IDF估计查询难度,高IDF(词更稀)走便宜检索,低IDF往上加码,阈值取训练集75/50/25分位。选定检索器之后,用基座模型对取回上下文算困惑度:低则证据和模型合拍,走轻生成;高则往上加思考。监督版DRAG-SFT用Qwen3-4B-Instruct在效率感知神谕标签上微调,一次解码输出检索档和生成档。神谕给每个查询挑「能答对的最便宜组合」,EM不到1则退到F1≥0.8,再不行就上最贵档。

数据是TriviaQA、HotpotQA、MuSiQue,FRAMES做域外。FRAMES的路由器不在该集上调,用MuSiQue训练直接测。

结果

静态网格里,固定生成器、把检索从词法升到稠密再到重排,多跳题涨幅最大;再升到Extra-High常常回落,HotpotQA上GPT-OSS的High/High是EM 51.6,Extra-High/High是48.8。固定检索、只加思考,涨幅更小且不稳:MuSiQue在弱检索上EM只从7.1到7.6,在High检索上才从19.5到22.8。推理补不上差检索。

HotpotQA上神谕分布也说明最贵档不是覆盖集:不少查询在低/中档就已经对。时延从Low/Low的0.11秒到High/High的4.36秒、Extra-High/High的5.87秒。

方法(GPT-OSS, HotpotQA)EMF1秒/查询
固定最强(RAGmax)51.665.24.36
DRAG-QPP49.263.12.18
DRAG-SFT53.267.63.11
神谕63.976.91.83

TriviaQA上SFT的EM 68.1,超过RAGmax的66.1,时延5.37秒对10.73秒。MuSiQue为24.5对22.8。FRAMES域外SFT仍高于RAGmax(23.3对21.8),统计显著性不如域内稳。Qwen和Gemma上趋势同向:QPP接近中高静态配置但更便宜,SFT再往上挤一点。路由本身只要0.28到0.36秒,时延差主要来自SFT更爱挑贵配置。

失败类型包括估高(简单题被送进分解检索,引入噪音)、估低(难题配了轻档)、以及实体张冠李戴。k=5附近,强检索已经饱和,再加文档帮助有限。

为什么重要

对RAG排期,优先把检索从BM25升到稠密加轻量重排,通常比把思考token从中档拉到高档更值。Extra-High那种「先分解再大候选再重排」不是免费的上界,有时更差。若不能微调,Avg-IDF加上下文困惑度就能把时延砍掉一截,质量接近固定中高配;有神谕标签就上SFT,HotpotQA上能同时赢质量和时延。

这是配置空间上的调度,不是新的检索器或新的推理算法。神谕还有十个点的EM空着,路由仍远未饱和。

局限与存疑

QPP只用Avg-IDF,信号在检索发生之前,看不到第一遍结果,所以QPP经常略低于RAGmax。SFT依赖神谕标签,标签来自同一批配置的穷举,换检索器或换模型要重打标签。FRAMES上提升不总显著,说明路由对题型分布敏感。生成器只覆盖思考档,没有换模型尺寸;检索器也只走了经典四档。k固定为5,延迟表排除了索引构建。论文没有把路由和Self-RAG、Adaptive-RAG那些「检不检索」方法放在同一张表里比端到端。

术语

原文与代码

社区讨论

相关论文

全部论文解读