同一批扩展换集成方式,AnchorQE最多把检索抬12.9%

Query Expansion Is More Than Generation: Improving Dense Retrieval through Better Integration

Siyuan Sun, Mihai Surdeanu

cs.IR

2026-08-26

把LLM扩展文本固定、只改进入冻住双塔的方式。AnchorQE对原查询与扩展向量插值,相对常见拼文本最多提升12.89%。

这篇在解决什么

LLM零样本查询扩展(QE)看起来该稳赚:把短查询写成假想文档、伪文档或关键词,再拿去检索。Arizona这组把同一批扩展冻住,只换集成方式,发现常见接法经常低于不用扩展的稠密检索基线。HyDE式「只用扩展向量」、Query2Doc式「把查询和扩展拼成一段再编码」,在TREC-DL、LoTTE、BEIR上对四种生成策略平均下来,多数设定掉到基线以下。生成质量背不了全部锅,文本一旦拼在一起,查询和扩展会在分词、注意力、池化和截断里缠死,没有旋钮去限制扩展把查询向量拽走多远。

方法

AnchorQE把原查询和扩展分开编码、各自归一化,再做向量插值:qα = normalize((1-α)q + α m)。α=0就是原查询;α控制扩展总贡献。多条扩展先按权重混成m,彼此打架会压低‖m‖,等于自动减弱不可靠的修正。论文证明,在共享稠密空间、原始点积打分时,这个单向量检索与加权CombSUM同序,却只发一次索引请求。α<1/2时还有角度上界:α=0.10,任何扩展最多把检索方向扳6.38°。

SC-AnchorQE用无标签流量前缀估计α。默认取流里前8条查询,分别用q和z探一次检索,算两个比例:扩展相对原查询的top-1强度,以及扩展与原查询top-10证据的一致性。两者相乘得到α,冻住后后面的请求只走一次AnchorQE检索。高信任只发给「自己检索得强、又跟原查询证据对得上」的扩展。

对照实验把Qwen3-8B的HyDE、Query2Doc、Q2E关键词、CoT术语各存一份,检索器冻BGE-large-en-v1.5,文档索引不动。更强的文本基线在MS MARCO开发集上从72种拼接配方里挑,固定α=0.15也在同一开发集上选定。

结果

诊断表里,已发表接法和调过的文本重编码各有16/20组低于稠密基线;α=0.15的AnchorQE 20/20都超过基线和已发表接法,相对已发表接法的增益从Query2Doc在TREC-DL 2019的0.46%到CoT术语在BEIR-14的12.89%。

主实验SC-AnchorQE在20组策略×基准上全部超过已发表接法,最大相对增益是CoT在BEIR-14的13.03%(nDCG@10从0.4816到0.5465)。相对无扩展基线,19/20组为正。相对开发集调好的固定α=0.15,17/20组仍为正,HyDE和Query2Doc的集合级置信区间不含零。索引侧延迟:一条AnchorQE请求0.19 ms/q,九路CombSUM要4.33 ms/q,top-10重叠0.9998。三套生成器×三套检索器共45格,对稠密基线44格为正。

为什么重要

QE论文习惯比「生成什么」,这篇把「怎么喂进冻住的双塔」单独做成变量。对已经在跑HyDE或Query2Doc、又不想重建索引的人,分开编码再插值是可直接换上的一层。在线标定不需要标注,八条无标签查询就能定α。代价是生成质量仍是天花板:弱扩展锚不住也救不回来。

局限与存疑

作者写得很清楚。流级α假定前缀能代表后面的流量,分布一变就会过期,一条共享系数也照顾不到「这条扩展特别好/特别差」。弱扩展缺的信息,集成补不回来;Qwen3-1.7B那一档对基线的覆盖明显变窄。评测是严格的无前瞻切分,不是真实时序流量。等价证明要求共享稠密空间和原始点积,混稀疏、截断ANN、非线性融合都不在保证里。标定前缀要额外两次探测检索,之后才回到单请求。

术语

原文与代码

社区讨论

相关论文

全部论文解读