按查询路由五条检索管线,比最准静态方案快12.4倍还多2.5%

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval

Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi

EMNLP 2026

cs.IR

2026-08-26

RetrievalRouter 只看查询文本,在 BM25、文本稠密、文本重排、多模态稠密、多模态重排之间做选择。λ=0.1 时 nDCG@5 到 0.755、均延迟 0.666 秒,比最准的多模态 late-interaction 高 2.5%,快 12.4 倍。

这篇在解决什么

文档检索现在有两条轴。模态上,可以检索抽出来的文字,也可以直接对页面截图做视觉检索。架构上,可以一条向量,也可以 ColBERT 式 late-interaction。最准的配置最贵:论文里多模态 late-interaction 均延迟 8.283 秒、nDCG@5 0.737;BM25 只要 0.019 秒,但只有 0.510。产线只能在漏证据和不可用延迟之间选一个,而且是对所有查询一刀切。

作者在金融、科学、开放域共 11 个基准上量了七条管线,发现失败是查询级、不对称的:版面复杂时文本管线崩,长程文本推理时视觉编码器又落后。没有一条静态管线包打。

方法

路由动作空间收成五条:BM25、文本稠密、文本重排、多模态稠密、多模态重排。纯 late-interaction 留作静态对照,因为重排已经能在低得多的延迟上接近它。路由器是冻住的 Qwen3-0.6B-Base 加 LoRA,均值池化到 1024 维,再接一层线性头。开销 15 毫秒。

标签不用「谁第一」的硬标签。每条查询对五条臂算奖励:nDCG@5 和归一化延迟的凸组合,λ 从 0 扫到 1 就得到整条准确率-延迟前沿。奖励经温度 0.1 的 softmax 变成软目标,再对预测分布做 KL。多条管线打成平手时,硬标签会制造噪声;软目标把平手留成平手,把小间隙放大成可学偏好。

文本管线用 Linq-Embed-Mistral 和 GTE-ModernColBERT,图表事先用 Gemini 3.0 Flash 加字幕,避免「没看见图」和架构能力混在一起。多模态侧是 Nomic Embed Multimodal 及其 ColPali 风格变体。

结果

λ=0.1 时 nDCG@5 0.755、均延迟 0.666 秒。相对 ML:+2.5%、快 12.4 倍;相对部署常用的 MR:+3.0%、快 1.7 倍。λ=0.5 时 0.707 / 0.314 秒,相对 MD +6.2% 且略快。λ=0.7 相对 Arabzadeh 式硬标签路由,nDCG 0.630 对 0.624,延迟 0.148 对 0.171 秒,两边都不显著。λ=0 时仍有 6.0% 查询走 BM25,Wiki-SS 上这个比例到 20.0%,说明词匹配有时就是最准的臂,不是省钱备用。

oracle 能到约 0.90 nDCG@5,路由器还差大约 14 分。oracle 选 MD 的那 1828 条查询上,MD 平均奖励 0.93,硬接重排掉到 0.70:重排不是免费的二阶段。视觉密度升高时,路由到多模态的比例从 69.7% 升到 95.2%。

为什么重要

财务、年报、幻灯、论文混在一个库里时,不必为最难的那类查询给所有流量买 ColPali。一个 0.6B 路由器加一个 λ,就能在同一套索引上滑准确率-延迟。代码和超过 8 万条查询的 per-query 最优臂标签一并公开,后续可以换臂、换损失。

这是路由,不是新的检索模型。所有臂的索引都要预先建好。

局限与存疑

存储是第一笔账:四个向量索引外加 BM25,多模态 late 索引约 39 GB,是文本稠密的 13 倍。常驻全部管线大约 40 GB 显存。省的是 GPU 时间,换的是盘和卡。

划分是数据集内 80/10/10,路由器可能在用领域词当视觉密度的代理,跨域零样本没有测。只看查询文本,遇到「总结第 5 页的表」这种话,最优臂取决于那一页长什么样,查询本身不够。动作空间还没有生成式 LLM 重排器。11 个基准偏英文本、财报和论文,中文扫描件、手写、双栏杂志不在数字里。

术语

原文与代码

社区讨论

相关论文

全部论文解读