Training Documents Reranker with Search Rubrics for Deep Research Agent
Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou
cs.IR, cs.AI, cs.CL
2026-08-04
深度研究 agent 检索回来的 top-k 文档单篇都相关,凑成一个集合却可能缺多样性、冗余、来源不权威。腾讯提出查询级 search rubrics(相关性/简洁/一致性 + 权威/时效),配 SFT+RL 两段训练重排器 RubricRanker(Qwen3-8B),在 4 个深度研究基准平均领先最强 baseline 2.6 分,还能减少 agent 的搜索调用次数。
深度研究 agent(deep research agent)回答复杂问题时,会反复检索、推理、再检索。每一步它向搜索引擎发一个子查询,拿回一批网页文档。现有检索器和重排器按「单篇相关性」打分选 top-k,但单看每篇都相关的文档,凑成一个集合未必能满足 agent 的复杂需求:可能漏掉某个重要角度、可能几篇内容互相重复浪费上下文预算、可能混进来源不权威的文档把 agent 带偏。
论文举的例子很直观:用户描述抑郁症状并求助,agent 发出子查询「如何治疗抑郁症」。检索回的三篇文档都相关,一篇讲药物、两篇讲心理治疗。但这个集合有三个问题:漏了自我调节这一类疗法;两篇心理治疗内容冗余,白占上下文;第三篇来自非权威的个人博客,可能让 agent 生成不可靠的医学建议。单文档相关性解决不了「集合质量」。
RubricRanker 的思路:把「高质量文档集该满足什么」显式写成查询专属的 rubric(评分准则),再用这些 rubric 训练重排器,让它直接选出一个好子集,推理时不再需要 rubric 输入。
rubric 的构造分三层。先是固定的「元 rubric」,分两级:集合级(相关性、简洁性、一致性)和文档级(来源权威性、时效性)。然后用 GPT-5.1(带联网搜索)为每个查询合成一份高质量参考答案当蓝图,据此把元 rubric 展开成查询专属 rubric,每条带 15 的权重。训练查询来自深度研究数据集(OpenScholar、SearchArena 等,用 Dr-Tulu-8B agent 跑出子查询)和 RAG 数据集(HotpotQA、NQ)。
训练两段式。第一段 rubrics-guided SFT:用 GPT-5.1 当老师,在 rubric 引导下从候选文档里选出最优子集作为银标签,给重排器冷启动。第二段 rubric-based RL:用 GRPO,奖励是把集合级和文档级 rubric 分数按权重聚合(集合级由 GPT-5.1 judge 给整集打分,文档级对每个选中文档打分再平均),再叠一个格式奖励。骨干是 Qwen3-8B,推理时输入查询和候选文档列表,直接输出选中的文档 ID。
两个场景评测。深度研究(用 Dr-Tulu-8B 当 agent,Google Search API 检索,重排 top-30 取 top-5)和 RAG(Qwen3-8B 生成,BGE 检索维基百科,精确匹配 EM)。
| 场景 | 最强 baseline | RubricRanker | 提升 |
| 深度研究 4 基准平均 | Rank4Gen 57.5 | 60.1 | +2.6 |
| RAG 5 基准平均 EM | Rank4Gen 38.2 | 40.0 | +1.8 |
深度研究上,WebWalkerQA 58.0、HealthBench 61.5、ResearchQA 74.2 都明显领先,DRB 46.8 与 baseline 接近。RAG 上 HotpotQA 38.0、PopQA 42.2 等 5 项全部最优。两个观察值得圈出:一是面向生成的重排器(Rank4Gen、SetR)在 RAG 上有提升,但增益到深度研究任务几乎消失,在封闭式 RAG 上训出来的不一定能迁到开放式深度研究,这正是 rubric 训练的用武之地。二是任何重排都比原始检索强(深度研究 54.0→56.160.1,RAG 34.3→35.340.0)。
消融:去掉 RL 从 52.5 降到 51.1,去掉冷启动 SFT 降到 48.3(SFT 对 RL 的稳定初始化更关键),label 构建去掉 rubric 降到 49.2,换成普通相关性排序 label 降到 48.1。还能省搜索调用:HealthBench 上 agent 平均搜索次数从 RankT5 的 3.2、Rank4Gen 的 3.4 降到 2.9(相对降 9.4% 和 14.7%),因为每步给的证据更够用,agent 更早收手。
这篇把「重排」的目标从单文档相关性挪到了文档集质量,这个视角对做 RAG 和 agent 检索的人都对口。rubric 当监督信号的好处是可解释,你能看见每条查询被哪些准则约束、权重多少,出了问题好定位。对生产系统,减少 agent 搜索调用次数意味着更低的延迟和成本,这点很实在。
它是 8B 模型,推理时不依赖 rubric 或 GPT-5.1,部署门槛低。
作者自己说:rubric 奖励依赖 GPT-5.1,大规模训练时成本高(他们计划训专门的奖励模型替代);深度研究基准因为 LLM 评测贵又慢,只抽了子集(每基准 100200 条),没跑全量;最终评估还是看 agent 生成质量,即使选了对文档,agent 自己推理或生成时仍可能出错,缺少直接评「文档集本身质量」的客观指标。
读下来再补一点:评测靠 LLM judge 按 rubric 打分,而 rubric 又是这套方法的核心,存在「用同类工具既当裁判又当训练信号」的循环风险,数字的绝对值要打折看。优势主要看相对排序和搜索调用下降这两个更稳的信号。