腾讯提出 RubricRanker:专为深度研究智能体训练重排序器

_reachsumit · x · 2026-08-05

现有的检索系统通常基于相关性来挑选文档,但对于深度研究智能体而言,单篇高度相关的文档未必能组合成满足复杂查询需求(如多样性、权威性)的优质文档集。

为此,腾讯团队提出了一种面向搜索的评价准则,显式定义了高质量文档集应满足的标准。基于这些由 LLM 合成的分层结构准则,研究者训练了文档重排序模型 RubricRanker。

训练过程分为两阶段:基于准则的监督微调(SFT)和强化学习(RL)。实验表明,该方法在四个深度研究基准上比最强基线高出 2.6 分,并且在五个 RAG 基准上展现出良好的泛化能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →