腾讯提出 RubricRanker:专为深度研究智能体训练重排序器
_reachsumit · x · 2026-08-05
现有的检索系统通常基于相关性来挑选文档,但对于深度研究智能体而言,单篇高度相关的文档未必能组合成满足复杂查询需求(如多样性、权威性)的优质文档集。
为此,腾讯团队提出了一种面向搜索的评价准则,显式定义了高质量文档集应满足的标准。基于这些由 LLM 合成的分层结构准则,研究者训练了文档重排序模型 RubricRanker。
训练过程分为两阶段:基于准则的监督微调(SFT)和强化学习(RL)。实验表明,该方法在四个深度研究基准上比最强基线高出 2.6 分,并且在五个 RAG 基准上展现出良好的泛化能力。
「编程与Agent」频道最新
- 高效提示词哲学:像带博士生一样管理大模型 — yunta_tsai · 2026-08-05
- MemHarness:记忆重构而非直接回放,让智能体更可靠 — rohanpaul_ai · 2026-08-05
- MCP 服务器面临间接注入威胁:权限校验无法阻止恶意内容写入 — Overall_Rough_8113 · 2026-08-05
- 开发者开源 AEO 审计引擎:排查 AI 爬虫抓取阻断 — goldlionroar · 2026-08-05
- 基因组智能模型接入MCP:Claude、Cursor等智能体可直接调用基因预测 — julia_kiseleva · 2026-08-05
- 上海迪士尼 MCP Server:让大模型实时查询门票价格与余票 — modelcontextprotocol · 2026-08-05