腾讯提出 RubricRanker:专为深度研究智能体训练重排序器
_reachsumit · x · 2026-08-05
现有的检索系统通常基于相关性来挑选文档,但对于深度研究智能体而言,单篇高度相关的文档未必能组合成满足复杂查询需求(如多样性、权威性)的优质文档集。
为此,腾讯团队提出了一种面向搜索的评价准则,显式定义了高质量文档集应满足的标准。基于这些由 LLM 合成的分层结构准则,研究者训练了文档重排序模型 RubricRanker。
训练过程分为两阶段:基于准则的监督微调(SFT)和强化学习(RL)。实验表明,该方法在四个深度研究基准上比最强基线高出 2.6 分,并且在五个 RAG 基准上展现出良好的泛化能力。
「编程与Agent」频道最新
- 开源多用户 Agent 平台 Nautilo 上线:Genie 可替你登录网站干活 — Dan_Jeffries1 · 2026-09-22
- 用 x402 让投研 Agent 订阅付费 Substack 财经通讯 — kleffew94 · 2026-09-22
- Hermes Agent 联手 ComfyUI 过夜自主迭代,做出角色替换视频 — Teknium · 2026-09-22
- 嫌 Codex 额度烧太快,开发者做 Token Saver 让 Muse 分担编码任务 — AIandDesign · 2026-09-22
- Agent 集群扩展 N 倍理论上可得 N^λ 倍加速 — tobyordoxford · 2026-09-22
- 睡一觉醒来:Agent 自作主张给训练任务加了 2 小时预算叫停 — BLUECOW009 · 2026-09-22