腾讯 AdaTutoRank:自适应辅导优化训练 RAG 文档重排器
tencent · hf · 2026-09-29
腾讯发布 AdaTutoRank,一种面向 RAG 与深度研究的 setwise 文档重排器,用自适应辅导优化(ATO)解决集合级训练的监督稀疏问题。
- 问题:主流重排器按单文档相关性排序,但复杂信息需求需要的是互补、非冗余的文档集合;现有集合级方法把同一标量奖励分给集合内所有文档,导致「搭便车」与「被连坐」无法区分,credit assignment 失效。
- 方法:ATO 从策略自身的冻结快照按 rollout 质量匹配三种递进粒度的提示——仅 rubric、self-selector 按 rubric 选出的兄弟集合、self-reflector 对比 rollout 与兄弟集合的反思;再用提示条件下的冻结教师与无提示快照重打分,把提示效果蒸馏成 token 级优势,与组相对结果优势互补。rubric 采用三层九维体系,同时服务于冷启动的 silver labels、RL 奖励与蒸馏 hints。
- 结果:在横跨 RAG、深度研究、setwise 评测的十个基准上取得最佳整体性能,同时检索调用次数更少。
「研究」频道最新
- 论文变多≠质量下降,NeurIPS 老论文同样无用 — xwang_lk · 2026-09-29
- 研究提出用聚敛与区分效度系统评估 AI 基准有效性 — sanmikoyejo · 2026-09-29
- 研究:偏差基准 BBQ 可能在测推理而非偏差 — sanmikoyejo · 2026-09-29
- 偏差基准按任务形式聚簇,而非宣称测量的性别种族偏差 — sanmikoyejo · 2026-09-29
- 研究:推理、知识、理解类基准高度相关或测同一概念 — sanmikoyejo · 2026-09-29
- 研究:同类安全基准相关性弱,偏差定义各行其是 — sanmikoyejo · 2026-09-29