SAP 用 off-policy GRPO 蒸馏出 1B 小型重排器,分布偏移下反超传统 KD
_reachsumit · x · 2026-09-03
SAP 团队提出一个两阶段框架,把强化学习引入重排器(reranker)蒸馏,训练出紧凑的指令遵循型重排模型。
- Stage 1:用 off-policy GRPO 结合 LLM-judge 反馈,在 88K 条指令遵循样本上强化一个 4B 教师重排器。
- Stage 2:1B 学生模型从自身策略采样排序,并在这些排序上获得教师衍生的软奖励,把学生探索与知识迁移耦合起来——区别于传统在固定样本集上离线模仿教师输出的蒸馏。
- 结果:在 MAIR-11(11 子集、869 查询)上学生达到 0.7670 nDCG@6,比离线 listwise KD 高 4.6 点;对照实验显示,无论改离线蒸馏目标(pairwise RankNet)还是把教师分布匹配搬到 on-policy(GKD),都复现不了基于奖励的 on-policy 蒸馏效果;优势在 MAIR-Full(126 任务、9356 查询)上同样保持,分布偏移场景下收益最明显。
「研究」频道最新
- 简单方法胜出:线性变换在单细胞批次校正上击败深度学习 — arjunrajlab · 2026-09-03
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03
- 推友激辩:CoT 提示是不是一种参数复用? — aryaman2020 · 2026-09-03
- LL(1) 语法约束解码实测:消除 Agent 语法错误,高层失误仍在 — Upstairs-Special-925 · 2026-09-03