SAP 用 off-policy GRPO 蒸馏出 1B 小型重排器,分布偏移下反超传统 KD

_reachsumit · x · 2026-09-03

SAP 团队提出一个两阶段框架,把强化学习引入重排器(reranker)蒸馏,训练出紧凑的指令遵循型重排模型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →