SCOUT 框架修复 on-policy 蒸馏中教师的 off-policy 失配
AWS · hf · 2026-10-01
AWS 团队论文指出 on-policy 蒸馏(OPD)存在根本性不对称:学生自己采样的轨迹对教师而言是 off-policy 的——教师习惯于从自身策略的前缀续写,却要在蒸馏中监督学生生成的前缀,实测表明前缀越长教师续写质量下降越明显。
为此提出 SCOUT(Student-COnditioned Updates of the Teacher)共训练框架:在常规 OPD 更新之外,周期性地用可验证奖励的强化学习优化教师的条件续写能力——教师从学生前缀生成续写并根据结果奖励学习。
控制实验验证了学生条件化教师适配的机制,且在多组师生配置、模型规模和推理任务上,SCOUT 均稳定提升 OPD 的蒸馏效果。
「研究」频道最新
- 1108 人 1000 万细胞免疫多组学图谱登 Nature,揭秘疾病变异调控机制 — anshulkundaje · 2026-10-01
- 同一 Nature 免疫多组学图谱论文的转发重复帖 — anshulkundaje · 2026-10-01
- Incident Arena:让编程 Agent 值夜班处理线上事故的新基准 — amankhan · 2026-10-01
- RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务破防至 14-31% — burny_tech · 2026-10-01
- 1000×1000 动力系统数据集发布:覆盖 133 种过程从混沌到大脑气候 — burny_tech · 2026-10-01
- GRASP 实验室四旋翼编队论文获 IROS 2026 最佳学生论文 — NikolaiMatni · 2026-10-01