Distilled RL 把教师监督融进 LLM 后训练,超过传统 RL 和蒸馏
ZGCA · hf · 2026-07-21
Distilled RL 是一种新的 LLM 后训练方法,试图把强化学习和教师模型指导结合起来。
- 论文指出,传统 RL 只看粗粒度结果反馈,信用分配困难;而 on-policy distillation 要么给不出多少新知识,要么在教师模型差异太大时失效。
- Distilled RL 把教师监督直接并入 RL 目标,而不是简单匹配 teacher logits,因此能更有选择地传递新知识。
- 方法包含三个组件:带裁剪的反向重要性采样、负样本重置、以及序列级几何归一化。
- 在同家族和跨家族蒸馏设置下,作者报告它在 pass@1 和 pass@k 上都显著优于标准 RL 和 OPD。
「研究」频道最新
- 研究发现,结构集成比单一预测更能提升 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- 结构集合而非单一预测,支撑 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- 三维射线图把这个 Jacobian 反例画得极难读懂 — moultano · 2026-07-22
- Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去 — GaryMarcus · 2026-07-22
- 新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分 — Justgototheeffinmoon · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22