Distilled RL 把教师监督融进 LLM 后训练,超过传统 RL 和蒸馏
ZGCA · hf · 2026-07-21
Distilled RL 是一种新的 LLM 后训练方法,试图把强化学习和教师模型指导结合起来。
- 论文指出,传统 RL 只看粗粒度结果反馈,信用分配困难;而 on-policy distillation 要么给不出多少新知识,要么在教师模型差异太大时失效。
- Distilled RL 把教师监督直接并入 RL 目标,而不是简单匹配 teacher logits,因此能更有选择地传递新知识。
- 方法包含三个组件:带裁剪的反向重要性采样、负样本重置、以及序列级几何归一化。
- 在同家族和跨家族蒸馏设置下,作者报告它在 pass@1 和 pass@k 上都显著优于标准 RL 和 OPD。
「研究」频道最新
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- AI 视频仍穿帮的五个信号:小物件物理、无摄影师与跨镜头光线断裂 — NewPhoneWhotiz · 2026-09-11
- AnyMatch 入选 ECCV 2026,主打无 presenter 设计 — ducha_aiki · 2026-09-11