RIDE:在表示空间外推 RL 方向,让蒸馏学生模型逼近或超越 RL 教师模型
Hao Li · hf · 2026-10-01
- 问题:On-policy 蒸馏(OPD)的广义变体希望在输出空间外推隐式奖励让学生超越教师,但 LM head 会各向异性地衰减隐状态变化,且输出空间 log-prob 比值含噪声,训练不稳定。
- 观察:RL 会使模型内部表示相对 base checkpoint 产生偏移,且该偏移方向可在每一层测量。
- 方法 RIDE:直接在表示空间外推 RL 诱导的变化——每层每 token 位置计算教师与其 pre-RL checkpoint 之间的残差,将学生隐状态回归到沿残差方向越过教师的目标点。数学上等价于在教师为中心的二次惩罚下最大化由残差定义的线性方向奖励。
- 结果:在跨规模、架构和预训练谱系的四组 base/RL-teacher 配对上,RIDE 是唯一平均意义上接近或超过 RL 教师的方法,且稳定优于输出空间外推(后者在教师接近 base 时反而劣化学生)。
「研究」频道最新
- Nature Genetics 论文发布 ArchMap:免代码单细胞数据比对参考图谱平台 — burny_tech · 2026-10-01
- arXiv 新论文:用世界文学方法构建有文化素养的 AI — begusgasper · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- KV-streams 方法让 SWE Agent 训练提速 2 倍且不掉点 — burny_tech · 2026-10-01
- 用「自我」替代「人格」?模型心理学术语之争引热议 — repligate · 2026-10-01
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01