DiffGate:只对失败轨迹施加教师指导,让 GRPO 蒸馏 pass@8 最多提升 5.7 点
Snapchat · hf · 2026-10-07
Hugging Face 上的论文提出 DiffGate,一种难度门控的 on-policy 蒸馏目标函数,结合 GRPO 与选择性教师指导。
核心思路
- On-policy 蒸馏(OPD)提供稠密的局部监督但与 rollout 正确性弱对齐;RLVR/GRPO 提供结果级监督但奖励稀疏、credit 分配粗糙。
- DiffGate 只对失败的轨迹施加教师指导,按组难度缩放并平滑限界,避免极端师生差异主导优化;verifier 决定哪些轨迹获得教师指导,教师在其内部提供稠密的 token 级更新方向。
实验结果
- Qwen3-0.6B / 1.7B 学生模型上,代码 avg@8 较 GRPO 提升 +1.7 / +1.8 点,pass@8 提升 +1.6 / +5.7 点。
- 数学任务 avg@8 与 GRPO 持平(差距 <0.5 点),pass@8 提升 +1.1 / +3.9 点。
- 在全部四个模型×领域设置中均改善 pass@8,说明解法覆盖率提升。
「研究」频道最新
- 把已知指数磨掉小常数算突破吗?算法界的实用主义之争 — srchvrs · 2026-10-07
- DOE 联手 Google、Isomorphic 等投 18 亿美元做药物 RL — Afinetheorem · 2026-10-07
- 用标准工具调用即可套出 GPT-6 等模型隐藏思维链 — jiqizhixin · 2026-10-07
- 新预印本:信息密集合成把分子发现实验数从 O(d) 降到 O(log d) — anshulkundaje · 2026-10-07
- UCLA 首次系统研究混合注意力 LLM 的多语言能力,发现层序可改 — UCLA · 2026-10-07
- NYU 提出 RGPO:自适应理由脚手架缓解 RL 奖励稀疏 — newyorkuniversity · 2026-10-07