解决策略蒸馏熵崩塌:SAF 框架提升大模型数学推理
Yifan Ding · hf · 2026-08-03
本文提出了 Stable Advantage Fusion (SAF) 框架,旨在解决强化学习与策略蒸馏(OPD)结合训练时的技术痛点。研究发现,使用固定系数融合 RLVR(带验证奖励的强化学习)和 OPD 的优势会因幅度和时间的不匹配导致熵崩塌。
SAF 框架通过一种轻量级的四阶段流水线(仅应用于 OPD 优势)来应对该问题:利用“稀疏后压缩”机制控制幅度,配合“预热后退火”机制控制时间。在基于 Qwen3-1.7B/4B/8B 模型的7项数学推理和代码生成基准测试中,该方法有效避免了熵崩塌,综合得分提升了 0.51% 至 2.70%,且训练过程更加稳定。
「研究」频道最新
- SMPL-X 推出 UE5.8 C++ 插件,大幅提升 3D 人体渲染效率 — Michael_J_Black · 2026-08-03
- lossfunk 新研究:扩散模型内部能自发表征视觉错觉 — paraschopra · 2026-08-03
- 应对 AI 生成论文泛滥,ICLR 被曝引入新评审机制 — gabriberton · 2026-08-03
- 腾讯混元推 E-Bench:真实场景多步工具调用,最强大模型成功率不足 74% — 腾讯混元 · 2026-08-03
- SIAM 介绍「子博弈完美」算法设计:兼顾理论与实践 — prof_grimmer · 2026-08-03
- AI 幻觉炮制高危漏洞,SQLite 遭遇虚假 CVE 误报 — jedisct1 · 2026-08-03