解决策略蒸馏熵崩塌:SAF 框架提升大模型数学推理

Yifan Ding · hf · 2026-08-03

本文提出了 Stable Advantage Fusion (SAF) 框架,旨在解决强化学习与策略蒸馏(OPD)结合训练时的技术痛点。研究发现,使用固定系数融合 RLVR(带验证奖励的强化学习)和 OPD 的优势会因幅度和时间的不匹配导致熵崩塌。

SAF 框架通过一种轻量级的四阶段流水线(仅应用于 OPD 优势)来应对该问题:利用“稀疏后压缩”机制控制幅度,配合“预热后退火”机制控制时间。在基于 Qwen3-1.7B/4B/8B 模型的7项数学推理和代码生成基准测试中,该方法有效避免了熵崩塌,综合得分提升了 0.51% 至 2.70%,且训练过程更加稳定。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →