浙大和腾讯的 STEER 直指 RL 训练中的熵塌缩

jiqizhixin · x · 2026-07-24

浙大和腾讯提出 STEER,解决 RL 训练中的熵塌缩问题

来自 浙江大学 和 腾讯 的研究者提出了 STEER,目标是处理大模型推理训练里的一个常见故障:entropy collapse(熵塌缩)。

与其用经验规则“硬调”熵值,STEER 的思路是先估计熵变化,再对 token 进行自适应重加权。作者认为,这种做法比传统启发式干预更直接地对准了 RL for LLMs 的关键缺陷。

帖子称,该方法在以下基准上优于当前最强 baseline:

论文题目为 Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective,代码也已公开。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →