浙大和腾讯的 STEER 直指 RL 训练中的熵塌缩
jiqizhixin · x · 2026-07-24
浙大和腾讯提出 STEER,解决 RL 训练中的熵塌缩问题
来自 浙江大学 和 腾讯 的研究者提出了 STEER,目标是处理大模型推理训练里的一个常见故障:entropy collapse(熵塌缩)。
与其用经验规则“硬调”熵值,STEER 的思路是先估计熵变化,再对 token 进行自适应重加权。作者认为,这种做法比传统启发式干预更直接地对准了 RL for LLMs 的关键缺陷。
帖子称,该方法在以下基准上优于当前最强 baseline:
- 6 个数学推理基准
- 3 个代码基准
论文题目为 Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective,代码也已公开。
「研究」频道最新
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27