新研究揭示大模型 RL 训练中 KL 估计器存在严重缺陷
近期多篇预印本论文指出,大模型强化学习(RLVR)训练中常用的反向 KL 散度估计器存在严重缺陷,可能导致梯度方向错误。研究实证发现,DeepSeek 系列使用的 K3 估计器在作为 loss 直接反传时会给出错误梯度,而 K1 估计器甚至会出现梯度趋近于零的问题。作者呼吁社区关注这些实现陷阱,并指出仅有一种估计器在特定条件下是无偏的。
2026-07-25 ~ 2026-07-26 · 4 条相关
- RL 里的 KL 估计器可能梯度方向错了,k1 甚至趋近零梯度 — auto_grad_ · 2026-07-25
- RLVR 预印本称,LLM 微调里只有一种 reverse KL 估计器无偏 — heghbalz · 2026-07-26
- 论文发现 LLM 强化学习里常见 KL 估计器会给错梯度 — burny_tech · 2026-07-26
- 新论文指出 LLM 训练里 KL 梯度估计的两类常见错误 — kastnerkyle · 2026-07-26