新研究揭示大模型 RL 训练中 KL 估计器存在严重缺陷

近期多篇预印本论文指出,大模型强化学习(RLVR)训练中常用的反向 KL 散度估计器存在严重缺陷,可能导致梯度方向错误。研究实证发现,DeepSeek 系列使用的 K3 估计器在作为 loss 直接反传时会给出错误梯度,而 K1 估计器甚至会出现梯度趋近于零的问题。作者呼吁社区关注这些实现陷阱,并指出仅有一种估计器在特定条件下是无偏的。

2026-07-25 ~ 2026-07-26 · 4 条相关