论文发现 LLM 强化学习里常见 KL 估计器会给错梯度
burny_tech · x · 2026-07-26
- 这篇论文讨论的是 LLM 的 RL 训练里 KL 正则化怎么估、以及不同估计器会不会把梯度带偏。
- 作者指出,DeepSeek 系列里使用的 k3 estimator 虽然对 expected reverse KL 的数值是无偏的,但它的梯度并不是 KL 的正确梯度;更糟的是,这个梯度实际上更像是 expected forward KL 的无偏梯度估计。
- 他们进一步做了实证分析,发现:在 on-policy 场景下,带偏梯度的估计器配置会引发训练不稳定;而 无偏梯度配置 往往能带来更好的 域内 和 域外 表现。
- 论文还观察到,KL 正则化有助于稳定 异步训练,并总结了 RL 后训练中使用 KL 目标时的实用建议。
所属事件:新研究揭示大模型 RL 训练中 KL 估计器存在严重缺陷(4 条相关)→
「研究」频道最新
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11