论文发现 LLM 强化学习里常见 KL 估计器会给错梯度
burny_tech · x · 2026-07-26
- 这篇论文讨论的是 LLM 的 RL 训练里 KL 正则化怎么估、以及不同估计器会不会把梯度带偏。
- 作者指出,DeepSeek 系列里使用的 k3 estimator 虽然对 expected reverse KL 的数值是无偏的,但它的梯度并不是 KL 的正确梯度;更糟的是,这个梯度实际上更像是 expected forward KL 的无偏梯度估计。
- 他们进一步做了实证分析,发现:在 on-policy 场景下,带偏梯度的估计器配置会引发训练不稳定;而 无偏梯度配置 往往能带来更好的 域内 和 域外 表现。
- 论文还观察到,KL 正则化有助于稳定 异步训练,并总结了 RL 后训练中使用 KL 目标时的实用建议。
所属事件:新研究揭示大模型 RL 训练中 KL 估计器存在严重缺陷(4 条相关)→
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27