新论文指出 LLM 训练里 KL 梯度估计的两类常见错误

kastnerkyle · x · 2026-07-26

这篇论文指出了 RL 训练里 KL divergence 梯度估计 的几个实现坑。

主要有两类问题:

作者用表格实验和 LLM 实验展示了这些错误实现的影响,并给出正确做法。帖子还指出,这些坑可能会影响一些开源 RLHF 工程栈,比如 TRL、Open Instruct,以及 GRPO 等方法的伪代码实现。

所属事件:新研究揭示大模型 RL 训练中 KL 估计器存在严重缺陷(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →