Predictive Divergence Masks 让 LLM RL 更新更贴近 trust region

Xiangxin Zhou · hf · 2026-07-24

Predictive Divergence Masks for LLM RL:用“预测下一步 divergence”改进 LLM 强化学习掩码

这篇论文讨论的是 LLM 强化学习里常见的 trust-region mask。作者指出,现有 PPO 风格方法虽然已经用某种 divergence 去约束“离行为策略太远”的问题,但方向判断仍然依赖采样 token 的 importance ratio;这个单样本代理信号,可能和真实 divergence 的变化方向不一致。

论文提出 predictive divergence mask:不再看“当前采样比率是否背离 1”,而是直接预测下一步梯度更新会让同一个 divergence 增大还是减小。主要内容包括:

整体上,它是在 RLHF/LLM RL 的稳定训练细节上做方法改进。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →