Predictive Divergence Masks 让 LLM RL 更新更贴近 trust region
Xiangxin Zhou · hf · 2026-07-24
Predictive Divergence Masks for LLM RL:用“预测下一步 divergence”改进 LLM 强化学习掩码
这篇论文讨论的是 LLM 强化学习里常见的 trust-region mask。作者指出,现有 PPO 风格方法虽然已经用某种 divergence 去约束“离行为策略太远”的问题,但方向判断仍然依赖采样 token 的 importance ratio;这个单样本代理信号,可能和真实 divergence 的变化方向不一致。
论文提出 predictive divergence mask:不再看“当前采样比率是否背离 1”,而是直接预测下一步梯度更新会让同一个 divergence 增大还是减小。主要内容包括:
- 针对离散 softmax policy 推出闭式推导
- 考虑生产 rollout 引擎通常只暴露 top-K 截断视图,因此设计了两个轻量级 top-K 估计器
- 分析表明,这个基于 divergence 的方向信号与真实变化更一致
- 在不同模型规模和精度设置下,训练效果都有提升
整体上,它是在 RLHF/LLM RL 的稳定训练细节上做方法改进。
「编程与Agent」频道最新
- Webcmd 认为浏览器智能体把 token 浪费在导航而不是任务本身 — heyshrutimishra · 2026-07-24
- AREX 提出内外双循环的递归自改进研究智能体 — _reachsumit · 2026-07-24
- 一个本地开源 Agent Skill 能标出多余的 diff 改动 — Saboo_Shubham_ · 2026-07-24
- 别给 Agent 暴露上千工具,改用代码沙箱 — edgestone22 · 2026-07-24
- “让 Claude 看代码库,基本等于开源” — _Stocko_ · 2026-07-24
- Roboto Agents 新增根因分析,直连机器人日志与源码 — Scobleizer · 2026-07-24