KLPO框架:单次采样免critic的LLM异步RL策略优化方法
math-ai · hf · 2026-10-08
该论文提出 KL-Regularized Policy Optimization(KLPO),针对 LLM 智能体异步 RL 中 rollout 来自过期 checkpoint、推理引擎与训练器概率不一致的问题。
核心思路:将 KL 正则锚定在采样器上,正则化改进步有闭式 Gibbs 解;通过在采样器自身轨迹上做最小二乘拟合 log-ratio 最优性条件,无需重要性权重。
理论贡献:
- 剔除回归截距后,用采样器均值加采样器到训练器的 KL 散度替代难解的 log-partition 函数
- token 级策略镜像下降目标可在随机工具输出下无 critic 地由终端回报算梯度
- 证明 KL 项的独立蒙特卡洛估计保持梯度无偏,并推导 top-K 与二值近似的精确 KL gap
- SPPO、GPO、REBEL、BPO 均为 KLPO 特例
结论:每 prompt 只需一次 rollout 的免 critic 更新,无需学习归一化器或组采样
「研究」频道最新
- 以太坊研究员 Justin Drake 呼吁行业转入「地堡模式」应对数学进步风险 — marcvanderchijs · 2026-10-08
- Lean 证明疑与论文不一一对应,GPT 形式化被指对难证引理抄近路 — ctjlewis · 2026-10-08
- Alignment Whack-a-Mole 获 COLM 2026 oral,作者预告对谈节目 — TuhinChakr · 2026-10-08
- OpenAI 疑似证明虚二次域模性猜想,CM 数域椭圆曲线或将全部模性 — soumitrashukla9 · 2026-10-08
- OpenAI 一天发 722 篇数学论文,过半引用自家工作且现引用环 — aran_nayebi · 2026-10-08
- 数学家发现 AI 洞见藏在既有思想的凸包里,其余科学也将在更大规模迎来这一课 — soumitrashukla9 · 2026-10-08