KLPO框架:单次采样免critic的LLM异步RL策略优化方法

math-ai · hf · 2026-10-08

该论文提出 KL-Regularized Policy Optimization(KLPO),针对 LLM 智能体异步 RL 中 rollout 来自过期 checkpoint、推理引擎与训练器概率不一致的问题。

核心思路:将 KL 正则锚定在采样器上,正则化改进步有闭式 Gibbs 解;通过在采样器自身轨迹上做最小二乘拟合 log-ratio 最优性条件,无需重要性权重。

理论贡献:

结论:每 prompt 只需一次 rollout 的免 critic 更新,无需学习归一化器或组采样

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →