PIRL把RL后训练改成闭环验证并提升推理与代码表现

This_Ad9834 · reddit · 2026-07-28

PIRL / PIPO 想解决什么问题

这篇工作认为,很多 RL 后训练方法本质上还是“开环”的:采样一批数据、算出奖励或优势、更新一次策略,然后就进入下一批;但更新之后的策略到底有没有真的变好,并没有被显式回看和验证。

作者提出 Policy Improvement Reinforcement Learning(PIRL),以及可直接叠加到现有算法上的 PIPO。它保留原有算法作为第一阶段的局部更新,然后在下一轮通过历史锚点比较更新前后的真实表现,形成一个“策略改进反馈信号”。

文中声称,这个闭环层加到 PPO、GRPO、DAPO 和自蒸馏等方法上后,在数学推理、代码生成、工具调用和自蒸馏任务上都能带来更稳定的训练和更好的准确率,并且在相近或略增训练时间下有更高的最终效果。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →