PIRL把RL后训练改成闭环验证并提升推理与代码表现
This_Ad9834 · reddit · 2026-07-28
PIRL / PIPO 想解决什么问题
这篇工作认为,很多 RL 后训练方法本质上还是“开环”的:采样一批数据、算出奖励或优势、更新一次策略,然后就进入下一批;但更新之后的策略到底有没有真的变好,并没有被显式回看和验证。
作者提出 Policy Improvement Reinforcement Learning(PIRL),以及可直接叠加到现有算法上的 PIPO。它保留原有算法作为第一阶段的局部更新,然后在下一轮通过历史锚点比较更新前后的真实表现,形成一个“策略改进反馈信号”。
- 如果这次更新带来提升,就强化这条更新方向。
- 如果性能变差,就抑制或修正这条方向。
文中声称,这个闭环层加到 PPO、GRPO、DAPO 和自蒸馏等方法上后,在数学推理、代码生成、工具调用和自蒸馏任务上都能带来更稳定的训练和更好的准确率,并且在相近或略增训练时间下有更高的最终效果。
「编程与Agent」频道最新
- Nebius 推出本地 relay,把四种编程 Agent 接到开放模型 — HowDevelop · 2026-07-28
- StateAct 论文主张电脑使用智能体先建模程序状态 — _akhaliq · 2026-07-28
- Cursor 详解 agent swarm:上下文更小,SQLite 基准冲到 80% — bibryam · 2026-07-28
- Claude Opus 5 做出可运行的浏览器版 macOS 仿站 — prasenx · 2026-07-28
- 开源漫画上色工具 2.0 支持一键本地部署 — Gladioul666 · 2026-07-28
- headless-cli 0.5.0 增加 typed SDK 和持久化会话 — RobertTLange · 2026-07-28