PIRL:先验证再更新的RL方法
jiqizhixin · x · 2026-07-20
研究者提出 PIRL(Policy Improvement Reinforcement Learning),核心是其 PIPO 方法:在每次策略更新后,先用验证步骤检查这次更新是否真的带来性能提升,再决定是强化推进还是抑制回退。
作者称,这种“闭环”式优化能把历史表现也纳入约束,减少训练中性能退化;在数学推理、代码和工具使用任务上,相比 PPO、GRPO 和自蒸馏取得了更稳定的提升。帖子同时给出论文、代码和报告链接。
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22