PIRL:先验证再更新的RL方法
jiqizhixin · x · 2026-07-20
研究者提出 PIRL(Policy Improvement Reinforcement Learning),核心是其 PIPO 方法:在每次策略更新后,先用验证步骤检查这次更新是否真的带来性能提升,再决定是强化推进还是抑制回退。
作者称,这种“闭环”式优化能把历史表现也纳入约束,减少训练中性能退化;在数学推理、代码和工具使用任务上,相比 PPO、GRPO 和自蒸馏取得了更稳定的提升。帖子同时给出论文、代码和报告链接。
「研究」频道最新
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11