两年前的 GPO 论文竟站 RL scaling 前沿,前沿配方已被公开

QuanquanGu · x · 2026-09-19

张一凡转发称,GPO 这篇两年前发表的论文如今仍处于 RL scaling 的前沿,并感叹「前沿 RL 配方已被揭示」,同时列出三篇相关工作:GPO、RPG、BPO。这些方法可视为当前推理模型强化学习训练思路的早期来源,作者展示的链条对理解 RL scaling 的演化颇有参考价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →