两年前的 GPO 论文竟站 RL scaling 前沿,前沿配方已被公开
QuanquanGu · x · 2026-09-19
张一凡转发称,GPO 这篇两年前发表的论文如今仍处于 RL scaling 的前沿,并感叹「前沿 RL 配方已被揭示」,同时列出三篇相关工作:GPO、RPG、BPO。这些方法可视为当前推理模型强化学习训练思路的早期来源,作者展示的链条对理解 RL scaling 的演化颇有参考价值。
「研究」频道最新
- kalomaze 吐槽:工具调用解析器 bug 是比想象中更大的评测混杂因素 — kalomaze · 2026-09-19
- Prof. Tom Yeh 手绘交互图对比全量微调与 LoRA 的成本差异 — ProfTomYeh · 2026-09-19
- HF 每日论文前三齐聚:KV 缓存压至 890 字节、自动优化 Agent 框架 — ThomasAger · 2026-09-19
- 博主炮轰私有评测集:要么全开源要么一句话带过 — xeophon · 2026-09-19
- DINO+Blender 合成数据实现停车场空位自动检测 — Roger_M_Taylor · 2026-09-19
- Claude Fable 5.1 登顶 ARC-AGI-2:90% 得分、单任务成本 $4.49 — geoffwolfe · 2026-09-19