研究揭示 RL 的马太效应:涨分多在简单题,NGU 自适应采样破局

vwxyzjn · x · 2026-09-16

Noukhovitch、Ivison、Lambert、Courville 等人的 arXiv 论文发现:RL 训练 LLM 的收益分布极不均衡——模型已擅长的简单题提升巨大,难题提升微小。作者称之为 RL for LLM 的「马太效应」。

他们指出 naive 解释是难题需要更多算力找解,但现代 RL 方法其实把大量算力浪费在简单题上;应动态重分配采样算力。

提出 Never Give Up(NGU):一种自适应采样方法,对一个问题持续生成样本直到出现正确解。结合异步 RL,简单题自然被快速过滤,难题获得更多算力。论文还给出 off-policy 鲁棒性等设计选择的最佳实践。在 Deepscaler 数学基准上 NGU 提升了单位算力性能(尤其难题);在编码基准 Manufactoria 上,标准 GRPO 配 per-test reward 无法完全解决难易混合的测试,NGU 则逐步攻克更难的测试直至完全解题。

所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →