RL 增益集中在简单题,Never Give Up 采样法攻克难题

teortaxesTex · x · 2026-09-16

Nat Lambert 等人发现 LLM 的强化学习收益主要集中在简单问题上,团队称之为「RL 的马太效应」,并在论文与博客中给出数据支撑。针对这一问题,他们提出一个朴素的扩展思路:当 GRPO 采样组内全部补全是错误答案、梯度为零时,以约 0.9 的概率继续追加采样,寻找能产生非零梯度的批次。这个被命名为「Never Give Up」的方法配合异步 RL,让模型把更多算力分配到更难的题目上,实测有效。

所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →