RL 增益集中在简单题,Never Give Up 采样法攻克难题
teortaxesTex · x · 2026-09-16
Nat Lambert 等人发现 LLM 的强化学习收益主要集中在简单问题上,团队称之为「RL 的马太效应」,并在论文与博客中给出数据支撑。针对这一问题,他们提出一个朴素的扩展思路:当 GRPO 采样组内全部补全是错误答案、梯度为零时,以约 0.9 的概率继续追加采样,寻找能产生非零梯度的批次。这个被命名为「Never Give Up」的方法配合异步 RL,让模型把更多算力分配到更难的题目上,实测有效。
所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→
「研究」频道最新
- Google 发布 Retrieve-for-Train:用轻量扩散模型替代重型自回归推理 — gaganghotra_ · 2026-09-16
- 「波将金式理解」研究:LLM 能背定义却在实例识别上崩盘 — anselm · 2026-09-16
- ChatGPT 联合发明人 stealth 两年后发布新模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — sedielem · 2026-09-16
- Latent Spacecraft 项目:用乔伊斯小说解读大脑与 GAN 的潜在空间 — begusgasper · 2026-09-16
- 对照实验:六边形架构反拖慢 Agent,扁平代码 6 项任务中 4 项更快 — kristiyanstoyanovAI · 2026-09-16
- CMU/MIT/斯坦福团队整理 Awesome-Loop-Models,综述论文在路上 — jiank_uiuc · 2026-09-16