研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局
Allen AI 等机构研究人员(Noukhovitch、Ivison、Lambert、Courville 等)发布 arXiv 论文指出,LLM 强化学习训练存在「马太效应」:平均评测分数掩盖了提升分布极不均衡的事实,模型已擅长的简单题收益巨大,而难题几乎得不到改善。团队据此提出自适应采样方法「Never Give Up」(NGU),将算力重新分配给难题,以攻克 RL 训练的偏科问题。
2026-09-16 ~ 2026-09-16 · 4 条相关
- 研究揭示 RL 的马太效应:涨分多在简单题,NGU 自适应采样破局 — vwxyzjn · 2026-09-16
- RL 训练 LLM 遇上马太效应:新论文用「永不放弃」策略攻最难题 — natolambert · 2026-09-16
- AI2 提出 NGU 采样法:把 RL 算力重新分配给 LLM 难题 — allenai · 2026-09-16
- RL 增益集中在简单题,Never Give Up 采样法攻克难题 — teortaxesTex · 2026-09-16