研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局

Allen AI 等机构研究人员(Noukhovitch、Ivison、Lambert、Courville 等)发布 arXiv 论文指出,LLM 强化学习训练存在「马太效应」:平均评测分数掩盖了提升分布极不均衡的事实,模型已擅长的简单题收益巨大,而难题几乎得不到改善。团队据此提出自适应采样方法「Never Give Up」(NGU),将算力重新分配给难题,以攻克 RL 训练的偏科问题。

2026-09-16 ~ 2026-09-16 · 4 条相关