RL 训练 LLM 遇上马太效应:新论文用「永不放弃」策略攻最难题

natolambert · x · 2026-09-16

Michael Noukhovitch 发布新论文(经 natolambert 推荐),揭示 LLM 强化学习后训练中的马太效应:平均 eval 分数掩盖了关键事实——提升几乎全部来自「本来就快会做」的简单题,而初始 pass@32=0 的最难题在训练后依然几乎不会做。

核心发现与做法:

所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →