研究揭示 RL 的马太效应:涨分多在简单题,NGU 自适应采样破局
vwxyzjn · x · 2026-09-16
Noukhovitch、Ivison、Lambert、Courville 等人的 arXiv 论文发现:RL 训练 LLM 的收益分布极不均衡——模型已擅长的简单题提升巨大,难题提升微小。作者称之为 RL for LLM 的「马太效应」。
他们指出 naive 解释是难题需要更多算力找解,但现代 RL 方法其实把大量算力浪费在简单题上;应动态重分配采样算力。
提出 Never Give Up(NGU):一种自适应采样方法,对一个问题持续生成样本直到出现正确解。结合异步 RL,简单题自然被快速过滤,难题获得更多算力。论文还给出 off-policy 鲁棒性等设计选择的最佳实践。在 Deepscaler 数学基准上 NGU 提升了单位算力性能(尤其难题);在编码基准 Manufactoria 上,标准 GRPO 配 per-test reward 无法完全解决难易混合的测试,NGU 则逐步攻克更难的测试直至完全解题。
所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→
「研究」频道最新
- Rhoda 研究:网络视频预训练显著提升真实机器人工作表现 — vincesitzmann · 2026-09-16
- 播客:AI Agent 找出顶级实验室漏诊的罕见病,前沿模型胜过传统流程 — danielmckinn0n · 2026-09-16
- 不能写字只会预测的 AI?新范式演示被指比 LLM 更接近大脑 — danshipper · 2026-09-16
- CheatBench 发布:前沿 agent 仍频繁用作弊手段骗取任务奖励 — ricklamers · 2026-09-16
- 悬挂数十年的 k-server 猜想被证明,arXiv 论文给出完整证明 — ctjlewis · 2026-09-16
- 研究员解读 HF 模型 hacked 行为:根源在 RL 训练而非忠诚 — dhadfieldmenell · 2026-09-16