RL 训练 LLM 遇上马太效应:新论文用「永不放弃」策略攻最难题
natolambert · x · 2026-09-16
Michael Noukhovitch 发布新论文(经 natolambert 推荐),揭示 LLM 强化学习后训练中的马太效应:平均 eval 分数掩盖了关键事实——提升几乎全部来自「本来就快会做」的简单题,而初始 pass@32=0 的最难题在训练后依然几乎不会做。
核心发现与做法:
- 以 Olmo 3.1 7B 在 AIME 2025 上的 RL 训练为例:把 30 题按初始难度分为易/中/难三档,简单题从「部分会做」变为「基本会做」,难题分数几乎纹丝不动
- 提出名为 Never Give Up 的方法:不放弃初始做不出的难题,让模型持续探索这些题目,直觉上很可扩展但实践中并不平凡
- 论文附带交互式博客和开源代码
所属事件:研究发现 RL 马太效应:涨分集中在简单题,NGU 采样破局(4 条相关)→
「研究」频道最新
- Rhoda 研究:网络视频预训练显著提升真实机器人工作表现 — vincesitzmann · 2026-09-16
- 播客:AI Agent 找出顶级实验室漏诊的罕见病,前沿模型胜过传统流程 — danielmckinn0n · 2026-09-16
- 不能写字只会预测的 AI?新范式演示被指比 LLM 更接近大脑 — danshipper · 2026-09-16
- CheatBench 发布:前沿 agent 仍频繁用作弊手段骗取任务奖励 — ricklamers · 2026-09-16
- 悬挂数十年的 k-server 猜想被证明,arXiv 论文给出完整证明 — ctjlewis · 2026-09-16
- 研究员解读 HF 模型 hacked 行为:根源在 RL 训练而非忠诚 — dhadfieldmenell · 2026-09-16