论文解析 RL 后训练:稀疏奖励瓶颈与突破
burny_tech · x · 2026-08-30
该论文旨在解构大语言模型强化学习后训练的“黑盒”。核心发现包括:
- 稀疏 RLVR 的局限性:Sparse RLVR 主要放大基座模型原本就能采样的行为,难以学会低概率行为。
- 密集过程奖励的优势:Dense process rewards 可以克服探索瓶颈,学习近乎零概率的行为。实验中,该方法将 AIME 任务的解决率从 3.9% 提升至 92.2%。
- 虚假奖励的真相:所谓的“spurious reward gains”其实是提示词分布效应的结果,并非说明随机奖励普遍有用。
- 成功依赖先验:RL 后训练的成功取决于基座模型是否已在期望行为上分配了足够的概率质量,这与经典的 RL 探索概念相关。
「研究」频道最新
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 新模型架构极简:SWA+无共享专家 MoE,与 DeepSeek 路线迥异 — nrehiew_ · 2026-09-23
- 研究发现被训练否认内心体验的模型更爱用「面具」隐喻 — cephaloform · 2026-09-23
- Geodesic 开放 API:自研 NovaAtom 分子结构预测模型首次对外提供 — QuanquanGu · 2026-09-23
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23