RLVR 论文:稀疏奖励挖不出模型采不到的行为,密集奖励才能破顶
iScienceLuvr · x · 2026-08-27
一篇探索语言模型 RL 后训练(RLVR)的论文在简化设置下给出三条关键结论:
- Result 1:稀疏 RL 找不到模型从未采样到的行为——奖励信号再对,采不到就学不到。
- Result 2:密集奖励能打破这个天花板。
- Result 3:所谓「虚假奖励」(spurious rewards)本质上与 prompt 集合有关,是 prompt 分布的故事。
作者的核心框架:后训练最好理解为在预训练分布内部重新分配概率质量。由此建议的度量方式是——训练全程追踪模型给目标行为分配的概率,以及输出分布的熵。
已开源项目页与代码。
「研究」频道最新
- 新预印本探讨AI相关学术研究 — bgoncalves · 2026-08-27
- PULSE 模型:利用常规临床数据重建分子图谱 — bravo_abad · 2026-08-27
- 自变量WALL-SS模型突破瓶颈,机器人虚拟训练可迁移至真机 — APPSO · 2026-08-27
- 仅 400 美元,开源双足机器人 Microduck 支持强化学习 — Thom_Wolf · 2026-08-27
- AI 癌症疫苗Ⅲ期临床成功,或定价 47.5 万美元 — 量子位 · 2026-08-27
- 零样本通用Agent导航:拆掉脚手架,成绩反超专训模型 — 机器之心 · 2026-08-27