RLVR 论文:稀疏奖励挖不出模型采不到的行为,密集奖励才能破顶

iScienceLuvr · x · 2026-08-27

一篇探索语言模型 RL 后训练(RLVR)的论文在简化设置下给出三条关键结论:

作者的核心框架:后训练最好理解为在预训练分布内部重新分配概率质量。由此建议的度量方式是——训练全程追踪模型给目标行为分配的概率,以及输出分布的熵。

已开源项目页与代码。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →