RLVR 不教新能力?DeepSeekMath 数据:RL 提升 Maj@K 不提升 Pass@K

le_james94 · x · 2026-09-16

该推文(上下文为验证器/DeepSeekMath-V2 讨论串)对「可验证奖励的 RL 能教会模型新能力」这一说法提出最强质疑:DeepSeekMath 自己跑过测量——RL 提升 Maj@K(多数投票正确率)但不提升 Pass@K(采样中存在正确答案的概率)。结论:模型变得更一致了,而不是本质上更聪明。

所属事件:RLVR能否教会新能力引发讨论(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →