RLVR能否教会新能力引发讨论
针对「可验证奖励的 RL 能教会模型新能力」的说法,有推文引用 DeepSeekMath 自测数据提出最强质疑:RL 提升 Maj@K 但不提升 Pass@K。相关讨论还将反馈信号概括为一个「越便宜越模糊的阶梯」:从环境回答、测试套件回答到成文文档回答,对应 ReAct、RLEF 到 Constitutional AI 的演进。
2026-09-16 ~ 2026-09-16 · 2 条相关
- 从 ReAct 到 Constitutional AI:反馈信号越便宜越模糊的阶梯 — le_james94 · 2026-09-16
- RLVR 不教新能力?DeepSeekMath 数据:RL 提升 Maj@K 不提升 Pass@K — le_james94 · 2026-09-16