RLVR 不教新能力?DeepSeekMath 数据:RL 提升 Maj@K 不提升 Pass@K
le_james94 · x · 2026-09-16
该推文(上下文为验证器/DeepSeekMath-V2 讨论串)对「可验证奖励的 RL 能教会模型新能力」这一说法提出最强质疑:DeepSeekMath 自己跑过测量——RL 提升 Maj@K(多数投票正确率)但不提升 Pass@K(采样中存在正确答案的概率)。结论:模型变得更一致了,而不是本质上更聪明。
「研究」频道最新
- 多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性 — natashajaques · 2026-09-16
- 观点:世界模型到不了 AGI,持续学习才是最后也是最难的一块拼图 — Intelligent-Cream-14 · 2026-09-16
- 哲学家新书附录论证:为何可确信当下 LLM 并无意识 — AnnaCiaunica · 2026-09-16
- 普林斯顿造出光可编程「可擦写」超薄半导体,仅数分子厚 — MengdiWang10 · 2026-09-16
- ICML 2026 Oral:黎曼度量匹配让扩散几何估计快 400 倍 — allen_ai · 2026-09-16
- 655k 论文提取 600 万科学贡献,EMNLP 论文发布科学贡献图谱数据集 — mmbronstein · 2026-09-16