DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展

le_james94 · x · 2026-09-16

lejames94 的九讲系列第 9 讲指出,DeepSeekMath-V2 不再把验证当作约束,而是把它做成产品:先训练一个验证器,再随生成器进步持续扩展验证算力,让验证始终领先一步。他也提醒:这条路在数学之外是否成立,无人知晓。结合前几讲的论据:METR 测得 o3 的 50% 时间视界约 110 分钟人类工作量、约每 7 个月翻倍,而 DeepScholar-Bench 上写相关工作章节没有系统能超过 31% 几何平均分;AlphaCode 每题采样 100 万个程序、AlphaCode 2 用约 100 个样本达到同等性能,样本效率提升超 1 万倍——生成器变强的同时,「挑选输出」的东西变强得多。他还质疑「可验证奖励的 RL 教会模型新能力」的说法:DeepSeekMath 的测量显示 RL 提升 Maj@K 而不提升 Pass@K,模型变得更一致而非更聪明;信号源呈阶梯:环境回答(ReAct)、测试套件(RLEF)、成文文档(Constitutional AI),循环不变但信号越来越便宜也越来越模糊;过程奖励模型训练曾需 80 万人标注,Math-Shepherd 用 rollout 替代人工(一步好不好取决于能否由此到达正确答案),把 GSM8K 从 77.9% 提到 84.1%。

所属事件:验证器成为核心:从DeepSeekMath到能力评测分歧(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →