DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展
le_james94 · x · 2026-09-16
lejames94 的九讲系列第 9 讲指出,DeepSeekMath-V2 不再把验证当作约束,而是把它做成产品:先训练一个验证器,再随生成器进步持续扩展验证算力,让验证始终领先一步。他也提醒:这条路在数学之外是否成立,无人知晓。结合前几讲的论据:METR 测得 o3 的 50% 时间视界约 110 分钟人类工作量、约每 7 个月翻倍,而 DeepScholar-Bench 上写相关工作章节没有系统能超过 31% 几何平均分;AlphaCode 每题采样 100 万个程序、AlphaCode 2 用约 100 个样本达到同等性能,样本效率提升超 1 万倍——生成器变强的同时,「挑选输出」的东西变强得多。他还质疑「可验证奖励的 RL 教会模型新能力」的说法:DeepSeekMath 的测量显示 RL 提升 Maj@K 而不提升 Pass@K,模型变得更一致而非更聪明;信号源呈阶梯:环境回答(ReAct)、测试套件(RLEF)、成文文档(Constitutional AI),循环不变但信号越来越便宜也越来越模糊;过程奖励模型训练曾需 80 万人标注,Math-Shepherd 用 rollout 替代人工(一步好不好取决于能否由此到达正确答案),把 GSM8K 从 77.9% 提到 84.1%。
所属事件:验证器成为核心:从DeepSeekMath到能力评测分歧(2 条相关)→
「模型」频道最新
- 中国开源模型占 OpenRouter 53% tokens?研究者称数据误导 — ohlennart · 2026-09-16
- 模型研发怪圈:小众场景终会被通用能力吞并 — samiramanabi · 2026-09-16
- 爆料称 Google 正打造数学特化版 DeepThink,原始思维链颇为有趣 — PMinervini · 2026-09-16
- 玩家称在《辐射3》中发现 OpenAI GPT-6 Astra 彩蛋 — imjustnewatai · 2026-09-16
- 观点:模型提速 5 倍无感,20-50 倍才会改变工作方式 — gabriel1 · 2026-09-16
- 博主预测重磅一周:Opus 5.2、Codex Bot 与降价版 Sol 将齐发 — daniel_mac8 · 2026-09-16