DeepSeek V4-Pro 评测升至开源第二,被指仅靠 pass@2 刷分
teortaxesTex · x · 2026-08-13
DeepSeek 的 V4 Pro 0813 版本在 Vals 指数上大涨 11 分,成为目前排名第二的开源模型,且单次任务成本仅 $0.14,比排名高于它的 Kimi K3 便宜 17 倍。
然而,有技术观察者指出该成绩存在水分:
- 机制质疑:认为 V4-Pro 本质上只是 V4-Flash-0731 加上了 pass@2(多次生成取最优)机制。
- 蒸馏猜想:推测 DeepSeek 的内部蒸馏策略抹平了不同规模模型的差异,导致较小的 Flash 模型表现反而更突出。
「模型」频道最新
- DeepSeek 网安实测:召回率登顶但精度垫底 — teortaxesTex · 2026-08-13
- 用 Grok 4.6 搭建《办公室》智能体模拟,实测速度与能力大升级 — mattyp · 2026-08-13
- Sakana AI 更新 Chat:新增 Fugu 模型并支持代码执行 — SakanaAILabs · 2026-08-13
- 开发者实测 Gemini V4-Pro:表现不及预期,疑似受蒸馏影响 — teortaxesTex · 2026-08-13
- 本地部署 DeepSeek V4 Flash:双 DGX Spark 体验极佳 — andrewchen · 2026-08-13
- DeepSeek v4-pro 评测:极低成本比肩 Opus,日常体验差异微乎其微 — haider1 · 2026-08-13