DeepSeek V4 Pro 后续基准回测
xeophon · x · 2026-07-19
这条转发整理了对 **DeepSeek V4 Pro** 的回测结论:作者收集了发布后新出现的 32 个 benchmark,重点比较它和 **GPT-5.4 / Claude Opus 4.6 / 其他前沿模型** 在后续基准上的表现。 核心结论是:早期发布时宣传的领先优势在后续 benchmark 上并不稳固。图里展示的对比中,DeepSeek V4 Pro 在多数项目上落后于竞品,尤其在 agentic coding 相关基准上差距更明显;作者据此质疑“中文开源模型第一”的叙事是否还能延续到 Kimi K3。
「模型」频道最新
- 一条暗示帖把 GLM 5.5 的发布时间推近了 — mark_k · 2026-07-21
- Nemotron 3 Ultra 预测榜表现突出 — kuchaev · 2026-07-21
- Kimi K3 登上 Agent Arena 第4 — arena · 2026-07-21
- Qwen 3.8 口碑分化 — davidtsong · 2026-07-21
- SuperGrok Heavy重回99美元/月 — Daniel_Farinax · 2026-07-21
- 一天实测Kimi K3:上限高但代价大 — Tarandjpop · 2026-07-21