DeepSeek-V4-Pro 代码能力跻身开源第二
arena · x · 2026-08-13
据 Chatbot Arena 的早期 AutoEval 自动评测,DeepSeek-V4-Pro (Max) 在 WebDev 代码竞技场中总排名约第 8,在开源模型中位列第 2。
其得分为 1607 分,仅次于 GPT-5.6 Sol (xHigh)(1622 分)和 Kimi K3 (Max)(1674 分)。该分数目前基于奖励模型自动投票得出,后续将随真实人类投票增加而更新。
所属事件:DeepSeek-V4-Pro 评测成绩出炉,代码能力居开源第二(3 条相关)→
「模型」频道最新
- 新基准DiG-bench发布:前沿模型在简单发现任务上仍会卡壳 — AccBalanced · 2026-08-13
- 用户抱怨 Claude Opus 护栏过严:根本没法用 — AIFlow_ML · 2026-08-13
- 疑似豆包 V4-Pro 泄露评测现倒退,官方未证实 — teortaxesTex · 2026-08-13
- 实测 Muse Glimmer 30B:编程与写作不及老牌竞品,视觉处理或成亮点 — Kahvana · 2026-08-13
- Grok 4.6 成本仅为 Claude Opus 5 的 1/5,效率碾压引热议 — SucceededMind · 2026-08-13
- Grok 4.6 实测:无需设定目标即可长时间自主运行 — XFreeze · 2026-08-13