DeepSeek V4 评测:强于 CVE 查找,弱于幻觉控制
teortaxesTex · x · 2026-08-26
对 DeepSeek V4 模型的能力进行了多维度的详细评估:
- 强项:在 CVE 查找/重构方面达到前沿水平;在 ProgramBench-Vetted、ARC-2 以及可能的数学(LiveBench)上属于开源前沿;在 CritPt 上正在追赶。
- 弱项:在各类 SWE 和 Agent 评估中表现一般;在幻觉、奖励黑客和设计品味方面表现糟糕。
作者最后提出疑问:这看起来像什么?(暗示其对模型本质的某种看法)。
「模型」频道最新
- 测试显示 Flash-Vision-Exp 擅长内核研发但逻辑混杂 — teortaxesTex · 2026-08-26
- Grok 独对「贫富差距」陷阱,ChatGPT 等均误判 — davidpattersonx · 2026-08-26
- Ox Alpha 确认为智谱 GLM-5.3-Flash:百万上下文 — MrWidmoreHK · 2026-08-26
- 实测 Claude Opus 5:autocompact 压到 200k 才不「上下文腐烂」 — bclavie · 2026-08-26
- 用户抱怨新 GPT 模型幻觉多且执行慢,考虑换回 GLM — SweatyActuator2119 · 2026-08-26
- 反馈称网页版 ChatGPT Pro 降智问题已修复 — mazzaTalk · 2026-08-26