DeepsecBench 漏洞挖掘评测:GPT-6 Sol 以 46% 居首
ArtificialAnlys · x · 2026-09-28
Artificial Analysis 发布由 Vercell 打造的 DeepsecBench-AA,专注隔离测试智能体的漏洞发现能力:给定代码库和预算,agent 需找出所有漏洞,按专家验证的金标准以 F2 打分(更重召回率,漏报代价高于误报)。
- GPT-6 Sol (max) 以 46% 领先,其后为 GPT-6 Astra(37%)、DeepSeek V4.1 Flash(31%)、Grok 4.7(27%)、Claude Opus 5.5(27%)
- 性价比帕累托前沿:GPT-6 Sol($1.83/任务)、DeepSeek V4.1 Flash($0.31/任务)、MiMo-V2.6-Pro($0.09/任务)
「模型」频道最新
- 用户实测:GPT 最高推理档理论证明仍藏 bug — MvsCerezo · 2026-09-29
- 让 Opus 5.5 自己解释动画是怎么做的:它生成 2 分钟第一性原理讲解视频 — jnack · 2026-09-29
- Gemini 3.5 Pro 被砍:吐槽称正确做法是宣称「太危险不宜发布」 — signulll · 2026-09-29
- 实测:$200 Claude Code 订阅每月可白嫖约 9000 美元 Opus 用量 — RexDouglass · 2026-09-29
- Bindu Reddy 实测:「Sonnet 5.5」各档位都不行,不如 Sol 5.6 — bindureddy · 2026-09-29
- 同提示四模型横评:Claude Sonnet 明显胜过 OpenAI 两款模型 — sven_ai · 2026-09-29