DeepsecBench 安全漏洞挖掘榜:GPT-6 Astra 37.79 分居首
JohnPhamous · x · 2026-09-11
Vercel 上线的 DeepsecBench 基于 deepsec cyber harness 衡量各 AI 模型在应用代码中挖掘安全漏洞的能力,综合召回率与精确度打分,同时展示 token 用量、成本与耗时趋势。榜单要点:
- GPT-6 Astra(xhigh)以 37.79 分居首:召回 32.8%、精确 97.9%、误报仅 2,成本 $63.70、耗时 49m47s;
- GPT-5.6 Sol(xhigh)35.44 分列第二;Claude Opus 5(max)32.44 分第三,但成本高达 $127.93、token 消耗 445 万居前列,精确度 88.0%、误报 10;
- GLM-5.3(high)21.91 分进入前十;同模型不同推理档位分数差距明显(如 Opus 5 max 与 medium 相差约 4 分);
- harness 涵盖 Codex、Claude Code、Pi 等。
另附作者的小技巧:在该站点按住 opt/alt 可开启 debug 模式,用 Voronoi 映射扩大点击热区。
「编程与Agent」频道最新
- Lenny 峰会热传幻灯片:AI slop 从没经历过真正的设计评审 — floguo · 2026-09-11
- 从 smolagents 源码拆解:为何一个 Agent 实例只应服务一次运行 — Mahmoud_Zalt · 2026-09-11
- 光靠 Prompt 恐吓不行,大厂用约束解码锁死 JSON 输出 — dotey · 2026-09-11
- supermemory 砍掉公司/个人脑产品,全力押注 Agent 记忆 API — julianweisser · 2026-09-11
- 妻子 AI 退款 agent 对上对方 AI,秒级邮件乒乓大战 — robleclerc · 2026-09-11
- visual-explainer:把终端输出变成精美 HTML 页面的 Agent Skill — tom_doerr · 2026-09-11