DeepSecBench 榜单:GPT-6 Sol 登顶,成本仅为亚军 Astra 的 20%
cramforce · x · 2026-09-26
Vercel 的 DeepSecBench(基于 deepsec cyber harness,测试模型在应用代码中找安全漏洞的能力,综合 recall 与 precision)更新,GPT-6 Sol(xhigh)以 40.91 分登顶 Pareto 前沿:recall 35.8%、precision 96%,总成本 $12.76,而亚军 GPT-6 Astra(xhigh)37.79 分却花了 $63.70——登顶模型价格约为其 20%。
Claude Opus 5(max)以 32.44 分排第四,但成本高达 $127.93,且 precision 88% 明显偏低;GPT-5.6 Sol 35.44 分排第三。榜单显示 OpenAI 系模型在代码漏洞挖掘上同时占据性能与成本优势。
「模型」频道最新
- Reddit 用户发现 Opus 5.5 几乎不再输出破折号 — Outside-Iron-8242 · 2026-09-26
- Jev 开源 4B 小模型 Lev,基于 Qwen 主打同尺寸最佳性能 — ycombinator · 2026-09-26
- 有人不服:Opus 5.5的文笔其实没那么好 — hugobowne · 2026-09-26
- 阿里官宣 RSI 进展:Qwen3.8-Max 全自动训练 33 轮,AA 分数 40 升至 45 — teortaxesTex · 2026-09-26
- 开发者实测 Opus 5.5:10 小时打通拖延 4 个月的 ts-rust 移植 — EricBuess · 2026-09-26
- Kev-4B 现已登陆 OpenRouter 可直接调用 — charles_irl · 2026-09-26