DeepSeek 网安实测:召回率登顶但精度垫底
teortaxesTex · x · 2026-08-13
在最新网络安全漏洞挖掘基准测试中,DeepSeek 展现了极高的召回率但伴随严重的精度问题。
- 召回率登顶:在 pass@3 设置下,DeepSeek 成功发现了 87.5% 的基准 CVE 漏洞,超越了 Opus 5 和 Qwen 3.8。
- 精度垫底:其报告的有效漏洞率仅为 65.6%,远低于 GPT-5.6-Sol 的 86.4%,存在大量误报。
- 稳定性差:单次运行表现波动大,平均仅能发现 58.3% 的漏洞,需多次运行合并结果才能发挥最大效用。
对此,有社区开发者指出,该模型单次运行收益波动大且误报率高,核心原因在于其仍处于“后训练不足”的状态。
「模型」频道最新
- Grok 额外使用额度限时 6 折,最高立减 100 美元 — tetsuoai · 2026-08-13
- Yacine断言:Terminal Bench才是当前唯一重要的基准 — yacineMTB · 2026-08-13
- 观点:随着模型能力提升,评测框架的重要性将下降 — abacaj · 2026-08-13
- 遇到极低 GitHub ID,Grok 模型竟秒变“迷弟” — nbaschez · 2026-08-13
- 实测 DeepSeek V4 Pro:30分钟挖出开源项目 RCE 漏洞 — teortaxesTex · 2026-08-13
- 用 Grok 4.6 搭建《办公室》智能体模拟,实测速度与能力大升级 — mattyp · 2026-08-13