DeepSeek Flash v4网安实测:找回24个CVE,性价比仍逊于Luna
teortaxesTex · x · 2026-08-01
在最新的网络安全漏洞挖掘基准测试中,DeepSeek Flash v4 展现了强大的实力。测试结果显示,该模型在 32 个 CVE(通用漏洞披露)中成功找回了 24 个,pass@3 召回率达到了 75%。
然而,从成本效益的角度来看,DeepSeek 此次测试的花费为 150.22 美元。相比之下,Luna 模型在重新定价后的成本仅为 75.36 美元。尽管 DeepSeek 在能力上仅落后于 GPT-5.6-Sol 和 Kimi 1 个 CVE,但在帕累托最优前沿(能力与成本的综合平衡)上,Luna 依然凭借更低的价格和稳定性保持领先。
「模型」频道最新
- Fable 游戏 AI 安全过滤器频繁误杀,被指严重影响体验 — dreamwieber · 2026-08-01
- DeepSeek-V4-Flash 推理受阻:vLLM 暂不支持新 confidence_head — teortaxesTex · 2026-08-01
- KOL称若无开源模型,闭源AI月费恐高达2000美元 — iamaliveix · 2026-08-01
- 会计任务大考:58%难题无模型能解,Claude居首 — EdwardSun0909 · 2026-08-01
- 实测 GPT-5.6 Luna:知识工作表现比肩 Sol,成本大幅降低 — BenBajarin · 2026-08-01
- OpenAI 宣布大降价:GPT-5.6 Terra 与 Luna 限时半价 — LeTanLoc98 · 2026-08-01