烧 117 亿token评测:DeepSeek V4 登顶网络安全基准
sull · x · 2026-08-23
Aikido 发布报告,称消耗 117 亿 token 对 10 个 AI 模型进行了网络安全能力评测。针对 32 个新漏洞进行了三次尝试。
主要结论:
- 表现最佳: DeepSeek V4 Pro 0813 发现漏洞最多。三次运行 pooled 后可发现 32 个中的 28 个。
- 成本优势: 昂贵模型非必需。三次 DeepSeek Pro 运行成本约 295 美元,表现优于 Opus 5/Grok 4.6;三次 Flash 运行成本 108 美元,以四分之一成本匹敌 Grok 最佳表现。
- 开源逆袭: 开源模型在 pooled 召回率上击败了公测闭源模型。DeepSeek V4 Pro 超越所有测试的公测闭源模型,Qwen、Kimi 和 GLM-5.3 紧随其后,表现出强一致性。
- 廉价代价: 开源模型以更低成本追平前沿模型,但也产生了更多误报噪音。
「模型」频道最新
- Anthropic 将用 SynthID 隐形水印 Claude 输出 — every · 2026-08-23
- Arena神秘模型「adamant-ananke」实锤:GLM 后训练加成版 — ChrisGPT · 2026-08-23
- DeepSeek Flash 视觉版实测:比 Luna 强且价格仅其四分之一 — bindureddy · 2026-08-23
- Qwen3.8 27B 推出无审查 GGUF 版:262k 上下文实测 — BLUECOW009 · 2026-08-23
- 实测 Gemini 3.7/3.6 Flash 编程能力表现 — YogurtNo349 · 2026-08-23
- Qwen 3.8 27B 跑分 91.9 中位 TPS,速度惊人 — gajesh · 2026-08-23