Qwen3.8-Max 网络安全实测:找漏洞比肩 Opus 5,但一致性较差

teortaxesTex · x · 2026-08-05

一家安全机构在找 CVE 漏洞的基准测试中实测了 Qwen3.8-Max。结果显示,在三次运行中,Qwen 找到了 32 个 CVE 中的 26 个(81.25% pass@3 召回率),与 Opus 5 并列第一,且成本仅为后者的二分之一。

然而,Qwen 的一致性明显不足:三次测试中都找到的漏洞仅有 10 个,而 Opus 5 有 19 个。评论指出,该模型基础能力很强,但后训练显然只做了一半,导致输出极不稳定。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →