Qwen3.8-Max 网络安全实测:找漏洞比肩 Opus 5,但一致性较差
teortaxesTex · x · 2026-08-05
一家安全机构在找 CVE 漏洞的基准测试中实测了 Qwen3.8-Max。结果显示,在三次运行中,Qwen 找到了 32 个 CVE 中的 26 个(81.25% pass@3 召回率),与 Opus 5 并列第一,且成本仅为后者的二分之一。
然而,Qwen 的一致性明显不足:三次测试中都找到的漏洞仅有 10 个,而 Opus 5 有 19 个。评论指出,该模型基础能力很强,但后训练显然只做了一半,导致输出极不稳定。
「模型」频道最新
- 曝 Ilya 创办的 SSI 首个模型计划于 2026 年 8 月发布 — TheOyinbooke · 2026-08-05
- Pokee-Isaac 28B 发布:单卡跑 10M 上下文,输入仅 $0.15/M — Kyrannio · 2026-08-05
- 传 SSI 研发在线学习,GPT-6 或于本月亮相 — flowersslop · 2026-08-05
- Hugging Face 上线优化版 MiniMax H3 演示空间 — mrfakename0 · 2026-08-05
- 同一道地理题问 8 次,AI 每次都得出相反结论 — Voxtante · 2026-08-05
- MiniMax H3 模型接入 Codex 与 Claude Code 教程 — breath_mirror · 2026-08-05