AISI称开源模型缩小网络安全差距

多条帖子转述英国 AISI(AI 安全研究所)最新公开分析,核心信息是:在长时程、实战型网络安全靶场任务上,开放权重模型与闭源前沿模型的能力差距已缩小到约 4–7 个月,较 2025 年大部分时间常见的 6–10 个月估计进一步收窄。之所以受关注,在于这类结果指向的是更接近真实攻防流程的长链路能力,而不只是短基准分数。

关键结果

多条帖文提到,AISI 使用了 32 步的 “The Last Ones” cyber range。按 @danielmac8 的转述,GLM-5.2 的表现已追平约 7 个月前发布的 Claude Opus 4.5。@Outside-Iron-8242 则称,AISI 最新结果显示 GPT-5.6 Sol 在其 cyber challenge 上超过了 Mythos 5。帖子中还反复点名 GLM-5.2 与 DeepSeek V4-Pro,说明二者是这轮更新里被重点关注的开放模型,不过现有材料未给出 DeepSeek V4-Pro 的精确名次或分数。

补充观点与局限

除 AISI 转述外,@AravSrinivas 还基于内部评测表示,Kimi K3 在网络安全任务上已属顶级水平;针对外界“benchmark overfit”的质疑,他认为其能力并非只体现在刷榜上。同一帖还称 Sol 在 cyber 能力上更进一步,但成本明显更高。需要注意的是,本簇帖子没有提供 AISI 的完整榜单、原始分数或更细的实验设定,因此更具体的排序和差距判断,仍需以 AISI 原始发布为准。

2026-07-17 ~ 2026-07-19 · 6 条相关