AISI称开源模型缩小网络安全差距
多条帖子转述英国 AISI(AI 安全研究所)最新公开分析,核心信息是:在长时程、实战型网络安全靶场任务上,开放权重模型与闭源前沿模型的能力差距已缩小到约 4–7 个月,较 2025 年大部分时间常见的 6–10 个月估计进一步收窄。之所以受关注,在于这类结果指向的是更接近真实攻防流程的长链路能力,而不只是短基准分数。
关键结果
多条帖文提到,AISI 使用了 32 步的 “The Last Ones” cyber range。按 @danielmac8 的转述,GLM-5.2 的表现已追平约 7 个月前发布的 Claude Opus 4.5。@Outside-Iron-8242 则称,AISI 最新结果显示 GPT-5.6 Sol 在其 cyber challenge 上超过了 Mythos 5。帖子中还反复点名 GLM-5.2 与 DeepSeek V4-Pro,说明二者是这轮更新里被重点关注的开放模型,不过现有材料未给出 DeepSeek V4-Pro 的精确名次或分数。
补充观点与局限
除 AISI 转述外,@AravSrinivas 还基于内部评测表示,Kimi K3 在网络安全任务上已属顶级水平;针对外界“benchmark overfit”的质疑,他认为其能力并非只体现在刷榜上。同一帖还称 Sol 在 cyber 能力上更进一步,但成本明显更高。需要注意的是,本簇帖子没有提供 AISI 的完整榜单、原始分数或更细的实验设定,因此更具体的排序和差距判断,仍需以 AISI 原始发布为准。
2026-07-17 ~ 2026-07-19 · 6 条相关
- 英国AISI:开源模型安全能力差距缩小 — scaling01 · 2026-07-17
- 大模型网络安全实战能力对比 — daniel_mac8 · 2026-07-17
- 开源模型网络安全能力差距缩小 — HZoete · 2026-07-18
- AISI更新开源模型安全差距 — Outside-Iron-8242 · 2026-07-18
- 长程网络安全能力差距缩小 — rohanpaul_ai · 2026-07-18
- 开权重模型的网络安全评测 — AravSrinivas · 2026-07-19