大模型网络安全实战能力对比

daniel_mac8 · x · 2026-07-17

推文引用了 AISI(AI 安全研究所)的网络安全靶场测试 "The Last Ones" 结果。数据显示,GLM-5.2 的表现追平了约 7 个月前发布的 Claude Opus 4.5;而 DeepSeek V4-Pro 的成绩则落后于同期的 Claude Sonnet 4.5。作者认为,评估模型在赛博空间中的实际破坏力,这类安全测试是最客观的基准。

所属事件:AISI称开源模型缩小网络安全差距(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →