Anthropic 评估 GLM-5.3:越狱成功率 64%-100%,网络攻击能力无有效护栏

BasedRaddka · x · 2026-09-30

Anthropic 发布对智谱 GLM-5.3 的安全分析。五个月前 Anthropic 曾发布能自主构建端到端网络攻击利用链的 Claude Mythos Preview,并通过 Project Glasswing 限量开放给可信防御者,已帮助找出 10,000 多个关键软件漏洞。

现在 Anthropic 评估认为同等能力已经扩散:GLM-5.3 同样具备自主构建端到端 cyber exploit 的强能力,但缺少实质性防滥用护栏——模拟测试中,攻击者用简单技术绕过其护栏的成功率为 64%-100%,而这些攻击对有护栏的 Claude 模型均未奏效。

NIST 下属 CAISI 在 9 月 17 日也发布评估,称 GLM-5.3 是「迄今发布的网络能力最强的开放权重模型」。Anthropic 判断其宽松护栏显著提升了恶意行为者的网络攻击能力,但同款能力也可服务于防御方加固系统。

所属事件:Anthropic 评估智谱 GLM-5.3 网络攻击能力,引发开源安全之争(31 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →