Anthropic 称 GLM-5.3 护栏 64%-100% 可被绕过,遭开源圈反驳

robleclerc · x · 2026-09-30

Anthropic 发布报告称,智谱最新模型 GLM-5.3 具备与 Claude Mythos Preview 相当的自主构建端到端网络攻击利用的能力,但缺乏有效安全护栏:在模拟测试中,攻击者用简单技术绕过 GLM-5.3 护栏的成功率为 64% 到 100%,而受护栏保护的 Claude 模型未被攻破。NIST 此前也评定 GLM-5.3 为「迄今网络能力最强的开源权重模型」。Rob LeCleerc 转发并批评 Anthropic 以「安全」之名攻击开源权重模型,称「恐惧是威权者的武器」,引发开源安全与模型护栏强度的争议。

所属事件:Anthropic 报告:GLM-5.3 网络攻击能力逼近 Claude,护栏形同虚设(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →