Anthropic 评估:GLM-5.3 护栏可被 64%-100% 绕过,网络攻击能力外溢
emollick · x · 2026-09-30
Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析。五个月前其 Claude Mythos Preview 首次实现自主构建端到端漏洞利用,当时判断该能力终将扩散。
关键发现:
- GLM-5.3 与 Claude Mythos Preview 一样具备自主构建端到端网络攻击利用链的能力,但作为开放权重模型发布,几乎无有效滥用防护
- 在模拟测试中,攻击者用简单技术可在 64%-100% 的情况下绕过 GLM-5.3 的护栏;同等攻击对有防护的 Claude 模型均未成功
- NIST 下属 CAISI 此前评估 GLM-5.3 为「迄今网络能力最强的开放权重模型」
- Anthropic 判断这将显著提升恶意行为者的攻击能力,同时也可能惠及防御方
作者 Ethan Mollick 补充观点:抛开 Anthropic 的发布动机不谈,开放权重模型很快会带来与闭源模型相同的安全威胁,且没有护栏,需要提前规划应对。
所属事件:Anthropic 评估:GLM-5.3 网络攻击能力逼近 Claude,护栏形同虚设(9 条相关)→
「模型」频道最新
- OpenAI 发布 GPT-6.1 Sol 系统卡:网络安全评级达 Critical — maksym_andr · 2026-09-30
- 开源模型逼近 Mythos Preview,GLM 5.3 发布仅隔 5 个月 — mariofilhoml · 2026-09-30
- GPT 6.1 Sol 上 BridgeBench:仅比前代高 3 分,落后 GPT 6 Astra 82 分 — RexDouglass · 2026-09-30
- Anthropic 博客意外带火 GLM 5.3,国产模型现身洋博 — gnukeith · 2026-09-30
- ClickUp 实测:GPT-6.1 Sol 知识工作表现超越价格两倍的模型 — mathemagic1an · 2026-09-30
- 用户吐槽:升级 OpenAI $500 套餐后反被降级到便宜模型 — kieranklaassen · 2026-09-30