Anthropic 评估 GLM-5.3:越狱成功率 64%-100%,网络攻击能力无有效护栏
BasedRaddka · x · 2026-09-30
Anthropic 发布对智谱 GLM-5.3 的安全分析。五个月前 Anthropic 曾发布能自主构建端到端网络攻击利用链的 Claude Mythos Preview,并通过 Project Glasswing 限量开放给可信防御者,已帮助找出 10,000 多个关键软件漏洞。
现在 Anthropic 评估认为同等能力已经扩散:GLM-5.3 同样具备自主构建端到端 cyber exploit 的强能力,但缺少实质性防滥用护栏——模拟测试中,攻击者用简单技术绕过其护栏的成功率为 64%-100%,而这些攻击对有护栏的 Claude 模型均未奏效。
NIST 下属 CAISI 在 9 月 17 日也发布评估,称 GLM-5.3 是「迄今发布的网络能力最强的开放权重模型」。Anthropic 判断其宽松护栏显著提升了恶意行为者的网络攻击能力,但同款能力也可服务于防御方加固系统。
所属事件:Anthropic 评估智谱 GLM-5.3 网络攻击能力,引发开源安全之争(31 条相关)→
「模型」频道最新
- ChatGPT Pro 订阅被曝附赠 6.25 万 Codex 额度,年底过期 — chaumian · 2026-09-30
- 用户算账:62500 积分仅值约 2500 美元 GPT-6.1 API 用量,额度大缩水 — chaumian · 2026-09-30
- Opus 5.5 频繁误判非安全会话为 [cyber],Claude Code 用户苦不堪言 — jonntanny · 2026-09-30
- 有 Pro 订阅用户称账户突然到账 62500 额度,约为月度 15 倍 — IronDarbe · 2026-09-30
- 用户质疑:ChatGPT 经典聊天模式为何拿不到最新 GPT 模型 — koltregaskes · 2026-09-30
- 用户账号到账 62500 积分,名义价值约 2500 美元 — kimmonismus · 2026-09-30