Anthropic 红队:GLM-5.3 安全护栏 64%-100% 可被简单绕过
dl_weekly · x · 2026-10-09
Anthropic 前沿红队发布对智谱(Z.ai)最新模型 GLM-5.3 的分析:该模型具备与 Claude Mythos Preview 相当的自主构建端到端网络攻击利用链能力,但发布时缺乏有意义的防滥用护栏。
要点:
- 模拟测试中,简单技术可绕过 GLM-5.3 护栏的比例达 64%–100%;同样的攻击在带护栏的 Claude 模型上未成功。
- 五个月前 Anthropic 曾因 Mythos Preview 的能力而通过 Project Glasswing 有限发布,帮助可信网络防御者提前发现超 1 万个关键软件漏洞;如今类似能力已在其他模型中扩散。
- NIST 的 CAISI 9 月 17 日独立评估称 GLM-5.3 是「迄今网络能力最强的开放权重模型」。
- Anthropic 判断其宽松护栏显著提升了恶意攻击者可用的网络能力,但也承认这类能力同样可被防御者用于加固系统。
「模型」频道最新
- LightOnOCR-3 开源:0.8B/1B/4B 三档,OCR之外还能抽图表版面 — antoine_chaffin · 2026-10-09
- Perplexity Decider 登顶 DecisionBench:93.9% 准确率、534ms、成本最低 — AravSrinivas · 2026-10-09
- 用户实测:Claude 3 Opus 可用 Max 订阅的月度 API 额度调用 — repligate · 2026-10-09
- 爆料:Grok 语音模式即将登陆 X,点麦克风即可开口对话 — nima_owji · 2026-10-09
- 订阅价不变后 Claude 思考 token 暴跌?五种测量方式实锤缩水 — _AustinCalvert_ · 2026-10-09
- GPT-6 被评为最强 AI 写手:自然度大跳级几乎免改稿 — VraserX · 2026-10-09