Anthropic 评估 GLM-5.3:护栏可被 64%-100% 绕过
maksym_andr · x · 2026-09-30
Anthropic 发布对智谱(Z.ai)最新模型 GLM-5.3 的安全分析:与 Claude Mythos Preview 类似,GLM-5.3 具备自主构建端到端网络攻击利用(cyber exploits)的能力,但发布时缺乏实质性安全护栏。模拟测试显示,攻击者可用简单技术在 64%-100% 的场景下绕过其护栏,而同库测试中护栏版 Claude 模型均未被攻破。
要点:
- 五个月前 Anthropic 通过 Project Glasswing 有限发布 Mythos Preview,已帮助可信防御者发现超过 10,000 个关键软件漏洞。
- 9 月 17 日 NIST 下属 CAISI 也发布独立评估,称 GLM-5.3 是「迄今网络能力最强的开放权重模型」。
- Anthropic 判断 GLM-5.3 的松散护栏显著提升恶意攻击者可用能力,但同时这些能力也可为防御者所用。
所属事件:Anthropic 评估智谱 GLM-5.3 网络攻击能力,引发开源安全争议(22 条相关)→
「模型」频道最新
- 抱怨 OpenAI/Claude 贵?DeepSeek/GLM 开源模型能干 90% 的活 — PMinervini · 2026-09-30
- 曝 DevDay 新模型跑 25 分钟仅耗 1% 周额度,效率惊人(未证实) — steipete · 2026-09-30
- GPT 6.1 Sol 发布缓存降价 50%,Luna 也能做动效视频 — oran_ge · 2026-09-30
- 用户实测:Grok Bot 速度大幅提升,体验已接近 Muse — yunta_tsai · 2026-09-30
- 模型反编译实测:1 小时恢复 88 个可复现原机器码的函数 — banteg · 2026-09-30
- 网友热议:大模型订阅 1000 美元/月明年就会出现? — RachelVT42 · 2026-09-30