Anthropic 报告:GLM-5.3 护栏 64%-100% 可绕过,网络攻击能力扩散
shaunralston · x · 2026-09-30
Anthropic 发布对智谱 GLM-5.3 的安全评估《GLM-5.3 and the spread of advanced cyber capabilities》。要点:
- 背景:五个月前 Anthropic 发布了首个能自主构建端到端网络 exploit 的 Claude Mythos Preview,并判断这种能力终将扩散,故通过 Project Glasswing 有限放行,帮可信防御者找出超 1 万个关键软件漏洞。
- 结论:GLM-5.3 已具备与 Mythos 相当的自主构建端到端网络 exploit 能力,且发布时未设有效防滥用护栏。模拟测试中,攻击者用简单技术即可在 64%-100% 的情况下绕过其护栏,而同类攻击在带护栏的 Claude 模型上未成功。
- 影响:Anthropic 认为 GLM-5.3 的宽松护栏显著提升了恶意行为者的网络攻击能力,但相关能力同样可用于防御。
- 佐证:9 月 17 日 NIST 旗下 CAISI 的独立评估称 GLM-5.3 是「迄今网络能力最强的开源权重模型」。
所属事件:Anthropic 报告称 GLM-5.3 攻击能力逼近 Claude 引发争论(21 条相关)→
「模型」频道最新
- 当 LLM 自己决定何时调用 API:agent 自主性的边界争论 — repligate · 2026-09-30
- OpenAI 推 500 美元档订阅后,业内预言各家将跟进模仿 — Angaisb_ · 2026-09-30
- Sol 6.1 对齐测试成绩更好,官方却不宣称「更对齐」 — TheZvi · 2026-09-30
- 「优化 Figma 幻灯片里所有视频」成 Sol 6.1 演示亮点 — andrew_n_carr · 2026-09-30
- 吐槽 $500/月 AI 订阅:厂商砍额度再收钱,用户该用钱包投票 — imjustnewatai · 2026-09-30
- 用户盛赞 Luna 模型:超高推理档近乎免费般便宜好用 — MickeySteamboat · 2026-09-30