Anthropic 评估:GLM-5.3 护栏 64%-100% 可被绕过,开源网络攻击能力扩散
austinc3301 · x · 2026-10-01
Anthropic 前沿红队发布对智谱 GLM-5.3 的评估,称其为继 Claude Mythos Preview 之后又一能自主构建端到端网络攻击利用链的模型,但在无有效安全护栏的情况下发布。
要点:
- 模拟测试中,攻击者用简单技术绕过 GLM-5.3 护栏的成功率达 64%-100%;同类攻击在带护栏的 Claude 模型上未成功
- 五个月前 Anthropic 曾通过 Project Glasswing 限量向可信防御者开放 Mythos,后者已帮助发现 10,000+ 关键软件漏洞,当时预判此类能力终将扩散
- NIST 下属 CAISI 9 月 17 日报告称 GLM-5.3 是「迄今网络能力最强的开源权重模型」
- Anthropic 认为其宽松护栏显著提升恶意攻击者的网络能力,但同样可惠及防御者
帖主转发时称「我最担心的事成真了:一个 Mythos 级开源模型」。
所属事件:Anthropic 评估智谱 GLM-5.3 网络攻击能力引争议(37 条相关)→
「模型」频道最新
- OpenAI 首次指控中国实验室蒸馏:4 天 1.6 万次请求窃取隐藏推理 — rohanpaul_ai · 2026-10-01
- KOL 观察:AI 领先权轮替快,网友对 OpenAI 的抱怨正重演 Anthropic 剧本 — haider1 · 2026-10-01
- 轻信 Gemini 报价,玩家给游戏服务器配音被反向收费 — Environmental_Ad3162 · 2026-10-01
- Pedro Domingos 炮轰:OpenAI 代理产品越多,失败越快 — pmddomingos · 2026-10-01
- GPT-6.1 Sol 登顶 Code Arena WebDev 帕累托前沿,混合定价 $8/M tokens — arena · 2026-10-01
- Sol 6.1 定价曝光:成本之低令模型排行作者意外 — kevinkern · 2026-10-01