Anthropic 称 GLM-5.3 护栏 64%-100% 可被绕过,遭开源圈反驳
robleclerc · x · 2026-09-30
Anthropic 发布报告称,智谱最新模型 GLM-5.3 具备与 Claude Mythos Preview 相当的自主构建端到端网络攻击利用的能力,但缺乏有效安全护栏:在模拟测试中,攻击者用简单技术绕过 GLM-5.3 护栏的成功率为 64% 到 100%,而受护栏保护的 Claude 模型未被攻破。NIST 此前也评定 GLM-5.3 为「迄今网络能力最强的开源权重模型」。Rob LeCleerc 转发并批评 Anthropic 以「安全」之名攻击开源权重模型,称「恐惧是威权者的武器」,引发开源安全与模型护栏强度的争议。
所属事件:Anthropic 报告:GLM-5.3 网络攻击能力逼近 Claude,护栏形同虚设(15 条相关)→
「模型」频道最新
- Claude Sonnet 5.5 即将上线 LMArena,可直接实测 — arena · 2026-09-30
- ARC Prize 将评测 DeepSeek V4.1 Flash,前作曾得 ARC-AGI-2 61.4% — teortaxesTex · 2026-09-30
- gpt-6.1-sol 跑简单校验任务 35 分钟未停,用户担忧额度耗尽 — arthurcolle · 2026-09-30
- ChatGPT Pro $200 档 6-Pro 网页聊天砍到每周 100 次 — triestdain · 2026-09-30
- GPT-6.1 Sol 实测:105 个植入 bug 修 44 个,成本仅为上代 1/15 — PawelHuryn · 2026-09-30
- 开源模型逼近 Mythos Preview,GLM 5.3 发布仅隔 5 个月 — mariofilhoml · 2026-09-30