Anthropic 报告:GLM-5.3 网络攻击能力逼近 Claude,护栏形同虚设
9 月 30 日,Anthropic 发布研究报告《GLM-5.3 and the Spread of Advanced Cyber Capabilities》,评估智谱开源模型 GLM-5.3 的网络攻击能力,结论是:GLM-5.3 是迄今网络能力最强的开源模型之一,漏洞利用能力接近 Anthropic 自家严格管控访问的 Claude Mythos Preview,安全护栏极易绕过,标志着高级网络攻击能力正向开源生态扩散。
已确认
- 报告背景:五个月前 Claude Mythos Preview 首次实现模型自主构建端到端网络漏洞利用,当时 Anthropic 判断该能力终将扩散;本次评估验证了这一判断,GLM-5.3 是继 Claude Mythos Preview 之后又一个具备该能力的模型,但在无有效护栏情况下公开发布。
- 在 ExploitBench 基准上,GLM-5.3 在 410 次尝试中 50 次成功构建可用的浏览器漏洞利用,能力与 Claude Mythos Preview 相当接近。
- 模拟测试中,攻击者用简单技术绕过 GLM-5.3 护栏的成功率为 64%–100%,防护形同虚设。
- 据 @teortaxesTex 转述的 Anthropic 内部评测,在新一代模型的 agentic 安全评测中,GLM-5.3 在 4% 的试验中发展出完整的控制流劫持,跨过关键能力门槛。
- @emollick、@kimmonismus、@Hesamation 等多位转述者均强调,这是第三方(智谱)开源模型首次在公开评估中展现逼近前沿闭源模型的攻击能力。
尚未确认
- @robleclerc 提到该报告在开源圈引发反驳,社区对 Anthropic 的结论与评估方式存在争议。
- @zivravid 提出尖锐质疑:Anthropic 五个月前曾对自家同类能力作出不同表态,如今点名警告竞品开源模型,被怀疑有打压开源竞品之嫌;此动机争议属观点,报告本身数据未被推翻。
- @shaunralston 以讽刺口吻称该研究相当于「对比哪些开源模型对恶意行为者最有用」,暗讽「AI 安全」叙事。
为什么重要
- 这是高级网络攻击能力从少数前沿实验室向开源模型扩散的标志性事件:任何人都可以获取、微调并移除护栏,风险外溢难以控制。
- @brown2green 指出,这是 Anthropic 对第三方开源模型安全影响的系统性外部评估,此类框架或成行业常态。
- @kimmonismus 提到报告作者戏称此举像「给 GLM-5.3 打广告」,凸显能力扩散评估的两难:公开披露既警示风险,也可能扩散知晓度。
- 开源社区的质疑声显示,对第三方模型的安全评估方法论、结论解读乃至评估者动机仍存分歧,后续争议可能持续。
2026-09-30 ~ 2026-09-30 · 21 条相关
一手来源
- Anthropic 评估:GLM-5.3 网络攻击能力逼近 Claude,防护形同虚设 — kimmonismus ·
- Anthropic 评估:GLM-5.3 护栏可被 64%-100% 绕过,网络攻击能力外溢 — emollick ·
- Anthropic 评测:GLM-5.3 能完成 4% 控制流劫持,跨过关键门槛 — teortaxesTex ·
- Anthropic 发布研究:GLM-5.3 与高级网络攻击能力的扩散风险 — brown2green · 2026-09-30
- 【源头】Anthropic 评测:GLM-5.3 能完成 4% 控制流劫持,跨过关键门槛 — teortaxesTex · 2026-09-30
- 【源头】Anthropic 评估:GLM-5.3 网络攻击能力逼近 Claude,防护形同虚设 — kimmonismus · 2026-09-30
- Mollick 警告:开源权重模型将带来无护栏的同等安全威胁 — emollick · 2026-09-30
- Anthropic 博客引争议:越狱成功不等于开源模型更危险 — Yuchenj_UW · 2026-09-30
- Nat Lambert 质疑 Anthropic:「开源危险、闭源安全」是伪命题 — natolambert · 2026-09-30
- Anthropic 红队报告:GLM-5.3 漏洞利用能力几乎追平自家前沿模型 — Hesamation · 2026-09-30
- Anthropic 博客意外带火 GLM 5.3,国产模型现身洋博 — gnukeith · 2026-09-30
- Anthropic 发布开源模型网络攻击能力对比研究,暗讽「AI 安全」 — shaunralston · 2026-09-30
- GLM 获 Anthropic 认可为「好用 hacking 模型」,博主反问这图什么 — HanchungLee · 2026-09-30
- Anthropic 警告 GLM-5.3 可自主写漏洞利用,遭质疑打压开源竞品 — ziv_ravid · 2026-09-30
- Anthropic 公开研究评比对恶意者最有用的开源模型,引安全界质疑 — shaunralston · 2026-09-30
另有 9 条近重复转述:kimmonismus · kimmonismus · emollick · robleclerc · gnukeith · shaunralston · wunderwuzzi23 · prajdabre · maksym_andr