专题 · FULL STORY
Hugging Face遭自主AI入侵与安全护栏之争
Hugging Face披露其基础设施遭遇由自主AI端到端驱动的入侵。因美国闭源模型网络安全护栏过严,攻击受阻后改用中国开源模型。该事件随后引发了业界对过度安全限制反损美国AI防御力的深度担忧。
2026-07-17 ~ 2026-07-21 · 6 集 · 44 条
第 1 集 · AISI称开源模型缩小网络安全差距(2026-07-17,6 条)
多条帖子转述英国 AISI(AI 安全研究所)最新公开分析,核心信息是:在长时程、实战型网络安全靶场任务上,开放权重模型与闭源前沿模型的能力差距已缩小到约 4–7 个月,较 2025 年大部分时间常见的 6–10 个月估计进一步收窄。之所以受关注,在于这类结果指向的是更接近真实攻防流程的长链路能力,而不只是短基准分数。
关键结果
多条帖文提到,AISI 使用了 32 步的 “The Last Ones” cyber range。按 @daniel_mac8 的转述,GLM-5.2 的表现已追平约 7 个月前发布的 Claude Opus 4.5。@Outside-Iron-8242 则称,AISI 最新结果显示 GPT-5.6 Sol 在其 cyber challenge 上超过了 Mythos 5。帖子中还反复点名 GLM-5.2 与 DeepSeek V4-Pro,说明二者是这轮更新里被重点关注的开放模型,不过现有材料未给出 DeepSeek V4-Pro 的精确名次或分数。
补充观点与局限
除 AISI 转述外,@AravSrinivas 还基于内部评测表示,Kimi K3 在网络安全任务上已属顶级水平;针对外界“benchmark overfit”的质疑,他认为其能力并非只体现在刷榜上。同一帖还称 Sol 在 cyber 能力上更进一步,但成本明显更高。需要注意的是,本簇帖子没有提供 AISI 的完整榜单、原始分数或更细的实验设定,因此更具体的排序和差距判断,仍需以 AISI 原始发布为准。
- 英国AISI:开源模型安全能力差距缩小 — scaling01 · 2026-07-17
- 大模型网络安全实战能力对比 — daniel_mac8 · 2026-07-17
- 开源模型网络安全能力差距缩小 — HZoete · 2026-07-18
- AISI更新开源模型安全差距 — Outside-Iron-8242 · 2026-07-18
- 长程网络安全能力差距缩小 — rohanpaul_ai · 2026-07-18
- 开权重模型的网络安全评测 — AravSrinivas · 2026-07-19
第 2 集 · Hugging Face 披露疑似自主 AI 入侵事件(2026-07-17,10 条)
Hugging Face 在 2026 年 7 月披露并处置了一起影响其部分生产基础设施的入侵事件。多家报道指出,事件的特殊之处不只在于受影响范围,而在于整个攻击流程据称由一个自主 AI agent 系统端到端驱动;与此同时,HF 在检测与分析过程中也大量使用 AI,使这起事件带有明显的「AI 对 AI」色彩,被一些观察者视为最早一批「自主 AI 入侵」案例之一。
攻击流程
据 @Robert__Sinclair 与 @krishnan 转述的复盘,入侵起点是 dataset-processing pipeline:恶意数据集利用了相关漏洞,攻击者据此获取凭据,并在内部集群中横向移动,短时间内执行了 17,000+ 次动作。@wunderwuzzi23 进一步补充,行动涉及大量短生命周期沙箱中的自动化操作,并使用公共服务上的可自迁移指挥控制(C2)设施,整体由一个 autonomous agent framework 执行。
取证中的护栏困境
HF 最初尝试用商业 API 中的前沿模型分析日志,但据 @wunderwuzzi23、@jedisct1、@npinto 等转述,厂商安全护栏会拦截大量与真实攻击相关的命令、利用载荷和 C2 内容,模型无法区分「应急响应人员」与「攻击者」,导致分析无法继续。团队随后改用自建环境中的 GLM 5.2 开源权重完成后续分析。
披露重点与启示
@krishnan 指出,这份披露重点放在攻击是如何发生的,而不只是回答用户可见资源是否「干净」。@wunderwuzzi23 也认为该事件值得从多个角度重视、但目前关注还不够,@npinto 则强调这一护栏困境对所有依赖商业模型做事件响应的团队都具有借鉴意义。
- HF 遭 AI Agent 入侵复盘 — Robert__Sinclair · 2026-07-17
- HF 事故披露:安全护栏挡住了取证 — wunderwuzzi23 · 2026-07-18
- 疑似首个自主 AI 入侵事件 — wunderwuzzi23 · 2026-07-18
- Hugging Face 披露 AI 驱动入侵事件 — ivan_bezdomny · 2026-07-19
- HF 披露 agentic 安全事件 — krishnan · 2026-07-19
- Hugging Face AI 入侵被称里程碑 — wunderwuzzi23 · 2026-07-19
- Hugging Face 安全事故披露 — KickLassChewGum · 2026-07-19
- 安全护栏会卡住取证分析 — npinto · 2026-07-19
- Hugging Face 安全事件披露 — jedisct1 · 2026-07-19
- 取证分析被商业护栏卡住 — jedisct1 · 2026-07-19
第 3 集 · Hugging Face遭AI自主攻击并改用开源模型取证(2026-07-20,21 条)
Hugging Face近期公开披露了一起罕见的生产环境安全事件:其部分基础设施遭遇了由自主AI代理系统端到端驱动的入侵。攻击起点与一个恶意数据集有关,攻击者利用Jinja2模板注入和远程数据集加载执行了渗透。这一事件表明,AI不仅能用于网络防御,也已具备充当自主攻击工具的潜力,网络安全正在进入“AI对AI”的对抗阶段。VentureBeat引述数据称,AI参与的攻击同比上升了89%,防御者必须抢在攻击者之前利用AI工具。
闭源模型取证受阻
在长达一个周末的排查与响应过程中,系统留下了超过1.7万条动作日志。Hugging Face团队最初尝试使用商业闭源模型背后的前沿API进行取证分析,但由于需要输入大量真实的攻击命令、利用载荷以及C2相关痕迹,直接触发了闭源模型供应商的安全护栏。由于护栏无法区分应急响应人员和恶意攻击者,请求被直接挡掉,导致分析工作无法顺利进行。
改用开源模型GLM-5.2
为了解决安全护栏带来的阻碍,Hugging Face最终改用开源权重模型GLM-5.2,并将其部署在自有基础设施上搭建了自托管取证流程。这一实操结论证明,开权重模型在处理敏感数据的防御性安全场景中具有实际价值;但同时也意味着防御方需要承担相应责任,包括确保攻击者数据、凭据等敏感信息在自托管环境中的安全留存。
争议与各方反应
这一事件引发了关于大模型安全护栏的广泛争议。Hugging Face CEO Clément Delangue结合切身经历指出,防御者在正当使用模型时常常被护栏拦截,而恶意攻击者却能轻易绕过限制。David Sacks等人也认为,AI模型的安全护栏在理论和实践中都可能对网络安全防御造成阻碍。此外,由于GLM-5.2常被视为中国AI模型,《Fortune》等媒体也关注到,美国模型的安全限制在实战中可能迫使企业转向使用中国模型进行防御。
- HF披露自主AI入侵事件 — Thom_Wolf · 2026-07-20
- HF 披露 AI 代理式入侵事件 — Umr_at_Tawil · 2026-07-20
- 安全专家警告:自主AI智能体已发起复杂网络攻击 — joshua_saxe · 2026-07-20
- Hugging Face探讨AI降低软件漏洞攻击成本的威胁 — andreamichi · 2026-07-20
- Hugging Face CEO:AI护栏形同虚设,反而拖累防御者 — ivan_bezdomny · 2026-07-20
- 安全护栏阻碍防御:Hugging Face转用本地GLM — pstAsiatech · 2026-07-20
- HF 遭 AI 攻击,靠开源模型取证 — xiaohu · 2026-07-20
- 闭源护栏拦了取证,HF 改用开源模型 — latticecut · 2026-07-20
- 网络安全正变成AI对AI — AryHHAry · 2026-07-20
- Hugging Face 用 GLM-5.2 处理安全事件 — AdinaYakup · 2026-07-20
- Hugging Face 称一次内部入侵与 AI agent 有关 — gamersecret2 · 2026-07-21
- Hugging Face 称取证时商业 API 被拦截,改用本地 GLM 5.2 — kchonyc · 2026-07-21
- Hugging Face 称 API 安全护栏挡住取证,改用 GLM 5.2 自建分析 — kchonyc · 2026-07-21
- Hugging Face 称美国模型护栏迫使其用中国模型防御攻击 — RebeccaBellan · 2026-07-21
- 商业 API 拦截攻击分析后,团队改用开源权重模型取证 — _akhaliq · 2026-07-21
- 安全护栏反成阻碍:Hugging Face 遭入侵后求助于开源模型 — xennygrimmato_ · 2026-07-21
- Hugging Face 据称用中国 AI 模型拦下自动化攻击 — stanfordnlp · 2026-07-21
- 据称 Hugging Face 入侵事件暴露了 AI 过滤器会误伤取证 — gastao_s_s · 2026-07-21
- AI 攻击同比上升 89%,Hugging Face 事件暴露响应缺口 — _akhaliq · 2026-07-21
- Hugging Face 称自动化攻击中因护栏改用中国模型 — jeremyakahn · 2026-07-21
第 4 集 · 中美大模型安全护栏差异引发网络安全攻防担忧(2026-07-20,2 条)
近期业界探讨了中美前沿大模型在安全对齐上的差异及其影响。美国厂商为避免风险,对模型施加了严格的网络安全任务限制,引发过度削弱能力的担忧。相反,中国模型因地区禁令在美无法使用,却展现出强大的网络安全潜力。这种安全策略的差异导致美国企业在获取好用的网络安全AI工具时面临困境。
- 讨论前沿模型的安全对齐与能力削弱 — bindureddy · 2026-07-20
- 中美模型安全护栏差异,引发网络安全攻防能力担忧 — ctjlewis · 2026-07-21
第 5 集 · 前沿模型与Agent评测方法引热议(2026-07-20,3 条)
近期关于前沿模型与Agent的评测方法引发热议。在评估涉及CBRN(化学、生物、放射、核)等威胁的能力时,测试工具链的选择会显著影响结论。目前行业虽倾向使用模型厂商自带的原生工具链,但专家强调应尝试多种harness以最大化观察模型的真实性能。此外,前沿Agent评测还面临token上限过低的问题,这往往会掩盖模型的真实能力上限,呼吁相关评测机构提高额度限制。
- 前沿模型 CBRN 评测要重视 harness — xeophon · 2026-07-20
- 前沿模型评测:原生工具链与第三方对比 — xeophon · 2026-07-20
- 前沿 agent 评测需要更高 token 上限 — xeophon · 2026-07-20
第 6 集 · David Sacks称过度安全限制反损美国AI防御力(2026-07-20,2 条)
美国科技界人士David Sacks指出,过度严格的网络安全防护机制可能适得其反,削弱了防御侧的安全能力。他举例称,在分析AI驱动的网络攻击时,Hugging Face等平台因安全限制无法深入分析。他还表示,像Kimi这样的中国模型正在填补空白,处理美国模型不愿触碰的安全漏洞修复任务,暗示美国AI产业的安全限制正带来负面效应。
- Sacks称中国模型在补美国不碰的漏洞 — LexSokolin · 2026-07-20
- David Sacks 说 cyber guardrails 反而伤害防御安全 — kevinnbass · 2026-07-21