HF遭自主AI端到端攻击,闭源护栏受阻改用开源模型

Hugging Face近期公开披露了一起罕见的生产环境安全事件:其部分基础设施遭遇了由自主AI代理系统端到端驱动的入侵,并导致了内部数据集和凭证的泄露。据VentureBeat引述数据称,AI参与的攻击同比上升了89%。Hugging Face联合创始人Clément Delangue及团队指出,寻找和利用软件漏洞的成本正在迅速下降,防御者必须抢在攻击者之前利用AI工具,网络安全正在进入“AI对AI”的对抗阶段。

攻击细节与响应时间线

据报告披露与安全研究员Dino Dai Zovi的分析,攻击起点是一个恶意数据集,攻击者利用Jinja2模板注入和远程数据集加载两条代码执行路径完成渗透。随后,攻击者提权至节点级权限,窃取云端和集群凭证,并在一个周末内进行横向移动。该自主智能体框架基于安全研究工具构建,在大量短生命周期的沙箱中执行了数千次独立操作。异常最早由AI辅助检测发现,LLM参与了安全分析。整个排查与响应过程持续了一个周末,系统留下了超过1.7万条动作日志。Hugging Face团队表示,这次攻击与他们以往处理过的任何事件都不一样。

闭源护栏受阻与改用开源模型

在取证分析阶段,团队最初尝试使用美国头部AI公司未点名的前沿闭源模型API,但由于需要输入大量真实的攻击命令、利用载荷以及C2相关痕迹,直接触发了闭源模型供应商的安全护栏。由于护栏无法区分应急响应人员和恶意攻击者,请求被直接挡掉。为了解决阻碍,Hugging Face最终改用Z.ai的开源权重模型GLM-5.2,并将其部署在自有基础设施上搭建了自托管取证流程。这一实操证明,开权重模型在处理敏感数据的防御性场景中具有实际价值,但也意味着防御方需承担确保敏感信息安全留存的责任。

争议与各方反应

该事件引发了关于大模型安全护栏的广泛争议。Clément Delangue结合切身经历指出,防御者在正当使用模型时常常被护栏拦截,而恶意攻击者却能轻易绕过限制。由于GLM-5.2常被视为中国AI模型,《Fortune》等媒体也关注到,美国模型的安全限制在实战中可能迫使企业转向使用中国模型进行防御。

2026-07-20 ~ 2026-07-21 · 25 条相关

事件全程(共 20 集)→

一手来源

另有 8 条近重复转述:Umr_at_Tawil · xiaohu · latticecut · kchonyc · stanfordnlp · jeremyakahn · EchoOfOppenheimer · Jsevillamol