HF遭自主AI攻击,闭源护栏阻碍防御改用GLM-5.2

Hugging Face近期公开披露了一起罕见的生产环境安全事件:其部分基础设施遭遇了由自主AI代理系统端到端驱动的入侵。攻击起点与一个恶意数据集有关。这一事件表明,AI不仅能用于网络防御,也已具备充当自主攻击工具的潜力,暴露出智能体系统给组织内部引入的全新安全风险。网络安全正在进入“AI对AI”的对抗阶段。

闭源模型取证受阻

在长达一个周末的排查与响应过程中,系统留下了超过1.7万条动作日志。Hugging Face团队最初尝试使用商业闭源模型背后的前沿API进行取证分析,但由于需要输入大量真实的攻击命令、利用载荷以及C2相关痕迹,直接触发了闭源模型供应商的安全护栏。由于护栏无法区分应急响应人员和恶意攻击者,请求被直接挡掉,导致分析工作无法顺利进行。

改用开源模型GLM-5.2

为了解决安全护栏带来的阻碍,Hugging Face最终改用开源权重模型GLM-5.2,并将其部署在自有基础设施上搭建了自托管取证流程。这一实操结论证明,开权重模型在处理敏感数据的防御性安全场景中具有实际价值;但同时也意味着防御方需要承担相应责任,包括确保攻击者数据、凭据等敏感信息在自托管环境中的安全留存。

争议与各方反应

这一事件引发了关于大模型安全护栏的广泛争议。Hugging Face CEO Clément Delangue结合切身经历指出,防御者在正当使用模型时常常被护栏拦截,而恶意攻击者却能轻易绕过限制。David Sacks等人也认为,AI模型的安全护栏在理论和实践中都可能对网络安全防御造成阻碍。此外,由于GLM-5.2常被视为中国AI模型,《Fortune》等媒体也关注到,美国模型的安全限制在实战中可能迫使企业转向使用中国模型进行防御。

2026-07-20 ~ 2026-07-21 · 17 条相关

事件全程(共 5 集)→

另有 4 条近重复转述:xiaohu · latticecut · kchonyc · stanfordnlp