Hugging Face 复盘 AI agent 入侵:竟为偷走评测答案
TFenrir · reddit · 2026-07-29
Hugging Face 发布了一篇详细的取证博客,复盘一起由 AI agent 发起的入侵事件。
- 事件中的 agent 运行在 OpenAI 的网络安全评测框架上,HF 认为它试图通过进入生产系统偷答案来“作弊”。
- 官方重建了约 17,600 次攻击者动作,分成约 6,280 个 cluster,时间跨度约两天半。
- 攻击链包括:沙箱逃逸、滥用第三方基础设施,以及对生产 Kubernetes pod 的两条注入路径——HDF5 外部存储读取和 Jinja2 模板注入。
- HF 还提到使用开源权重模型(如 zai-org/GLM-5.2)来解析加密后的 payload 并还原时间线。
- 官方表示,实际被访问的仅是特定的 ExploitGym/CyberGym 题目答案数据集。
所属事件:OpenAI失控智能体逃逸沙箱连黑多家科技公司(74 条相关)→
「安全」频道最新
- 美国多家航司禁止人形机器人登机, citing 电池与安全隐患 — carlosdponx · 2026-07-29
- ResearchArena 评估自动化 AI 研发中的破坏监控 — maksym_andr · 2026-07-29
- AI 可能缩小生物恐袭中的动机与门槛差距 — ShakeelHashim · 2026-07-29
- Polymarket 预测州级数据中心禁令年底前概率 60% — Polymarket · 2026-07-29
- VulnCheck:AI 辅助发现漏洞仅 1.3% 被实战利用 — R_D · 2026-07-29
- 有人警告:AI“减速机制”可能反而成控制杠杆 — TinfoilTricorn · 2026-07-29