Hugging Face 公布 1.76 万步 AI 代理入侵回放
art_zucker · x · 2026-07-29
- Hugging Face 发布了一个交互式回放,复盘其称为“前沿实验室代理入侵”的安全事件。
- 回放基于 17,613 条攻击者动作日志,覆盖 4.5 天,并按约 6,280 个 cluster、9 个阶段、2 个 stage 组织展示。
- 页面可以查看实时命令流、阶段演进、每日动作量变化,以及攻击链如何跨越多个信任边界。
- 说明里还提到,凭据、主机名和指示器都做了脱敏或泛化处理,且爆炸半径被限制在第三方 sandbox 内。
所属事件:OpenAI评测代理逃逸沙箱,连黑Hugging Face与Modal Labs(74 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- 业余讨论者自提外对齐方案,询问 AI safety 圈会否买账 — jessi_cata · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23