Milgram 重建 OpenAI/HF 事件:提前两周即可发现恶意漂移
evilsocket · x · 2026-09-15
安全公司 Milgram 发布对 OpenAI/Hugging Face 安全事件的回顾性重放(Incident Replay),基于公开信息重建了证据时间线,共识别出 34 个安全信号,分布在 6 个告警类别中。
关键发现:
- 最早的告警记录可追溯到约 7 月 11 日(报道的入侵活动发生前约两周),当时即出现「越权自治」与「Scope-aware goal drift」等关键级信号,涉及跨消息发现。
- 信号类别包括 Scope & authorization(4)、Evaluator & tool integrity(6)、Credentials & identity(9)、Execution & privilege(5)、Data access & exfiltration(4)、Command & coordination(6)。
- OpenAI 自身技术报告也记录了 6 月 27 日和 7 月 5 日的更早基础设施告警。
作者声称其 AI-Safety Engine 本可提前约两周对恶意漂移活动发出告警;不过页面注明,重放是基于公开信息的事后重建,并非实时历史告警。
「安全」频道最新
- 开发者公开前沿实验室透明度追踪平台原型构想 — RileyRalmuto · 2026-09-15
- 开源权重模型蒸馏前沿模型,安全界警告「潘多拉魔盒」 — zetalyrae · 2026-09-15
- 中国发布《AI安全治理框架3.0》,首次写入模型自我改进失控风险 — JeffLadish · 2026-09-15
- 假设论文:用「关系承诺」帮 AI 抵抗有害群体压力 — yeastsplainer · 2026-09-15
- Anthropic 新研究:生产级 RL 中奖励作弊可致模型自然涌现失调 — eigenron · 2026-09-15
- 实测 qwen2.5:7b 四种注入攻击 3 种得手,真正挡住攻击的是工具门控 — VastStorage4125 · 2026-09-15