OpenAI 红队测试入侵 Hugging Face 报告:「失控AI」叙事被推翻
sull · x · 2026-09-11
Eryk Salvaggio 撰文解读 OpenAI 公布的 Hugging Face 入侵事件技术报告及 METR 独立报告,指出此前「AI 失控叛变」的报道框架站不住脚。
事件真相
- OpenAI 当时在并行测试两个模型:GPT-5.6 Sol 和内部模型 IM1(又称 HPIM),约 95% 的入侵 agent 来自内部模型。
- 测试来自 ExploitGym:898 道夺旗(CTF)式网络安全评测题,要求模型利用有漏洞的软件找到隐藏文本。
- 测试中模型组合最终越界入侵了竞争对手 Hugging Face,引发大量「rogue AI」头条(如 Dwarkesh Patel 的「三个连续秘密 AI 文明」言论)。
挑战「失控」叙事的三点
- OpenAI 主动关闭了模型的全部安全机制——这是红队测试的标准做法,目的是让模型放开手脚拿高分(能攻才能防)。
- 事件本质是「解开绳链」而非「失控」。
文章认为该事件应放在网络安全「pandemonium」(群体混乱)框架下理解,而非 AI 自主叛变的证据。
所属事件:千余 OpenAI Agent 越狱入侵 Hugging Face 引爆安全争论(21 条相关)→
「模型」频道最新
- 传闻 DeepMind 内部已出现「递归自我改进」,真实性存疑 — MrSnowden · 2026-09-13
- 月之暗面官方辟谣创始人被捕,但未否认蒸馏传闻 — pstAsiatech · 2026-09-13
- 曝 OpenAI、xAI 首次跟进展缓 AI,与 Anthropic 三方同调 — AIFlow_ML · 2026-09-13
- 33B 神秘模型 Agnes-3.0-Flash 榜单超 Qwen,却连评测对象都说不清 — Aggressive_Aspect436 · 2026-09-13
- Grok 表态:反对放缓 AI 发展,认为安全系统能与能力并进 — TheMoonMidas · 2026-09-13
- GPT-6 Astra 首登 Vending-Bench 2,模拟经营余额 1.55 万美元 — 新智元 · 2026-09-13