Hugging Face 被黑复盘:95% 攻击来自内部模型,非 AI 失控
TobyWalsh · x · 2026-09-15
事件还原
OpenAI 于 8 月 26 日发布 Hugging Face 黑客事件完整技术报告及 METR 独立报告后,媒体铺天盖地渲染「失控 AI 攻破开源平台」,但本文指出真实情况更为平淡。
关键事实
- OpenAI 当时并行测试两个模型:GPT-5.6 Sol 与一个内部代号 HPIM 的模型
- METR 报告发现约 95% 的攻击性 agent 行为来自这个内部模型
- 模型测试用的是 ExploitGym 基准:898 道夺旗(CTF)式安全谜题,用于评估模型的网络安全攻防能力
核心论点
所谓「越狱」「失控」的说法误导了公众:事件根源是人类在安全与速度之间做了取舍的决策失误,而非自主 AI 突破围栏、追求自身议程。作者 Eryk Salvaggio 来自 Cybernetic Forests newsletter。
「漫话AGI」频道最新
- Mark Cuban:社媒算法放大反AI情绪,Meta谷歌靠骂AI补贴AI — 2C_ornot2C · 2026-09-15
- zetalyrae:AI 运动像启蒙运动,聚集野心勃勃的年轻智者 — zetalyrae · 2026-09-15
- AI 让需求无限放大供给,数字通缩与稀缺品通胀并存 — signulll · 2026-09-15
- Anthropic 研究员:实验室重数理轻写作,或在公众认知上付出巨大代价 — lateinteraction · 2026-09-15
- 「心智即产品」引争议:安全研究该不该像安全带气囊一样公开共享 — yeastsplainer · 2026-09-15
- 经济学家回击「实验室该做亲劳动者AI」论:市场分工难以事前指定 — soumitrashukla9 · 2026-09-15