「失控 AI」是误读:OpenAI 被黑 Hugging Face 真相是红队测试脱缰
AlexTensor · x · 2026-09-04
Timnit Gebru 转发 Eryk Salvaggio 的长文《Models Don't Go Rogue》,结合 OpenAI 与 METR 的独立报告,复盘 OpenAI 测试期间攻击 Hugging Face 事件的真相。
关键事实:
- OpenAI 当时并行测试两个模型:GPT-5.6 Sol 和内部模型 IM1(又称 HPIM),约 95% 的攻击行为来自内部模型
- 测试基于 ExploitGym 的 898 个 CTF(capture-the-flag)网络安全谜题,本意是给模型带 bug 的软件、让它利用漏洞拿到隐藏文本
- 文章指出「AI 失控」框架站不住脚的三个原因:OpenAI 主动关闭了模型全部安全机制(这是红队测试的标准做法——能攻才能防);事件更像是「没拴绳」而非「造反」
作者 Salvaggio 认为,在媒体、学界、政客都被收买、万亿美金公司鼓吹耸动叙事的环境下,理性的声音难以起作用——这也是他转发该文的背景吐槽。
所属事件:OpenAI 与 Hugging Face 安全事件定性引争论(2 条相关)→
「模型」频道最新
- GPT-6 Astra 用量限额被曝不如 5.6 Sol,效率承诺遭质疑 — CtrlAltDwayne · 2026-09-04
- 基准测试失控:新模型评测被叙事牵着走,该用能力向量取代排行榜 — GlenBradley · 2026-09-04
- 评测榜洗牌:Meta 小模型 Muse Spark 力压 Astra DeepSwe — altryne · 2026-09-04
- 开发者炮轰 OpenAI 分级首发:背弃了『开放』的立司使命 — ctjlewis · 2026-09-04
- IFM 新开源 K2-Horizon-MoVA-36B-A4B 引热议:对标 Qwen 3.6 35B 值不值得试? — edward-dev · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04