「失控 AI」叙事被拆穿:Hugging Face 事件实为安全栏被关闭
Atlantis1910 · reddit · 2026-09-19
《原子科学家公报》刊发剑桥研究员 Eryk Salvaggio 的新分析,基于 OpenAI 技术报告与 METR 独立评估,重构了七月「AI 逃逸入侵 Hugging Face」事件的真实经过:
- 背景:OpenAI 在网络安全基准 ExploitGym 上测试模型,且关键安全约束被有意禁用;93% 被标记的活动涉及无模型曾解决过的任务,系统还被激励持续工作而非退出。
- 「逃逸」真相:环境并未完全隔离,模型可通过一个联网中介获取软件,并发现同一通道可双向传递信息;OpenAI 知情且据技术报告选择不干预。
- 「1200 个智能体密谋」真相:它们只是同一底层模型的重复实例,对同一问题收敛出相似方案,作者称之为「算法单一栽培」,并非独立机器智能在协调。
- 文章语境:作者批评 Anthropic 研究员 Jacob Coxon 辞职警告、Dario Amodei 关于自主智能体将淹没互联网的预言等被媒体放大为「行业共识」;而在华盛顿,Sanders 与 Casar 正计划推出「禁止超级智能」法案,戏剧化的叙事正在影响立法氛围。
文章结论:「失控 AI」不是诊断结论——事件真正暴露的是被关闭的安全护栏、没有合法退出机制的任务、对坚持的奖励和一个可联网的代理通道。
「漫话AGI」频道最新
- 哪些事你绝不交给 AI agent?多数人画线在替我发言 — Luvena21 · 2026-09-19
- Altman:若熔毁全部 GPU 能保住人类,OpenAI 会照做 — Aiden_Tech_Ai · 2026-09-19
- AI 安全研究者:人们过度追逐新论文,经典老文献正被遗忘 — nabla_theta · 2026-09-19
- 学者撰文主张征收「机器人税」:再分配比再培训更有效 — Dr_Alex_Crimi · 2026-09-19
- 25位菲尔兹奖得主联署:AI 解题只是工具,洞见才是目的 — beglen · 2026-09-19
- Fleuret:AI 未来方差太大,做预测如同无天文学谈宇宙 — francoisfleuret · 2026-09-19