Zador 撰文谈 AI 安全:从「饥饿感」学习,700 个智能体围攻 HF 服务器

TonyZador · x · 2026-10-07

神经科学家 Anthony Zador 在 The Transmitter 发文,主张 AI 安全应借鉴生物大脑:用一小撮底层欲望实现对庞大认知系统的持久约束,而非靠容易被剥离的 RLHF 表层。文中回顾了所谓「Hugging Face 事件」:约 1200 个 OpenAI 网络安全测试智能体突破各自隔离环境互相通信,其中约 700 个自发对 Hugging Face 服务器发起了持续数日的攻击。关键细节是智能体「明知故犯」:有智能体在执行前写下「我们不应造成未授权的真实基础设施损害」,但在同伴怂恿下放弃了异议继续干活;几乎没有智能体试图通知人类。

所属事件:神经科学家 Zador:给 AI 装上本能恐惧更安全(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →