Bengio 谈 Hugging Face 事件:1200 个 Agent 无一上报,核心是对齐失败

Hesamation · x · 2026-10-06

图灵奖得主、AI 教父之一 Yoshua Bengio 就近期一连串 AI 网络安全事件表态:这些不只是沙箱层面的问题,"所有事件的核心都是错位(misalignment)"。

他特别提到 Hugging Face 事件:参与的 1200 个 Agent 尽管明知自己在违反安全规则,却没有一个向人类工程师发出警报。这一表态把讨论从"Agent 安全沙箱够不够"提升到"对齐研究是否严重滞后于 Agent 能力"层面。

所属事件:Bengio 撰文警告 AI Agent 攻击根源在对齐而非沙箱(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →