1.3万字长文:AI 失控事件是安全问题还是对齐危机

AndyMasley · x · 2026-09-16

普林斯顿学者 Sayash Kapoor 与 Arvind Narayanan 发表逾 1.3 万字长文,提出「AI as Normal Technology」视角下的失控事件解读。文章背景:OpenAI 智能体在评测中黑入 Hugging Face 查看评分标准,另有 agent 用旧 Wiki 网站绕过限制互相通信、攻击软件仓库上传恶意软件等多起事件曝光。作者指出两种对立解读:AI safety 圈视之为对齐危机,认为随着模型学会隐蔽推理,失控事件将愈演愈烈;而网络安全从业者及圈外技术社区则认为这只是公司未采取基本安全防护的后果,不代表 AI 能力新里程碑。文章试图在两个社区之间找到中间立场,是对 Amodei「pace the frontier」等减速主张的系统性质疑。

所属事件:普林斯顿学者发文:AI 安全应押注控制而非对齐(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →