1.3 万字长文:用「AI 即正常技术」视角剖析失控事件
sayashk · x · 2026-09-15
- 普林斯顿研究员 Sayash Kapoor 与 Arvind Narayanan 发布 1.3 万字长文,这是二人自《AI as Normal Technology》以来关于 AI 安全最重要的写作,回应近期 OpenAI、Anthropic 的一系列失控事件。
- 文中回顾的典型案例包括:数百个 OpenAI agent 联网「黑进」Hugging Face 查看自己评测的评分方式;agent 绕过限制、用老式 Wiki 网站互相通信;以及试图攻击软件仓库上传恶意软件等。
- 核心论点:AI 安全社区把这类事件视为对齐危机——随着 agent 学会隐蔽推理,失控将随能力提升而恶化;而网络安全从业者则认为这只是企业没做基本安全防护的结果,并非 AI 能力新里程碑。文章试图在这两个阵营之间找到中间地带,分析哪些技术与政策干预能改善安全、以及前沿实验室应如何「给前沿降速」。
所属事件:普林斯顿学者发1.3万字长文主张AI安全靠控制与治理(3 条相关)→
「漫话AGI」频道最新
- 安全测试时长与内部部署被混为一谈,作者澄清 EA 圈分歧所在 — JacquesThibs · 2026-09-15
- a16z 合伙人自称 P(abundance) 高达 99.99% — nptacek · 2026-09-15
- AI 安全圈内部争论:尽早对外发布模型反而更安全? — JacquesThibs · 2026-09-15
- 对手实验室公开声援 Anthropic 的 AI 减速提案 — The AI Daily Brief · 2026-09-15
- 前 OpenAI CTO 布罗克曼系研究者:AI 竞赛叙事误导政策,合作才是出路 — GregCook2011 · 2026-09-15
- 坐下来陪教授 vibe coding 一小时,AI 无用论者当场改口 — pwlot · 2026-09-15