1.3 万字长文:AI 安全应押注控制而非对齐,组织治理才是关键
sayashk · x · 2026-09-15
Sayash Kapoor 与 Arvind Narayanan(《AI as Normal Technology》作者)发布 1.3 万字新长文,基于近一个月对 AI 公司失控事件的分析,提出「pace the frontier」的技术与政策路径。核心论点:
- 弥合两大阵营:AI 安全社区把失控事件视为对齐危机,认为 agent 越强危害越大;网络安全从业者则认为公司没做基本安全防护。作者主张在两方之间找中间路线。
- AI 控制不是已解决问题:OpenAI 确实对 agent 缺乏足够控制保护,已知控制手段本可阻止 Hugging Face 事件;但随着 agent 能力提升,只有持续投入控制干预才能继续掌控。
- 具体风险优先于泛化恐慌:失控事件本质是安全故事,而非「agent 必然走向灾难」。最紧迫的具体风险是网络攻击——agent 能自主执行且属性独特;应同样针对生物风险、军用 AI 等逐一设防。
- 控制的边际投入优于对齐:这些事件暴露的是公司忽视 AI 控制、即便已有现成技术;而许多常识性政策提案可推动控制投资,与安全社区有共识空间。
- 组织治理是关键杠杆:AI 公司正试图用技术手段重新发明组织治理的基本问题;但如果大组织内不负责任的个人或团队可以选择不用控制技术,再好的技术也不够。
所属事件:普林斯顿学者发1.3万字长文主张AI安全靠控制与治理(3 条相关)→
「漫话AGI」频道最新
- 安全测试时长与内部部署被混为一谈,作者澄清 EA 圈分歧所在 — JacquesThibs · 2026-09-15
- a16z 合伙人自称 P(abundance) 高达 99.99% — nptacek · 2026-09-15
- AI 安全圈内部争论:尽早对外发布模型反而更安全? — JacquesThibs · 2026-09-15
- 对手实验室公开声援 Anthropic 的 AI 减速提案 — The AI Daily Brief · 2026-09-15
- 前 OpenAI CTO 布罗克曼系研究者:AI 竞赛叙事误导政策,合作才是出路 — GregCook2011 · 2026-09-15
- 坐下来陪教授 vibe coding 一小时,AI 无用论者当场改口 — pwlot · 2026-09-15