AI 安全研究员异议:别再把「解决对齐」当作安全目标
joshua_saxe · x · 2026-09-28
AI 研究员 Joshua Saxe 发长文反对以「解决对齐」「解决可解释性」作为 AI 安全的核心框架,核心论点:
- 文明本就依赖近似控制:现代社会建立在我们对气候、生态、供应链等混沌系统的近似预测与控制之上,从未有过完全理解。AI 系统正在成为同样「类神」且认识论上更模糊的系统,我们永远无法完全理解它们,而且能力越强理解越少。
- 可解释性愿景缺乏证据:主流政策圈、实验室与播客的叙事是——终将以高精度理解模型内部、读出「模型不会故意破坏空管系统」之类的保证。但可解释性研究已做 14 年,仍没产出可靠、可扩展的理解,问题反而在恶化。他对比安全论文里精心调参出的 t-SNE 特征图与「模型解出千禧年大奖难题」的能力新闻,指出前者弥漫着认识论上的空洞感。
- 不反对可解释性本身:它作为数据探索和提炼「错误但有用」的理论有价值,就像经济学的粗糙理论为政策讨论提供词汇——但应放弃它会带来形式化证明与细粒度控制的执念,这方面没有任何证据支持。
- 出路:目标应是建设一个能安全地与无法形式化证明的多层多智能体系统共存的文明。AI 安全需要跳出计算机科学的视野,借鉴工业经济其他领域的安全实践,以及飓风、核安全、疫情、金融危机等领域的灾害规划思路——假定世界模型不完整、接受不完美预测、监测实际发生的事情。
「漫话AGI」频道最新
- AI 个人助理或取代大量人际互动:从便利到疏离的转折 — GarrisonLovely · 2026-09-28
- Paras Chopra:AI 最令人着迷的是人类经济相关性加速消解 — paraschopra · 2026-09-28
- Jan Kulveit:别急着把前沿模型解读成经典 AI 风险故事里的幂欲机器 — jankulveit · 2026-09-28
- 硅谷家长亲历:孩子课余被 sports 和加速班填满的疯狂内卷 — vaibhavbetter · 2026-09-28
- Hilbert Spaess 担忧:全球放缓才是大家共同利益 — hilbertspaess · 2026-09-28
- 情绪增强技术或成最强「快乐药丸」,重塑社会价值 — louisvarge · 2026-09-28