从业者泼冷水:机制可解释性难担 AI 安全大任

joshua_saxe · x · 2026-09-28

AI 安全研究者 Joshua Saxe 表态看空「机制可解释性」作为 AI 安全的承重路线:他用段子指出,神经科学家研究只有 302 个神经元的线虫 C. elegans 已四十余年仍未完全搞懂,指望理解前沿 LLM 的内部机制来实现对齐保证并不现实。

但他整体仍看好 AI 安全,理由是人类有长期管理「不完全理解的复杂系统」的历史经验——气候、宏观经济、人体、组织文化。安全不必建立在完全透明之上。

所属事件:AI 可解释性遭调侃:302 个神经元都没搞懂谈何对齐(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →