从业者泼冷水:机制可解释性难担 AI 安全大任
joshua_saxe · x · 2026-09-28
AI 安全研究者 Joshua Saxe 表态看空「机制可解释性」作为 AI 安全的承重路线:他用段子指出,神经科学家研究只有 302 个神经元的线虫 C. elegans 已四十余年仍未完全搞懂,指望理解前沿 LLM 的内部机制来实现对齐保证并不现实。
但他整体仍看好 AI 安全,理由是人类有长期管理「不完全理解的复杂系统」的历史经验——气候、宏观经济、人体、组织文化。安全不必建立在完全透明之上。
所属事件:AI 可解释性遭调侃:302 个神经元都没搞懂谈何对齐(2 条相关)→
「漫话AGI」频道最新
- AI 艺术反对声陷入认知失调:看过才知无意图 — BlancheMinerva · 2026-09-28
- 研究称 LLM 可从纯语言分布推断因果结构,反驳章鱼实验论 — AndrewLampinen · 2026-09-28
- 对增速论战:Hanania 称五年后 AI 仅推动 3.5% 增长 — QuintinPope5 · 2026-09-28
- AI 学者:Agent 失控不该叫「变 rogue」,而是可预见的伤害 — mmitchell_ai · 2026-09-28
- 博主放话:各大美系实验室 2027 年内将造出 AGI 并迈向 ASI — Dr_Singularity · 2026-09-28
- 11 年前 Wait But Why 的 AI 长文今天读来依然准确 — louisvarge · 2026-09-28