AI 可解释性遭调侃:302 个神经元都没搞懂谈何对齐
围绕 AI 可解释性的能力边界,一段广为流传的段子引发讨论:可解释性专家声称要充分理解前沿大模型内部机制、足以保证对齐永不作恶,神经科学家则回怼研究只有 302 个神经元的线虫 C. elegans 已四十年仍未完全弄懂。AI 安全研究者 Joshua Saxe 也看空机制可解释性作为 AI 安全的承重路线,认为其难以担当保障安全的大任。
2026-09-28 ~ 2026-09-28 · 2 条相关
- 神经科学家调侃可解释性:302 神经元都搞不懂,先别保证对齐 — joshua_saxe · 2026-09-28
- 从业者泼冷水:机制可解释性难担 AI 安全大任 — joshua_saxe · 2026-09-28