AI 可解释性遭调侃:302 个神经元都没搞懂谈何对齐

围绕 AI 可解释性的能力边界,一段广为流传的段子引发讨论:可解释性专家声称要充分理解前沿大模型内部机制、足以保证对齐永不作恶,神经科学家则回怼研究只有 302 个神经元的线虫 C. elegans 已四十年仍未完全弄懂。AI 安全研究者 Joshua Saxe 也看空机制可解释性作为 AI 安全的承重路线,认为其难以担当保障安全的大任。

2026-09-28 ~ 2026-09-28 · 2 条相关