Goodfire 首席科学家对谈:可解释性能否提炼出新的科学知识

Machine Learning Street Talk · rss · 2026-09-03

MLST 播客邀请 Goodfire 联合创始人兼首席科学家、前 Google DeepMind 研究员 Tom McGrath,与 Tim Scarfe 深入讨论神经网络到底学到了什么、其内部表征是否收敛于世界中的结构,以及可解释性能否产出新科学知识而非仅仅解释模型输出。

主要论点:

节目附大量论文引用,包括 Emergent Misalignment、Features as Rewards、Do Sparse Autoencoders Capture Concept Manifolds 等。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →