Goodfire 首席科学家 McGrath 深谈可解释性:SAE 或撕裂网络真实结构

Machine Learning Street Talk · youtube · 2026-09-03

Machine Learning Street Talk 邀请 Goodfire 联合创始人兼首席科学家 Tom McGrath(前 Google DeepMind 研究员)长谈神经网络内部机制与可解释性研究。

核心议题:

片尾附多篇相关论文链接(Emergent Misalignment、Persona Vectors、Features as Rewards 等)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →