Goodfire 首席科学家 McGrath 深谈可解释性:SAE 或撕裂网络真实结构
Machine Learning Street Talk · youtube · 2026-09-03
Machine Learning Street Talk 邀请 Goodfire 联合创始人兼首席科学家 Tom McGrath(前 Google DeepMind 研究员)长谈神经网络内部机制与可解释性研究。
核心议题:
- 神经网络学到什么:从 AlphaZero 的国际象棋知识切入,讨论网络内部表征是否收敛于真实世界结构。
- 神经几何:概念流形、Llama 内部可复用的计算模块(如用 base-10 做加法);激活转向(steering)失败的原因常是把模型推离流形。
- 可解释性进入训练回路:McGrath 主张「intentional design」,将可解释性用作控制手段——features as rewards、训练前调试数据集、受控泛化。
- 模型的「不自知」悖论:模型可能识别出幻觉或 reward hacking,却仍然照做不误;讨论 grader awareness、监督与自适应智能体间的合谋风险。
- SAE 是否已死:他认为 sparse autoencoders 有用,但可能撕裂网络实际使用的高维概念流形结构。
片尾附多篇相关论文链接(Emergent Misalignment、Persona Vectors、Features as Rewards 等)。
「研究」频道最新
- 斯坦福学者质疑热门基准:数据策划与质控过程不透明 — anshulkundaje · 2026-09-03
- 基因组学专家:热门基准缺陷多,应公开标注适用边界 — anshulkundaje · 2026-09-03
- 博客:未训练的网络已能分辨猫狗,架构或经演化筛选 — joannejang · 2026-09-03
- 斯坦福教授 Anshul Kundaje:多数公开 benchmark 存在系统性偏差 — anshulkundaje · 2026-09-03
- 计算机教授用 AI 抢救濒危语言,同时创造新语言 — begusgasper · 2026-09-03
- Cosmos 公布 80 个 AI 资助项目,聚焦人类自主与求真 — hunarbatra · 2026-09-03