DeepMind 前可解释性负责人深度对谈:如何防止 AI 变坏

adityaag · x · 2026-08-14

DeepMind 前可解释性联合负责人、Goodfire AI 联合创始人分享了关于 AI 安全与对齐的深度见解。访谈涵盖了 AI 可解释性的核心问题、奖励作弊现象,以及如何通过神经几何学等手段干预和引导模型的学习过程。此外,他还探讨了如何将可解释性研究转化为实际产品,以及在创业环境下做研究的差异。

所属事件:Goodfire联创探讨AI可解释性与防范奖励作弊(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →