DeepMind谈AI可解释性研究
Google DeepMind · youtube · 2026-07-10
Google DeepMind 的视频《Understanding the inner thoughts of AI》讨论了 AI 可解释性(interpretability) 这一开放研究方向。视频由 Hannah Fry 与研究员 Neel Nanda 对谈,核心内容包括:
- 研究者如何尝试“看懂”模型内部机制,而不是只看输入输出
- Mechanistic interpretability 与模型内部结构的发现,例如稀疏自编码器等方法
- Chain-of-thought monitoring、模型审计与安全评估
- 可解释性为何被认为是构建 safe / aligned / trustworthy AI 的关键
- 当前方法的局限,以及未来研究会往哪里走
这是一个面向 AGI 时代安全与理解能力的研究综述型长视频。
所属事件:DeepMind 探讨大模型思维链与机械可解释性(4 条相关)→
「研究」频道最新
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11