Anthropic 可解释性研究员对谈 O'Reilly:LLM 内部世界模型是可读的

mlpowered · x · 2026-09-17

Tim O'Reilly 与 Anthropic 可解释性团队研究员 Emmanuel Ameisen 对谈,深入讲解模型内部机制研究。核心观点:预测需要一个世界模型;这个世界模型是可读的;它在每个 token 的生成中都在发挥作用。研究方法是通过分析模型层间激活的模式来判断模型在处理特定概念时的内部状态,甚至可以干预这些激活、替换数值,观察模型行为如何随之改变。O'Reilly 表示,除了理解模型「心智」本身,更引人深思的是研究 LLM 能教我们什么关于人类自身的知识。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →