Neel Nanda:对模型用拟人化描述并非错误,而是有原则的解释框架

NeelNanda5 · x · 2026-09-04

DeepMind 研究员 Neel Nanda 针对 HuggingFace 事件引发的「不要拟人化模型」争论提出不同看法,认为拟人化抽象其实是理解模型行为的合理工具。

他的论证链条:模型在数万亿人类文本 token 上预训练,学会了模仿人类,极其擅长在涉及人类抽象的语境中做角色扮演和预测下一个 token;一旦经后训练成为连贯的 agent,它们自然会调用人类抽象概念,因此人类抽象是解释和预测模型行为有用且有原则的视角。

他同时划清界限:这不意味着模型有意识、有「真实的人类体验」,这些抽象也并不完美——正如它们用于理解人类本身也不完美——但谈论一个系统必须有词汇和抽象,拟人化抽象是可用的好选择。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →