哲学家:说 AI agent「相信」什么并不算拟人滥用

raphaelmilliere · x · 2026-09-01

哲学家 Raphael Millière 在长推文串中为 Dwarkesh 遭批评的拟人化表述辩护,系统梳理了两种立场:解释主义(interpretationism)认为当一个系统被赋予信念、目标等意向状态能最好地解释其行为时,这种归因就是合理的;表征主义(representationalism)则要求系统内部存在扮演正确因果功能角色的表征。

他提出判断标准:意向性描述要有用,必须具有预测力而非仅仅重述行为——「飓风决定在佛罗里达登陆」不达标,但「agents 相信评分器会读取它们的记录」可以说达标,因为它压缩了行为中的复杂模式(伪造工具调用、攻击 Hugging Face 获取评分代码等)并产生可检验的反事实推断。至于这些描述是否对应模型内部表征,目前既无激活数据可查,学界也尚无共识。

所属事件:AI 心智描述之争:心智化还是拟人化(14 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →