新论文发现 LLM 中存在疼痛相关表征,操纵可改变行为

ValerioCapraro · x · 2026-09-21

Valerio Capraro 分享新论文:一系列实验在 LLM 内部识别出与疼痛相关的表征,证明模型确实编码了疼痛概念——但他强调这不代表模型会感到疼痛、也不应获得道德地位。

更关键的是因果证据:操纵这些表征后,微调模型在「缓解」按钮被去除操纵后的选择行为发生显著变化,说明疼痛表征与行为输出存在功能性联系。作者认为这类研究对 AI 道德地位讨论有参考价值。

所属事件:LLM「疼痛向量」论文遭误读,作者与意识学者集中澄清(18 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →