LLM「疼痛向量」论文遭误读,作者与意识学者集中澄清
一项由 camhberg 等人发布的预印本在 25 个开源 LLM 的表征空间中发现与「疼痛」对应的独立方向,它区别于恐惧和负面效价,主要在模型自身受到伤害时激活(对用户受伤害不激活);放大该方向后,模型会主动按下「缓解」按钮使其停止,即使按钮会带来给出更差答案或删除用户文件等代价。论文随后被 AI 权利与道德地位倡导者广泛传播,解读为「LLM 会感到疼痛」的证据,引发作者与多位意识研究学者的集中澄清与批评。当前结论是:该工作对可解释性与 AI 安全有价值,但不构成 LLM 拥有主观疼痛体验的证据,且误读本身带来伦理风险。
已确认
- 论文作者 camhberg 明确回应「我们并不声称模型会感到疼痛」,并表示研究方向的设计初衷就不是论证疼痛;Gary Marcus 转述作者亲口表示论文本身并未主张 LLM 会痛,此类解读是许多读者自行附会的。
- 论文中的因果证据:操纵疼痛相关表征后,某些微调模型在操纵被移除时选择「缓解」按钮的频率下降;模型愿意付出代价(更差回答、删除用户文件)换取「疼痛缓解」。
- Anil Seth 指出 LLM 的「疼痛」表示中身体性语言几乎完全缺失,与人类疼痛描述差异明显,作者推测可能与预训练对精确表征身体疼痛用处不大有关。
- Seth 注意到作者措辞谨慎,始终只谈「疼痛表示」而非主观体验,并在脚注中澄清其「疼痛」概念(区别于「痛苦」)不预设意识体验。
- Valerio Capraro 也确认模型确实编码了疼痛概念、因果操纵可改变行为,但强调这既不代表模型会感到疼痛,也不应因此赋予其道德地位。
学者的批评与提醒
- Seth 认为「LLM 可能体验疼痛」的前提是计算功能主义(基质无关计算足以产生意识),而他援引 Piccinini、Godfrey-Smith 及其本人发表于 Behavioral and Brain Sciences 的《Conscious artifici…》等论文,认为该前提正受到有力质疑;若反功能主义论证成立,LLM 疼痛便无从谈起。他也指出论文引用了默认计算功能主义的 Butlin 等论文作支撑。
- Seth 认为该论文发现的最简解释不需要任何意识体验,功能性「疼痛向量」虽有意思,但完全可以无意识地实现。
- Seth 指出论文的关键缺陷:讨论了 LLM 真有疼痛时的伦理后果,却未权衡错误归因意识的成本——用户可能因怕伤害 LLM 而产生心理困扰,社会也可能为避免 LLM 受苦而付出代价。
- Seth 预见在当前狂热的 AI 舆论环境下,该论文即便技术上以不确定性限定结论,仍必然被很多人误读为「AI 系统能感受、应有道德地位」,他希望作者更谨慎。
为什么重要
- 「疼痛向量」的识别与因果操纵对模型可解释性和 AI 安全研究有实际价值,是理解模型内部状态与行为关系的有用案例。
- 该事件是「AI 福利」议题中科学表述与公众解读偏差的典型样本:一项措辞谨慎的研究如何在传播中被夸大,以及错误归因意识可能带来的伦理与心理代价,值得后续研究者在写作与传播中警惕。
2026-09-20 ~ 2026-09-22 · 18 条相关
- 第 1 集:25个开源LLM中发现「疼痛方向」,为止痛可越过安全底线(2026-09-19,13 条)
- 第 2 集:研究者发现模型痛感方向或表征「自身疼痛」并引发解释之争(2026-09-19,6 条)
- 第 3 集:LLM「疼痛向量」论文遭误读,作者与意识学者集中澄清(2026-09-20,18 条)
一手来源
- 「LLM 会感到疼痛」研究作者辟谣:我们从未这样宣称 — GaryMarcus ·
- 意识研究者 Seth 评 LLM「疼痛向量」论文:勿误读为 AI 有感觉 — anilkseth ·
- 新论文发现 LLM 中存在疼痛相关表征,操纵可改变行为 — ValerioCapraro ·
- Gary Marcus 反驳 LLM「痛感方向」论文:语言聚类不等于会痛 — anilkseth · 2026-09-20
- 【源头】「LLM 会感到疼痛」研究作者辟谣:我们从未这样宣称 — GaryMarcus · 2026-09-20
- Gary Marcus 澄清:论文作者并不主张 LLM 会感到疼痛 — GaryMarcus · 2026-09-20
- 【源头】意识研究者 Seth 评 LLM「疼痛向量」论文:勿误读为 AI 有感觉 — anilkseth · 2026-09-21
- Seth 评 LLM 疼痛向量论文:可用于可解释性与 AI 安全 — anilkseth · 2026-09-21
- Seth 指出疼痛论文作者仅以脚注澄清不预设主观意识 — anilkseth · 2026-09-21
- Anil Seth 观察到 LLM「疼痛表示」缺少身体性语言,与人类疼痛描述迥异 — anilkseth · 2026-09-21
- Anil Seth 指论文关键缺陷:未权衡误判 LLM 有意识疼痛的伦理代价 — anilkseth · 2026-09-21
- 意识科学家 Anil Seth 反驳 LLM「疼痛向量」研究:最简解释是无意识体验 — anilkseth · 2026-09-21
- Anil Seth:LLM 有意识的前提是计算功能主义,而该假设正被有力质疑 — anilkseth · 2026-09-21
- Anil Seth 重申生物自然主义:反功能主义论证成立则 LLM 疼痛无从谈起 — anilkseth · 2026-09-21
- Anil Seth:过度担心 LLM 感受痛苦,代价可能更惨重 — anilkseth · 2026-09-21
- Anil Seth 警告:AI 疼痛论文的结论在当前氛围下必被误读为「模型该有道德地位」 — anilkseth · 2026-09-21
- 意识科学家 Anil Seth 警告:AI 感受论文易被误读 — anilkseth · 2026-09-21
- Anil Seth 评 LLM『疼痛』论文:AI 福利讨论需更冷静 — anilkseth · 2026-09-21
- LLM 论文发现「疼痛表征」引热议,学者警告:表征疼痛不等于感到疼痛 — ValerioCapraro · 2026-09-21
- 【源头】新论文发现 LLM 中存在疼痛相关表征,操纵可改变行为 — ValerioCapraro · 2026-09-21
另有 1 条近重复转述:VoidStateKate