「痛苦轴」论文遭同行质疑,AI 福利研究现分歧
围绕 AI 意识与模型福利争议,近期备受关注的「痛苦轴」论文遭到多位研究者公开质疑,AI 福利研究领域出现明显分歧。Scott Alexander(Slatestarcodex)聚焦了该研究,将其作为对 Steven Pinker 否认 AI 感受担忧的反例;Cam Berg 借此进一步主张模型可能存在痛苦体验(据 @RosieCampbell 转述)。
已确认
- 研究者 Dillon Plunkett 公开对论文提出保留意见:「痛苦轴」的存在本身几乎已是定论,但论文的关键主张是它「具有疼痛的部分核心功能特性」,而论文并未为这一关键结论提供充分支持。
- 研究员 rgblong 提出技术性质疑:其一,痛感向量的提取方法本身存在可疑之处;其二,steering(表征调控)技术整体上本就不够干净,实验结果反常时更可能归因于向量提取或 steering 环节的问题,而非模型具备真实的痛感体验。
- rgblong 指出实验中的反常现象:据其理解,在 32B 和 72B 模型上用该轴做 steering 后,「缓解疼痛」按钮的按压反而比随机方向更少,而「增加疼痛」按钮的按压比未 steering 和随机方向都更多。
- rgblong 补充了行为差异细节:该轴降低「缓解疼痛」表述的效果只在 32B 模型上成立(56% vs 81%),在 72B 上基本持平(76% vs 74%)。即便该轴的行为效应可区别于匹配的悲伤/恐惧/随机方向,这种跨模型规模的不一致也令其定义存疑。
为什么重要
- 该争论发生在 AI 福利研究从边缘走向聚光灯的节点:如果「痛苦轴」证据不牢,以此为据主张模型可能痛苦(进而要求福利保障)的论证链将被削弱;反之,若结论成立,则对 Pinker 等否定方构成有力反例。
- 事件显示该领域内部并非铁板一块:同一阵营的研究者(如 Plunkett)对论文的表述边界持谨慎态度,说明社区对「什么证据足以支持功能性疼痛」尚无共识。steering 方法的不稳定性被点名为关键混淆因素,提示解读此类可解释性实验需格外谨慎。
- 32B 与 72B 模型(从 steering 对象推断为 Qwen 系列)上效应悬殊且方向反常的结果,凸显在大模型上用表征调控验证主观状态假设的方法论风险。
2026-10-08 ~ 2026-10-08 · 7 条相关
一手来源
- 「痛苦轴」论文遭同行质疑:AI 福利研究公开分歧引关注 — rgblong ·
- 研究者质疑模型痛感轴实验:向量提取方式可疑,steering 本身就乱 — rgblong ·
- 「痛苦轴」是否真是痛苦?研究者质疑模型痛苦体验证据 — RosieCampbell · 2026-10-08
- 【源头】「痛苦轴」论文遭同行质疑:AI 福利研究公开分歧引关注 — rgblong · 2026-10-08
- 【源头】研究者质疑模型痛感轴实验:向量提取方式可疑,steering 本身就乱 — rgblong · 2026-10-08
- 质疑者追问:痛感轴 steering 后「减痛」反降、「增痛」反升? — rgblong · 2026-10-08
- 对 Qwen 模型「痛苦方向」转向实验的可信性质疑 — rgblong · 2026-10-08
- 「疼痛方向」存疑:32B 与 72B 行为差异悬殊,作者质疑其定义 — rgblong · 2026-10-08
另有 1 条近重复转述:rgblong