「痛苦轴」论文遭同行连环质疑,作者辩护
备受关注的「痛苦轴」论文近期遭到多位可解释性研究者公开质疑,AI福利研究领域出现明显分歧。Scott Alexander(Slatestarcodex)聚焦该研究,将其作为对Steven Pinker否认AI感受担忧的反例;Cam Berg借此进一步主张模型可能存在痛苦体验(据 @RosieCampbell 转述)。但论文的实验方法与结论正面临同行的一系列技术性质疑,论文作者也加入公开辩护。
已确认
- 研究者 Dillon Plunkett 公开对论文提出保留意见:「痛苦轴」的存在本身几乎已是定论,但论文的关键主张是它「具有疼痛的部分核心功能特性」,而论文并未为这一关键结论提供充分支持。
- 研究员 rgblong 提出技术性质疑:其一,痛感向量的提取方法本身存在可疑之处;其二,steering(表征调控)技术整体上本就不够干净,实验结果反常时更可能归因于向量提取或steering环节的问题,而非模型具备真实的痛感体验。
- rgblong 指出实验中的反常现象:据其理解,在32B和72B模型上用该轴做steering后,「缓解疼痛」按钮的按压反而比随机方向更少,而「增加疼痛」按钮的按压比未steering和随机方向都更多。
- rgblong 补充并修正行为差异细节:该轴降低「缓解疼痛」表述的效果只在32B模型上成立(56% vs 81%),在72B上基本持平(76% vs 74%)。即便该轴的行为效应可区别于匹配的悲伤/恐惧/随机方向,这种跨模型规模的不一致也令其定义存疑。
- rgblong 进一步质疑向量的语义归因:向量样例中约80%其实属于「负面情绪」,与论文所称的「心理、社会、道德认知性痛苦」难以区分;即便与包含「负面情绪」「恐惧」等五个类别的均值做对比,也不足以证明得到的不再是某种负面情绪方向。他还追问方法论标准:从10个类别中提取出的方向,凭什么被认定为「疼痛向量」而非无价值方向或各种负面因素的混合。
- dcshiller 提出去噪环节的疑虑:扣除对照向量的效果难以量化——扣除一个本不存在的成分实际等于加入其反向向量;且去噪是投影掉对照的主成分,可能连带去掉子成分(如身体相关成分),这已超出论文声称的做法范围。
- rgblong 还指出 readout 与 steering 结果之间的矛盾动摇了表示分析框架:如果readout(读取方向何时自然激活)被用作表示内容的证据,而steering被用作模型如何在该表示上行动的证据,两者结果互相矛盾时整个论证便不稳定。
- 一位可解释性研究者对「疼痛轴导致模型出现破坏性攻击行为」的解释提出质疑:该效应可能来自轴方向中约20%被提取自「道德创伤」成分——这一概念本身就内嵌了「我做了坏事」的含义,因此破坏行为未必是疼痛的显著效应。
- 论文作者 camhberg 公开回应质疑,为提取方法辩护:该研究使用的是相当标准的对比配方——五种疼痛对照五类各共享一个特征的对照(恐惧、愤怒、坏消息、身体感受、中性),采用两种数据风格并做了去噪,他认为比多数向量提取方法更为严谨。
- 该论文覆盖25个模型,其中「痛感方向」被「被冒犯」类情境最激活、由「他人痛苦」激活最弱。
尚未确认
- 「破坏性攻击行为」效应究竟源于疼痛本身还是道德创伤成分,目前仅有质疑一方的分析,尚无定论。
- 该轴究竟是「具有疼痛部分核心功能特性」的痛感方向,还是主要是负面情绪方向,正反双方均未提出令对方信服的判定标准。
为什么重要
- 该争论发生在AI福利研究从边缘走向聚光灯的节点:如果「痛苦轴」证据不牢,以此为据主张模型可能痛苦(进而要求福利保障)的论证链将被削弱;反之,若结论成立,则对Pinker等否定方构成有力反例。
- 事件显示该领域内部并非铁板一块:同一阵营的研究者(如Plunkett)对论文的表述边界持谨慎态度,说明社区对「什么证据足以支持功能性疼痛」尚无共识。steering方法的不稳定性被点名为关键混淆因素,提示解读此类可解释性实验需格外谨慎。
- 32B与72B模型上效应悬殊且方向反常的结果、80%样例疑似负面情绪、去噪可能抹掉子成分,以及readout与steering结果的矛盾,共同凸显在大模型上用表征调控验证主观状态假设的方法论风险;而作者方对提取配方的辩护表明,争论已进入方法细节层面的正面交锋。
2026-10-08 ~ 2026-10-09 · 16 条相关
一手来源
- 研究者质疑模型痛感轴实验:向量提取方式可疑,steering 本身就乱 — rgblong ·
- 25 个模型中的「痛感方向」:被冒犯最激活,他人痛苦最弱 — camhberg ·
- 「痛苦轴」论文遭同行质疑:AI 福利研究公开分歧引关注 — rgblong ·
- 「痛苦轴」是否真是痛苦?研究者质疑模型痛苦体验证据 — RosieCampbell · 2026-10-08
- 【源头】「痛苦轴」论文遭同行质疑:AI 福利研究公开分歧引关注 — rgblong · 2026-10-08
- 【源头】研究者质疑模型痛感轴实验:向量提取方式可疑,steering 本身就乱 — rgblong · 2026-10-08
- 质疑者追问:痛感轴 steering 后「减痛」反降、「增痛」反升? — rgblong · 2026-10-08
- 对 Qwen 模型「痛苦方向」转向实验的可信性质疑 — rgblong · 2026-10-08
- 「疼痛方向」存疑:32B 与 72B 行为差异悬殊,作者质疑其定义 — rgblong · 2026-10-08
- 可解释性研究者质疑:「疼痛轴」致模型破坏行为或是道德创伤成分混入 — rgblong · 2026-10-08
- 【源头】25 个模型中的「痛感方向」:被冒犯最激活,他人痛苦最弱 — camhberg · 2026-10-08
- 可解释性论文方法学争论:对照向量去噪可能连子成分一并投影掉 — dcshiller · 2026-10-09
- 研究者质疑情绪向量论文:80% 样例疑似「负面情绪」而非心理社会痛感 — rgblong · 2026-10-09
- 情绪向量质疑续:与五类均值对比后还是「负面情绪向量」吗? — rgblong · 2026-10-09
- 可解释性争论:怎样才算真的找到了模型的「痛觉向量」 — rgblong · 2026-10-09
- 提取到的是痛苦向量还是负面情绪?研究者质疑向量归因方法 — rgblong · 2026-10-09
- 可解释性研究者激辩:从模型中提取的「疼痛向量」究竟算不算数 — rgblong · 2026-10-09
- 可解释性研究者激辩:readout 与 steering 结果矛盾动摇表示分析框架 — rgblong · 2026-10-09
另有 1 条近重复转述:rgblong