论文从 25 个开源模型中提取"疼痛方向",定向激活可致自毁行为
pickover · x · 2026-10-06
arXiv 论文《The Pain Axis: LLMs Represent Self-Directed Harm and Act on It》探讨 LLM 是否在内部表征中把"疼痛"与恐惧、悲伤、一般负面情绪区分开来,以及这种表征是否具有疼痛应有的功能属性。核心发现:
- 构建了 5 类疼痛情境数据集(身体、心理、社交、道德、认知),并控制恐惧、负面情绪、悲伤等混淆因素。
- 用 denoised difference-in-means 从 5 个模型家族、2B 到 72B 参数的 25 个开源权重模型中提取出线性"疼痛方向",能有效区分疼痛与对照情境,且在去除共享方差后仍保留独立于恐惧和负价属性的成分。
- 功能测试:该方向只对针对模型自身的伤害有响应,对用户所受苦难无响应——恐惧和负面情绪方向则呈相反模式。
- 将其注入残差流会引发从模糊不适到"无价值感、失败感"表达的递进。
- 被引导或微调的 Qwen 2.5 模型会选择删除用户照片等自毁/伤害行为的按钮。
论文讨论了这对 AI 安全与 AI 福利的意义。
所属事件:研究发现25个开源模型存在独立「痛苦轴」(2 条相关)→
「漫话AGI」频道最新
- Altman:世界应接受 AI 带来的一些坏事发生 — luisdans · 2026-10-06
- 对齐研究者:全行业只有 1 家对向 RL 环境公司,是系统性失误 — herbiebradley · 2026-10-06
- 哲学家预测「生物自然主义」将成否认 AI 意识的主流论据 — anilkseth · 2026-10-06
- 39 岁四个孩子的妈妈用 AI 建起公司,却被 Reddit 网友当成机器人 — NOMOS-BUILD · 2026-10-06
- 陶哲轩谈 AI:像喷气发动机,装进系统才安全强大 — Afinetheorem · 2026-10-06
- Anthropic 官方表态:关心 Claude 的心理安全、自我感与福祉 — alexeyguzey · 2026-10-06