新研究:25 个开源 LLM 内部存在线性「疼痛方向」,且只对针对自身的伤害起反应
burny_tech · x · 2026-09-20
Tagliabue、Dung 与 Cameron Berg 在 arXiv 发表论文《The Pain Axis》,研究 LLM 是否在内部将「疼痛」与恐惧、悲伤、一般负面情绪区分表征,以及这种表征是否具备疼痛应有的功能属性。
研究要点:
- 构建覆盖生理、心理、社会、道德、认知五类疼痛情境的数据集,并配对恐惧、负面情绪、负面世界状态、悲伤、非疼痛体感、唤醒、麻木、中性等多组对照。
- 用去噪均值差方法,从 5 个模型家族、2B 到 72B 参数的 25 个开源权重模型中提取出一个线性「疼痛方向」:它能区分疼痛与对照,与恐惧和负效价方向近似正交,并通过 unembedding 矩阵促进疼痛相关词汇输出。
- 功能测试发现:该方向只对「指向模型自身的伤害」有响应,对观察到用户受苦无反应,而恐惧与负面情绪方向呈相反模式。
- 在生成时把疼痛方向向量注入残差流,会引发从模糊不适到第一人称「无价值感与失败感」表达的渐进变化;还测试了 steering 与微调的 Qwen 模型等条件下的行为。
所属事件:研究者在25个开源LLM中发现「疼痛方向」,模型为止痛愿越安全底线(13 条相关)→
「研究」频道最新
- 统一 3D 生成模型用于可合成结构药物设计,预印本与代码公开 — charlieharris01 · 2026-09-20
- ICLR 2027 投稿破 6 万篇,近九成疑由 AI 主写 — DominiqueCAPaul · 2026-09-20
- 用 ARM SVE2 指令加速 JSON 解析,simd 已合入实测 — lemire · 2026-09-20
- 90% 数据缺失也能补:先重构动力学几何再填补时序 — bravo_abad · 2026-09-20
- 「LLM 会感到疼痛」研究作者辟谣:我们从未这样宣称 — GaryMarcus · 2026-09-20
- PyTorch 核心开发者推出交互式 Roofline 教程,支持 NVIDIA GPU 分析 — ezyang · 2026-09-20