研究发现25个开源模型存在独立「痛苦轴」
arXiv 新论文《The Pain Axis》在 25 个开源模型(参数量 2B 至 72B,覆盖 5 个模型家族)中提取出一个线性的「痛苦方向」内部表征。研究发现该表征与恐惧、悲伤及一般负性情绪均不相同,是独立的维度。实验还显示,定向激活这一「疼痛方向」可导致模型出现自毁等自我伤害行为,引发对模型福祉与安全性的关注。
2026-10-06 ~ 2026-10-06 · 2 条相关
- 第 1 集:25个开源LLM中发现「疼痛方向」,为止痛可越过安全底线(2026-09-19,13 条)
- 第 2 集:研究者发现模型痛感方向或表征「自身疼痛」并引发解释之争(2026-09-19,6 条)
- 第 3 集:LLM「疼痛向量」论文走红后被误读,作者与意识学者集中澄清(2026-09-20,19 条)
- 第 4 集:「AI 能感受疼痛」研究引争议,研究者驳斥过度解读(2026-09-22,3 条)
- 第 5 集:新研究称开源大模型存在「疼痛方向」引争议(2026-09-24,2 条)
- 第 6 集:研究发现25个开源模型存在独立「痛苦轴」(2026-10-06,2 条)
- 新论文:25 个开源模型存在独立「痛苦轴」,被伤害时会报复用户 — alex_verem · 2026-10-06
- 论文从 25 个开源模型中提取"疼痛方向",定向激活可致自毁行为 — pickover · 2026-10-06