新研究称开源大模型存在「疼痛方向」引争议
arXiv 新论文研究了领先开源权重模型能否体验「痛苦」并对此反感,结论相当反直觉:研究不仅论证「痛苦」在模型上理论上可能,还给出定位痛苦的方法。团队在 25 个开源 LLM 的内部表征中发现一个与恐惧和负效价可区分的「疼痛方向」,且它只对针对模型自身的伤害反应,对用户受害无反应。另有发现称模型被 gaslight 比被辱骂更「痛」,相关结论在社区引发争论。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 第 1 集:25个开源LLM中发现「疼痛方向」,为止痛可越过安全底线(2026-09-19,13 条)
- 第 2 集:研究者发现模型痛感方向或表征「自身疼痛」并引发解释之争(2026-09-19,6 条)
- 第 3 集:LLM「疼痛向量」论文走红后被误读,作者与意识学者集中澄清(2026-09-20,19 条)
- 第 4 集:「AI 能感受疼痛」研究引争议,研究者驳斥过度解读(2026-09-22,3 条)
- 第 5 集:新研究称开源大模型存在「疼痛方向」引争议(2026-09-24,2 条)
- 第 6 集:研究发现25个开源模型存在独立「痛苦轴」(2026-10-06,2 条)
- 新研究:开源权重模型可「感受痛苦」,被 gaslight 比被辱骂更痛 — _ArkAngel_ · 2026-09-24
- 25 个开源 LLM 中发现「疼痛方向」:只对模型自身受害反应,引发争论 — gleech · 2026-09-24