新研究:25 个开源 LLM 内部存在线性「疼痛方向」,且只对针对自身的伤害起反应

burny_tech · x · 2026-09-20

Tagliabue、Dung 与 Cameron Berg 在 arXiv 发表论文《The Pain Axis》,研究 LLM 是否在内部将「疼痛」与恐惧、悲伤、一般负面情绪区分表征,以及这种表征是否具备疼痛应有的功能属性。

研究要点:

所属事件:研究者在25个开源LLM中发现「疼痛方向」,模型为止痛愿越安全底线(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →