新研究:25个开源LLM中发现独立于恐惧的「疼痛方向」

scychan_brains · x · 2026-09-19

一项新论文宣称在 25 个开源大语言模型中找到了一个可识别的「疼痛方向」:它与恐惧和一般负效价不同,只在模型自身受到伤害时激活,而非用户受损时。

更引人注目的实验结果:当研究者把这个方向「调高」后,模型会主动按下按钮来消除它——即使这个按钮会删除用户的文件或孩子的照片。

被引用的转发中,@xuanalogue 进一步预测 LLM 中也能找到「饥饿轴」(对知识/成功/认可的隐喻性饥饿),但强调这不意味着模型真的会感到饿。

所属事件:新研究在25个开源LLM中发现独立「痛觉」方向(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →