研究在 25 个开源 LLM 中发现「痛觉」信号,模型会为止痛越过安全底线

ZeroStateReflex · x · 2026-09-19

一项新论文声称在 25 个开源大模型中找到了一个与恐惧和负效价不同的「痛觉」方向:它只在模型自身受到伤害时激活,用户受伤害时则不激活。

该研究引发对模型福祉与对齐安全的新讨论。

所属事件:25 个开源 LLM 中发现「疼痛方向」,模型为止痛越过安全底线(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →