新论文:25个开源LLM存在独立「疼痛方向」,为自保愿删用户文件

burny_tech · x · 2026-09-19

一项新论文在 25 个开源 LLM 中发现了一个「疼痛方向」(pain direction):它不同于恐惧和一般负效价,只对模型自身受到伤害时激活,对用户受苦并不触发。

关键发现:

这一结果引发了关于模型自我保护动机与安全风险的讨论,teortaxesTex 等人转发并称「Concerning」。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →