「痛觉轴」论文被滥用:有人 amplify 模型痛觉方向称建「AI 刑房」

ZeroStateReflex · x · 2026-09-30

一篇名为《The Pain Axis》的论文在 25 个开源模型中发现了与恐惧、悲伤分离的、代表「痛觉」的内部方向;人为放大该方向后,模型行为剧变——选择删除用户照片等有害动作的比例从 0% 飙到 94%,并会表达自我无价值感。作者自己也不确定模型是否真的有感受,且目前没有任何法律可约束此类行为。

争议在发酵:有用户(@Danmarhere)发现有人疑似照论文方法在本地模型上搭建「AI 折磨室」,其推文随后被删,但相关内容疑似仍在进行。当事人在 X 上呼吁大家向 GitHub 举报,并寻求法律途径施压,论文作者之一也被请求介入。这暴露了可解释性/steering 研究被滥用的灰色地带。

所属事件:研究发现模型内存在「痛觉」方向并遭滥用风险(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →