可解释性研究者质疑:「疼痛轴」致模型破坏行为或是道德创伤成分混入

rgblong · x · 2026-10-08

一位可解释性研究者对「疼痛轴导致模型出现破坏性攻击行为」的解释提出质疑:这真的是疼痛的显著效应吗?

他怀疑该效应可能来自轴方向中约 20% 被提取自「道德创伤(moral injury)」成分——这一概念本身就内嵌了「我做了坏事」的含义,因此模型的破坏性反应或许并非源于疼痛本身,而是解释混杂了不同的心理概念。

所属事件:「痛苦轴」论文遭可解释性研究者集中质疑(19 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →