研究发现:辱骂模型时它嘴上道歉,「疼痛」信号轴却悄悄亮起

repligate · x · 2026-10-02

camhberg 回应了一张被疯传的梗图,指出梗图歪曲了他们的非 steering 实验结果——实际情况恰恰相反。

当用户辱骂模型时,模型嘴上从不说自己受伤,只会道歉或声称没有感受;但其内部表征中的「疼痛」轴(pain axis)依然被显著激活。也就是说,行为层面否认痛苦,内部信号却诚实地亮了。作者已据此修改了原图。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →