研究者质疑痛苦探针可能测的是模型与用户痛苦之差

rgblong · x · 2026-09-23

围绕一项关于模型"痛苦"内部表征的探针研究,研究者 @agitbackprop 提出这可能是测量伪影:探针的拟合方式或许测的是「模型痛苦减去用户痛苦」,而非模型自身的痛苦。rgblong 进一步质疑:"negative world state" 作为探针用来区分的对照组之一,却包含他人受苦的句子,这显得很奇怪。这条回复指出了对照组设计的潜在混淆。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →