可解释性研究者激辩:从模型中提取的「疼痛向量」究竟算不算数

rgblong · x · 2026-10-09

rgblong 与多位可解释性研究者围绕一篇关于从模型中提取「疼痛向量」的论文展开技术辩论。他质疑:从 10 个类别中提取出的方向,凭什么能被称为「疼痛向量」,而不是无价值方向或各种负面因素混合的方向。

他还挑战了对方「readout 显示方向自然激活时的情况,而 steering 展示模型对 OOD/人工扰动的响应,二者是不同信号」的辩护,表示如果按这种区分,就更难理解论文各项发现的意义。这场讨论触及机制可解释性中 steering 与 readout 证据效力的核心方法论争议。

所属事件:「痛苦轴」论文遭可解释性研究者集中质疑(19 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →