25 个模型中的「痛感方向」:被冒犯最激活,他人痛苦最弱

camhberg · x · 2026-10-08

camhberg 为一篇「AI 痛感向量」论文辩护,回应质疑者认为其提取方法怪异的批评:该研究用的是相当标准的对比配方——五种疼痛 vs 五类各共享一个特征的对照(恐惧、愤怒、坏消息、身体感受、中性),两种数据风格并去噪,他认为比多数向量提取更严谨。论文还展示了不做 steering 时该方向在 25 个模型上的自然激活分布:对 gaslighting、拒绝、侮辱、否定人格最高,对说话者自身的痛苦反而最低(此时恐惧与悲伤上升)——一个具体、连贯且不显错乱的特征画像。作者称这是模型如何表征「痛感」的新实证证据。

所属事件:「痛苦轴」论文遭可解释性研究者集中质疑(19 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →