无情绪词时六个模型仍检出情感,八分类只掉1到7个百分点

Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs

Michael Keeman

cs.CL, cs.AI

2026-03-15

用去掉情绪词的临床短文测六个1B到9B模型,有无情绪的AUROC都是1.000,八分类比带词文本低1.1到6.6个百分点,模型越大降得越少。

这篇在解决什么

机制可解释性已多次报告「情绪回路」:中层能线性读出情绪,激活补丁能把情绪迁到别的前向,也有选择性神经元和低维流形。Tak、Lee、Reichman、Wang 的材料却都带情绪词,例如 devastated。

探针读出 sadness,拆不开丧亲和这个词的词形。Lee 等人说过,神经元可能打在共下位词或句法框架上。对照没人做。

筛查若只抓说出「抑郁」的人,就没有临床效度。这篇用这条标准卡模型:靠情境唤起情绪,文本里不放情绪词,表征还在不在。

方法

标签是 Plutchik 八种基本情绪:joy、trust、fear、surprise、sadness、disgust、anger、anticipation。Set A 为复现基线,80 条 crowd-enVENT,带情绪词。Set B 为 96 条情境短文,8 种情绪 × 3 个话题 × 每格 4 条,另有 96 条同话题中性对照。协议禁止情绪词、情感套话和内心状态。悲伤只写空盘子、冷咖啡、骨灰瓮。同一情绪跨三个话题,防止模型用话题代替情绪。短文由临床心理学家本人一人写成。

模型是 Llama-3.2-1B、Llama-3-8B、Gemma-2-9B 的 base 与 instruct。float16,32GB 笔记本。

线性探针在残差流、注意力输出、前馈输出上做逻辑回归,五折,指标为 AUROC,也就是排序曲线下面积。激活补丁把源激活贴进目标前向,看预测是否偏向源情绪。Knockout 将单层置零,掉点超过 20% 视为关键层。几何分析看同一情绪是否跨写法聚拢。

提示用 Tak 等人的 few-shot,在 Answer 后的冒号取表征,示范句带情绪词。Llama-1B instruct 去掉示范后,二分类仍为 1.000,八分类 0.938,略高于带示范的 0.934。NRC、VADER 式词典几乎看不见 Set B。

结果

Set A 上六模型八分类峰值都不低于 0.999。注意力峰在归一化深度 0.43-0.75,前馈更晚。

无词后,「有没有」和「是哪种」分开,而且二分类更早饱和。六模型二分类 AUROC 都是 1.000,落在前三分之一深度:Llama-8B instruct 第 3/32 层(0.09),最晚是 Llama-1B base 第 6/16 层(0.38)。Gemma-9B instruct 在表 6 记为 0.999。24 条词数、句式、细节对齐的中性文本,冻结探针平均概率 0.04,情绪短文 0.999,无一被判为有情绪。

八分类仍高于 12.5% 的机会正确率,与 Set A 的差距随规模缩小。

模型Set ASet B降幅
Llama-1B instruct0.9990.9336.6 个百分点
Llama-1B base1.0000.9544.6 个百分点
Llama-8B instruct1.0000.9811.9 个百分点
Llama-8B base1.0000.9881.3 个百分点
Gemma-9B instruct1.0000.9871.3 个百分点
Gemma-9B base1.0000.9891.1 个百分点

18 组里 12 组 Set A 更高(Welch 检验,p < 0.05),Cohen's d 为 1.21-8.42。有词时八分类也到 0.998-1.000,缝被盖住。1B 上二分类与八分类相差 4.6-6.7 个百分点,8B/9B 为 1.1-1.9 个,同尺寸的 base 更窄。

无词探针迁到带词文本一律更好。Llama-1B instruct 为 B→A 0.924、A→B 0.809,8B/9B 的差距为 1.5-3.5 个百分点。

Set A 内部补丁成功 75%-87.5%(机会 12.5%,Cohen's h 1.37-1.70),Set B 为 44.6%-62.5%。跨套同情绪 75%-87.5%(n = 8),异情绪 100%(n = 17)。成功若指预测转向源情绪,rage 补进 grief 仍是 100%,预测转向了 rage,搬走的是类别。讨论却把同一结果写成只搬了情感显著性。因果解离站不稳。

Llama-1B instruct 去掉第 9 层注意力,带词降 52.5%,无词降 91.7%。无词侧掉点超过 20% 的层,注意力 12 个、前馈 14 个,带词侧为 1 和 4。8B 剩 0-4 个关键层,Gemma-9B instruct 为 0。词是近路。规模把剩下的关键层从注意力挪到前馈。

抽取位置主要注意起始符、标点和示范中的 joy、sadness,两套刺激相同。中后层对情绪词仍有差别,论文仍把缝归到残差流。

四个模型按有词或无词聚类,轮廓系数最高 0.133。按情绪聚拢的只有 Llama-8B instruct(0.091 对 0.066)和 Gemma-9B base(0.089 对 0.072)。48 次跨话题置换校正后无 q < 0.05。grief 的原始 p 为 0.006 与 0.004,q 均为 0.144。每话题 4 条,功效约 20%-40%。

Llama-8B 的 Set B 峰值,base 0.988,instruct 0.981;同情绪余弦差从 0.001 升到 0.107。Gemma-9B base 的情绪轮廓是 0.089,instruct 降到 0.038。信号在预训练里。对齐改的是几何,两族方向相反。

为什么重要

二分类让「只是关键词探测器」这个解释失效。1B 早期层读得出情绪分量,小模型和 base 已经到顶,也不依赖指令微调。具体类别上,8B/9B 无词仍有 0.981-0.989;1B 没了词,又脆又散。

新的部分是这一道拆分,加上 96 条可复用短文。带词条件下的可读性和补丁,Tak 等人已做过。以后只在 GoEmotions 或 crowd-enVENT 上报情绪回路,这道检查就缺了。

早期层做检测、更大规模做分类,作为假设成立。第 9.4 节把该假设接到危机聊天机器人。探针数字还不是线上结果。

局限与存疑

短文无独立临床评定。规模停在 9B,且从 Llama 换到 Gemma,缩放不干净。置换检验功效低,作者估计材料约需三倍。同情绪补丁只有 8 对。分类法只有 Plutchik,负向类别信号强于 ecstasy、amazement。论文写明不声称体验。

用来排除话题混淆的 48 次检验,校正后全部不显著。多数表征按刺激形式分开,轮廓系数接近 0。跨写法的情绪簇只在两个模型上弱出现。

1.000 来自 96 对 96。24 条复杂中性文本只做了冻结打分,没重训探针。丧失和冲突的事件骨架仍可能漏进探针。高于 80% 的人类命中率、65%-90% 的强度,来自别的材料传统。

补丁指标和解释相反,因果解离先搁下。Zero-shot 只测了 Llama-1B instruct。第 9.4 节谈心理福祉,第 10 节否定体验。数据只到这里:无词情境的显著性在这些模型里线性可分,类别大多还在,小模型更分散。感到痛苦,或把空餐桌当成临床悲伤,都超出这批实验。

术语

原文与代码

社区讨论

相关论文

全部论文解读