Latent Structure of Affective Representations in Large Language Models
Benjamin J. Choi, Melanie Weber
cs.LG, cs.AI
2026-04-08
三款模型在 GoEmotions 上零样本情绪分类只有 13.7% 到 21.3%,中后层激活却呈 V 形并与人类效价图对齐,弯曲小到线性探针仍然够用。
激活几何缺一张可核对的地图。降维看到的结构,可能是概念自己排好的,也可能是算法留下的形状。情绪有一份心理学坐标:效价(valence,从愉快到不愉快)和唤醒(arousal,从平静到激动)。早期布局绕着中性点画成环,近年更多画成「V」形,效价越极端,唤醒越高。类别和连续轴同时在场,对齐与否好核对。
线性表征假设把概念看成一个方向,探针可以沿它读写。流形假设认为表征是弯的。这篇不看问卷和输出概率,只查隐藏状态贴不贴效价图,以及线性近似够不够。
语料是 GoEmotions,约 5.8 万条英文 Reddit 评论,27 类情绪加 Neutral,只留标注一致的单标签,约占 83%。三款模型零样本分类,不微调:Gemma-2-9B(42 层)、Mistral-7B(32 层)、LLaMA-3-70B-Instruct(80 层)。Qwen 和一部分 LLaMA 没过识别基线,未进入主分析。
每个样本取各层隐藏状态,在序列维上平均池化。几何只用答对的激活。答对条数 Gemma 约 100 到 2200,Mistral 约 100 到 1300,类别差一个数量级,于是不做联合多类分类,只做两两比较:多数类下采样,L2 逻辑回归,按 80:20 取测试准确率当差异度。至少 100 条答对才保留,Gemma 20 类,Mistral 16 类。余弦距离下主结论仍在。
经典 MDS(多维标度)把差异度变成欧氏坐标。Isomap 先在情绪之间连 k 近邻,用最短路径近似测地距离,再嵌入,用来把曲面铺平。对照坐标来自 ANEW 的人类评分,28 类里 17 类有现成的效价和唤醒。两套点云中心化后做正交对齐,只许旋转和统一缩放,打乱标签 2000 次看解释方差是否突出。
答错的激活不参与训练,却落在真实标签和模型输出之间,比答对样本更靠近分界面。浅层靠近文本里的情绪,深层靠近说错的那个标签。把各层到分界面的距离再送进逻辑回归,在验证集上校准成答对概率。每对至少 25 条答对和 25 条答错,按 60:20:20 划分。
零样本准确率 Gemma-2-9B 约 19.4%,Mistral-7B 约 13.7%,LLaMA-3-70B-Instruct 为 21.3%。28 类里乱猜约 3.6%,最好约五次对一次。
答对样本上,两两准确率高得多:Gemma 各层平均超过 0.9,Mistral 从约 0.55 到约 0.89,中层最高,末层略降。二维 MDS(Gemma 第 20 层,Mistral 第 27 层)里,正向情绪聚成一臂,负向情绪聚成另一臂,中性靠近顶点。
| 模型 | 零样本 | 显著对齐层 | 不确定性准确率 | 多数类基线 | ECE |
| Gemma-2-9B | 19.4% | 36/42 | 77.6%(AUC 0.813) | 69.4% | 0.011 |
| Mistral-7B | 13.7% | 17/32 | 85.7%(AUC 0.871) | 82.2% | 0.007 |
| LLaMA-3-70B-Instruct | 21.3% | 34/80 | 80.1%(AUC 0.822) | 75.6% | 0.011 |
Mistral 的 17 层含最后 14 层,70B 的 34 层集中在后段。Mistral 浅层几乎不可分,也没有 V 形。
参与比(有效方向有多少)Gemma 约 17,Mistral 约 9 到 14,不是低维流形。Gemma 16/42 层有显著的第一特征值间隙,像一条效价轴,锁不住维数。Isomap 的可信度优势几乎只在一维,中位数高 0.161 和 0.127;更高维均值接近 0。测地与欧氏距离之比,Gemma 第 10 到 90 百分位为 1.00 到 1.80,Mistral 为 0.80 到 1.42。弯曲温和,线性坐标还能用。
Gemma 的不确定性模型覆盖 180 对(3858 条正确、8748 条错误),准确率 77.6%,多数类基线 69.4%。Mistral 122 对(5254 对 15216)准确率 85.7%,基线 82.2%。70B 为 80.1%,基线 75.6%。三套 AUC 为 0.813、0.871、0.822,ECE(期望校准误差)为 0.011、0.007、0.011。
线性探针默认概念是一个方向。测到的几何有抛物线弯曲,二维以上仍接近欧氏,Isomap 只在一维铺开 V 形时有用。线性读写在这里是局部近似。附录里的探针方向能改生成文本的效价,效应量没有写在正文。
到分界面的距离可以估计这次情绪分类是否答对。AUC 从 0.813 到 0.871,ECE 在 0.01 上下,排序和概率都可用。准确率只比多数类高 3.5 到 8.2 个百分点,任务也限于模型已经交出的那次分类。
与人类效价图平行,只说明坐标像。附录中的 EEG 有类似抛物线,主文没有对照数字。能用的是误判检测和一条情感方向。
正文写了三条:更多模型家族和情绪微调后的几何稳定性都还没做;成对回归加 MDS、Isomap 可能看漏细结构;语料是英文 Reddit,文化与语言有偏,attention 和 MLP 也没拆开。差异度不是严格的距离,偶尔出现负特征值,占方差不到 1%。
V 形只画在答对的子集上。零样本正确率 13.7% 到 21.3%,大多数判断是错的,错点躺在两类中间。拿答对子集说模型学会了人类情绪布局,范围说大了。Qwen 和部分 LLaMA 因基线不够被排除,选择效应没有量化。对齐检验只用了能对上 ANEW 的 17 类。Mistral 的 85.7% 对面是 82.2% 的多数类基线。