Do LLMs "Feel"? Emotion Circuits Discovery and Control
Chenxi Wang, Yixuan Zhang, Ruiji Yu, Yufei Zheng, Lang Gao, Zirui Song, Zixiang Xu, Gus Xia, Huishuai Zhang, Dongyan Zhao, Xiuying Chen
cs.CL, cs.AI
2025-10-13
定位 LLM 内部稳定的情绪回路,直接调制神经元与注意力头,情绪表达准确率 99.65%,高于提示词与 steering。
用户已经习惯把 GPT-4o 当情绪陪伴,但模型为什么会生成带情绪的文字、输出能不能被稳定控制,一直没有机制层面的答案。已有发现停在信号层面:激活里确实编码了情绪,Tigges 等(2024)证明情绪在激活空间里近似线性方向;控制侧的 steering vector 和提示词工程能用,却是黑盒。更深的尝试也没走通:Tak 等(2025)的逐层修复层间不稳,Lee 等(2025)的「情绪神经元」被遮蔽后输出几乎不变。
这篇把问题拆成三问:LLM 里有没有跨上下文稳定的情绪机制、以什么形式存在、能不能做通用情绪控制。
主实验在 LLaMA-3.2-3B-Instruct 上做,另在 Qwen2.5-7B-Instruct 上复现全流程。
因果验证做得很严:消融证明必要性,分数在 k=2、4 骤降,神经元数再扩大 30 倍也几乎不动,典型长尾;增强实验证明充分性,往 top 组件注入情绪差异向量,提示词不带情绪指令,情绪表征照样被拉起来;随机组件做同样干预几乎无效(10 个种子平均)。
| 方法 | 情绪表达准确率(独立测试集) | surprise 单项 |
| 提示词诱导 | 98.96% | 正文未单列 |
| steering vector(层 11–20) | 91.22% | 67.71% |
| 回路调制 | 99.65% | 100% |
回路调制即把情绪差异向量(λ=1.0)注到电路选中的组件,提示词不含情绪指令,greedy 解码。表征层面:第 9 层起隐状态分出情绪簇,第 12 层时愤怒挨着厌恶、悲伤挨着恐惧,与人的情感直觉一致。六种情绪的电路之间,神经元重叠只有 0.056±0.033,注意力头重叠 0.454±0.047,是「MLP 情绪专属子电路 + 共享注意力通路」的双层结构。
对做可解释性的人,这是把「线性方向」推进到「组件级电路」的完整工作流,每步协议可复用,代码开源。对做生成控制的人,它比 steering 细一层:steering 往残差流塞一个全局向量,这里直接调制具体神经元和注意力头,surprise 从 67.71% 被推到 100%。输出也自然,「Whoa?!」式的感叹从内部冒出来,不靠指令摆拍。陪伴产品、情感支持对话、安全侧压制情绪输出,都是直接应用面。边界也要说清:验证只到 3B 与 7B 开源模型,这是机制可解释性的扎实一步,不支撑对前沿规模的外推。
作者自述三条:只测英文,多语言下是否出现同样回路未知;只覆盖六种基本情绪;回路在微调或迁移学习下稳不稳未验证。另有几处要打折:成败判定靠 GPT-4o-mini 标注(作者做了人工一致性抽查),把主观维度交给 LLM judge,99.65% 可能偏乐观;独立测试集与 SEV 同分布同规模,「跨域泛化」的说法撑不太起。标题里的「Feel」是钩子,全部证据只关于情绪表达的计算机制,与模型是否有主观感受是两回事,拿它论证 AI 能否感到痛苦,超出了论文给出的东西。