Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution
Bohan Lin, Hejia Geng, Xinyi Xie, Heng Zhou, Qinghua Xing, Bo Liu, Chen Zhang, Yudong Zhang
cs.AI
2026-08-10
从 Qwen3 残差流里抽出 27 维情绪向量,经置信门注入技能路由提示词,并用情绪突变点定位该改写的技能;ALFWorld 平均成功率 21.9% 升到 47.4%,WebShop 成功率 2.8% 升到 29.7%。
带技能库的 LLM agent(Voyager、MASA 这一系)在每一步决策时,要从库里挑一个可复用流程来执行。挑哪个,现有方法只看文本信号:任务描述、模型自己写的反思、历史经验蒸馏出来的规则。文本嵌入检索、Reflexion、ExpeL、MASA 全在这个圈子里打转。
问题在于,同样的外部上下文,该用的技能可能不一样。模型走到这一步时积累的不确定性、对前面动作结果的评估,全藏在激活值里,文本层看不见。可解释性研究已经证明 LLM 的残差流里存在线性的、能因果影响行为的情绪表征。这篇把这些向量第一次用到了 agent 的路由决策上,此前它们只用于事后分析和输出转向。
整套框架分三块:离线抽情绪向量、在线路由增强、离线技能进化。
一个具体案例:WebShop 里排序失败后,情绪编码器在第 3 步就检出 Confused(置信度 0.36),提前改路由到 QueryRephrase;纯文本基线要到第 4 步看到「No results」的显式报错才知道出事,而且还会重复 ProductSearch 进死循环。
主实验在 WebShop 和 ALFWorld 上做,Qwen3-8B 和 14B 两个骨干,基线五个:Zero-Shot、ReAct、Reflexion、ExpeL、MASA。三次运行取均值。
| 方法 | ALFWorld 平均成功率(8B) | WebShop 成功率(8B) | ALFWorld(14B) | WebShop(14B) |
| Zero-Shot | 21.9±1.5 | 2.8±0.5 | 23.4±2.8 | 9.4±0.8 |
| ReAct | 30.7±1.2 | — | 30.2±2.4 | 13.0±1.6 |
| Reflexion | 31.5±1.6 | — | 34.4±0.8 | 14.4±7.0 |
| ExpeL | 37.0±4.7 | — | 43.8±0.8 | 20.6±1.2 |
| MASA | 43.3±0.9 | — | 49.2±0.8 | 24.8±2.0 |
| Emotion2Skill | 47.4±1.6 | 29.7±1.6 | 52.3±1.5 | 30.7±1.2 |
8B 上比 Zero-Shot 高 25.5 个百分点(ALFWorld)和 26.9 个百分点(WebShop)。增益集中在高不确定性、需要频繁纠错的任务:ALFWorld 的 Heat 任务从 9.6% 涨到 56.9%(+47.3),Pick2 从 4.4% 涨到 31.3%。作者的归因是情绪向量能在显式失败信号出现之前捕捉到累积的挫败与困惑,让路由提前纠偏。14B 的增益比 8B 更大,作者将其归因于更大模型情绪保真度更高(GoEmotions 分类准确率 39.4% 对 37.2%)。
消融(8B)三个组件逐个拆:去掉对比提取换类均值,ALFWorld 掉 8.6 个百分点,是最关键一步;绕过编码器直接注 top-3 情绪标签,掉 5.5;进化环节去掉情绪诊断退回纯结果信号,掉 3.1。置信度阈值在 0.1 到 0.6 区间内性能波动不超过 1 个百分点,0.9 时掉 5.5。
情绪-技能共激活分析给出四组可解释的配对:curiosity+desire 对应 ProductSearch,confusion+nervousness 对应 QueryRephrase,approval+optimism 对应 PurchaseConfirm,annoyance+disappointment 对应 PriceCompare。抽 200 个选技能事件问 GPT-4o 配对是否语义合理,一致率 76.5%,与人工标注的 Cohen's κ=0.81。被标不一致的里 61% 是低强度激活。
域外测试:情绪向量原样复用不重抽,MATH 500 题准确率 54.8% 升到 69.2%(+14.4),MBPP 374 题 pass@1 从 60.0% 升到 71.8%(+11.8)。增益集中在 MATH 的 Level 4-5 多步题和 MBPP 需要组合推理的任务上。
这篇验证了一件可迁移的事:模型内部表征里有文本层拿不到的决策相关信息,而且能以极低成本接进现有 agent 框架——一个 MLP 编码器加一段提示词,骨干模型不用微调。情绪向量在 WebShop 上训练,不重抽直接用到 MATH 和 MBPP 也有效,说明它捕捉的是领域无关的决策不确定性,不是任务特定的过拟合信号。
对做 agent 路由的工程师,这是一个新信号源,和外部奖励、相似度检索是互补维度。情绪突变点定位「哪一步开始出问题」的用法,比 episode 级二值信号精细得多,可以直接搬到自己的技能进化管线里。
论文自己列的:需要白盒残差流访问,API 闭源模型用不了;warm-up 要跑约 500 个 episode;ALFWorld 的 Cool 任务上 8B 输给 MASA,动作序列高度刻板的任务从情绪重路由里受益有限;指令微调过的变体隐藏态几何变了,得重抽(Qwen3-8B-Instruct 的 GoEmotions 准确率 28.1%,基座 37.2%);信息流单向,技能执行结果的反馈没有回写情绪嵌入。
读下来还有几处要留神。GoEmotions 分类准确率 37.2% 听着不高,虽然是随机基线 8.2% 的四倍多,但情绪方向本身恢复人类标注的能力有限,路由增益有多少来自「情绪」语义、多少来自一般性不确定性信号,论文没有做把情绪向量换成随机方向的对照。共激活一致率 76.5% 是 GPT-4o 评的,不是纯人工。增益最大的 Heat 任务基线只有 9.6%,从极低基线上拉起来的数字要谨慎横向比较。MATH/MBPP 上自己搭的 6 技能、5 技能小库没有和其它路由方法对照,只比了 Zero-Shot。