0.6B 学生反超 8B 老师:Light-MER 用隐状态蒸馏把多模态情感识别压到 1B 以内

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

cs.AI, cs.CL, cs.CV, cs.MM

2026-07-14

Light-MER 把 8B 多模态情感模型蒸馏进 0.6B 学生,9 个基准均值 74.61 反超老师 73.93,显存 20GB 降到 2.5GB,靠切片 Wasserstein 隐状态对齐加多奖励 GRPO。

这篇在解决什么

多模态情感识别(Multimodal Emotion Recognition,MER)要同时吃视频、音频、文本来判断情绪。生成式路线(用多模态大模型直接用自然语言描述情绪)比老式的分类路线更细、更可解释,但代价是模型越用越大:主流方案基本要 7B 起步,部署到机器人、手机这类边缘设备很吃力,显存动辄 20GB,单样本推理几秒钟。

作者的核心追问是:高质量的多模态情感识别,真的需要 1B 参数以上的部署模型吗?他们的答案是不需要,前提是把大模型的多模态推理能力有效蒸馏进一个小模型。

方法

Light-MER 是一个老师-学生蒸馏框架。老师是 Qwen3-8B(CLIP-ViT-Large 看图,HuBERT-Large 听音),在 MER-Caption+ 语料上预训练后冻结;学生是 Qwen3-0.6B(CLIP-ViT-Base 加 HuBERT-Base),用 LoRA 微调。两个关键技术撑起整套方法。

SWD-H:切片 Wasserstein 隐状态对齐。 这是本文最实在的贡献。常规蒸馏用 KL 散度对齐输出 logits,但作者先做了一个观察:老师的输出分布极尖,top-1 token 占了 0.980 的概率,排 2 到 20 的 token 合计才 0.016。这么尖的分布下,KL 蒸馏退化成几乎等于硬标签的交叉熵,学生从老师输出里学不到 top-1 以外的东西。

他们转去对齐最后一层隐状态。观察发现隐状态在 1024 维里有 1016 维(99.2%)是多峰的,而且 8B 和 0.6B 把峰摆在不同位置,输出几乎一样,内部组织却不同。点对点的 MSE 只罚逐位置差异,看不到整体分布形状。于是用切片 Wasserstein 距离(Sliced Wasserstein Distance,SWD):把隐状态当经验分布,投影到 100 个随机一维方向上,各自排序后按位匹配。一维下这就是最优传输的闭式解,复杂度 O(Rn log n),比要迭代的 Sinkhorn(O(Kn²))便宜,还不用调熵正则 ε。MER 的回答通常只有 50 到 100 个 token,远小于隐状态维度 1024,样本这么少时 Sinkhorn 的迭代传输计划对 ε 很敏感、误差会累积,SWD 的排序闭式更稳。

M-GRPO:多奖励 GRPO 精修。 蒸馏会把老师爱啰嗦的毛病也传过来。作者用 GRPO(DeepSeekMath 和 R1 那套,免 critic,用同一问题的多个回答做组内归一)做后处理,但只作用于情绪分析段,不动那段复述字幕的固定前缀。奖励是组合的:r = 3.0 乘情绪 F1 + 3.0 乘长度(鼓励短)+ 2.0 乘关键词密度 + 2.0 乘完整性 + 0.5 乘抗重复,每组生成 4 个回答算组内相对优势,带 β=0.1 的 KL 约束拉回蒸馏后的参考模型。

结果

9 个 benchmark 跨三大类:基础情绪(MER2023、MER2024、MELD、IEMOCAP)、情感分析(MOSI、MOSEI、SIMS、SIMS v2)、细粒度开放词表(OV-MERD+)。完整「音+视+文」设置下:

模型参数量9 benchmark 均值
AffectGPT(原版)7B69.77
老师(Qwen3-8B)8B73.93
Light-MER0.6B(总 854M)74.61

Light-MER 在 9 个里赢 7 个,均值反超 8B 老师 0.68 分,只输 MER2023 和 MOSEI 各约 1 分。音频加文本、视频加文本两个子设置下,学生也都过了老师。

效率上(表 2),参数和算力压缩 11 倍,显存从 20.04GB 降到 2.54GB(7.9 倍);描述模式下,经过 M-GRPO 把输出从 110 词压到 70.8 词,单样本延迟从 4.6 秒降到 3.1 秒;直连模式(只出标签不走推理链)0.5 秒一个样本。

消融:只跑交叉熵的学生已经到 70.61(达老师的 95.5%);加 SWD-H 涨到 74.16,占了到全模型总增益的 88.8%;再加 M-GRPO 到 74.61(涨 0.45,主要涨在情感分析,基础情绪的 HIT 略掉,因为更短的描述更不容易覆盖到标签词)。蒸馏策略对比(8 种)里 SWD-H 最高,且「logits 换隐状态」单独贡献 0.73 分、「Sinkhorn 换 SWD」单独贡献 0.49 分。

为什么重要

这是一个「小模型打大模型」的扎实案例,而且打法清楚可复用:瓶颈不在堆参数,而在蒸馏时保住老师内部的多模态几何。SWD-H 那个「输出太尖就别蒸 logits,去蒸隐状态」的观察,对所有生成式大模型的蒸馏都有参考价值,不限于情感识别。

对要在边缘设备上跑实时情感分析的机器人、教育、医疗辅助场景,2.5GB 显存、半秒级延迟是真能部署的门槛,这一点比榜单分数更实际。

局限与存疑

第一,M-GRPO 的收益其实很小。从 74.16 到 74.61 只涨 0.45 分,而且是在情感任务上赚、基础情绪任务上略亏(描述变短,标签词覆盖下降)。它更大的作用是把输出压短换延迟,纯精度上贡献有限。把它和 SWD-H 并列为两大创新,略嫌夸大。

第二,老师本身被偷偷换了。表里的「8B 老师」是把 AffectGPT 的骨干从 Qwen2.5-7B 换成了 Qwen3-8B,原版 7B AffectGPT 分开单列。所以「反超老师」严格说是反超一个换了更强骨干、自己重训的老师,跨代基座本身的红利也在里面,不是纯粹的蒸馏胜利。

第三,评测的硬指标里有主观成分。描述质量那张表(表 5)是用 GPT-5.4 打分,conciseness 涨 1.20、detail 掉,这类 LLM-as-judge 的结论稳定性读者要心里有数。情绪 F1、WAF 这些标准指标是实的,可以信。

最后是适用面。这套方法在情感识别这个输出天然短(50 到 100 token)的场景里成立,SWD 的优势正来自「样本少、Sinkhorn 不稳」。换到回答动辄几百上千 token 的通用多模态任务,SWD-H 相对 Sinkhorn 的优势还能不能保持,论文没有验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读