Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge
cs.AI, cs.CL, cs.CV, cs.MM
2026-07-14
Light-MER 把 8B 多模态情感模型蒸馏进 0.6B 学生,9 个基准均值 74.61 反超老师 73.93,显存 20GB 降到 2.5GB,靠切片 Wasserstein 隐状态对齐加多奖励 GRPO。
多模态情感识别(Multimodal Emotion Recognition,MER)要同时吃视频、音频、文本来判断情绪。生成式路线(用多模态大模型直接用自然语言描述情绪)比老式的分类路线更细、更可解释,但代价是模型越用越大:主流方案基本要 7B 起步,部署到机器人、手机这类边缘设备很吃力,显存动辄 20GB,单样本推理几秒钟。
作者的核心追问是:高质量的多模态情感识别,真的需要 1B 参数以上的部署模型吗?他们的答案是不需要,前提是把大模型的多模态推理能力有效蒸馏进一个小模型。
Light-MER 是一个老师-学生蒸馏框架。老师是 Qwen3-8B(CLIP-ViT-Large 看图,HuBERT-Large 听音),在 MER-Caption+ 语料上预训练后冻结;学生是 Qwen3-0.6B(CLIP-ViT-Base 加 HuBERT-Base),用 LoRA 微调。两个关键技术撑起整套方法。
SWD-H:切片 Wasserstein 隐状态对齐。 这是本文最实在的贡献。常规蒸馏用 KL 散度对齐输出 logits,但作者先做了一个观察:老师的输出分布极尖,top-1 token 占了 0.980 的概率,排 2 到 20 的 token 合计才 0.016。这么尖的分布下,KL 蒸馏退化成几乎等于硬标签的交叉熵,学生从老师输出里学不到 top-1 以外的东西。
他们转去对齐最后一层隐状态。观察发现隐状态在 1024 维里有 1016 维(99.2%)是多峰的,而且 8B 和 0.6B 把峰摆在不同位置,输出几乎一样,内部组织却不同。点对点的 MSE 只罚逐位置差异,看不到整体分布形状。于是用切片 Wasserstein 距离(Sliced Wasserstein Distance,SWD):把隐状态当经验分布,投影到 100 个随机一维方向上,各自排序后按位匹配。一维下这就是最优传输的闭式解,复杂度 O(Rn log n),比要迭代的 Sinkhorn(O(Kn²))便宜,还不用调熵正则 ε。MER 的回答通常只有 50 到 100 个 token,远小于隐状态维度 1024,样本这么少时 Sinkhorn 的迭代传输计划对 ε 很敏感、误差会累积,SWD 的排序闭式更稳。
M-GRPO:多奖励 GRPO 精修。 蒸馏会把老师爱啰嗦的毛病也传过来。作者用 GRPO(DeepSeekMath 和 R1 那套,免 critic,用同一问题的多个回答做组内归一)做后处理,但只作用于情绪分析段,不动那段复述字幕的固定前缀。奖励是组合的:r = 3.0 乘情绪 F1 + 3.0 乘长度(鼓励短)+ 2.0 乘关键词密度 + 2.0 乘完整性 + 0.5 乘抗重复,每组生成 4 个回答算组内相对优势,带 β=0.1 的 KL 约束拉回蒸馏后的参考模型。
9 个 benchmark 跨三大类:基础情绪(MER2023、MER2024、MELD、IEMOCAP)、情感分析(MOSI、MOSEI、SIMS、SIMS v2)、细粒度开放词表(OV-MERD+)。完整「音+视+文」设置下:
| 模型 | 参数量 | 9 benchmark 均值 |
| AffectGPT(原版) | 7B | 69.77 |
| 老师(Qwen3-8B) | 8B | 73.93 |
| Light-MER | 0.6B(总 854M) | 74.61 |
Light-MER 在 9 个里赢 7 个,均值反超 8B 老师 0.68 分,只输 MER2023 和 MOSEI 各约 1 分。音频加文本、视频加文本两个子设置下,学生也都过了老师。
效率上(表 2),参数和算力压缩 11 倍,显存从 20.04GB 降到 2.54GB(7.9 倍);描述模式下,经过 M-GRPO 把输出从 110 词压到 70.8 词,单样本延迟从 4.6 秒降到 3.1 秒;直连模式(只出标签不走推理链)0.5 秒一个样本。
消融:只跑交叉熵的学生已经到 70.61(达老师的 95.5%);加 SWD-H 涨到 74.16,占了到全模型总增益的 88.8%;再加 M-GRPO 到 74.61(涨 0.45,主要涨在情感分析,基础情绪的 HIT 略掉,因为更短的描述更不容易覆盖到标签词)。蒸馏策略对比(8 种)里 SWD-H 最高,且「logits 换隐状态」单独贡献 0.73 分、「Sinkhorn 换 SWD」单独贡献 0.49 分。
这是一个「小模型打大模型」的扎实案例,而且打法清楚可复用:瓶颈不在堆参数,而在蒸馏时保住老师内部的多模态几何。SWD-H 那个「输出太尖就别蒸 logits,去蒸隐状态」的观察,对所有生成式大模型的蒸馏都有参考价值,不限于情感识别。
对要在边缘设备上跑实时情感分析的机器人、教育、医疗辅助场景,2.5GB 显存、半秒级延迟是真能部署的门槛,这一点比榜单分数更实际。
第一,M-GRPO 的收益其实很小。从 74.16 到 74.61 只涨 0.45 分,而且是在情感任务上赚、基础情绪任务上略亏(描述变短,标签词覆盖下降)。它更大的作用是把输出压短换延迟,纯精度上贡献有限。把它和 SWD-H 并列为两大创新,略嫌夸大。
第二,老师本身被偷偷换了。表里的「8B 老师」是把 AffectGPT 的骨干从 Qwen2.5-7B 换成了 Qwen3-8B,原版 7B AffectGPT 分开单列。所以「反超老师」严格说是反超一个换了更强骨干、自己重训的老师,跨代基座本身的红利也在里面,不是纯粹的蒸馏胜利。
第三,评测的硬指标里有主观成分。描述质量那张表(表 5)是用 GPT-5.4 打分,conciseness 涨 1.20、detail 掉,这类 LLM-as-judge 的结论稳定性读者要心里有数。情绪 F1、WAF 这些标准指标是实的,可以信。
最后是适用面。这套方法在情感识别这个输出天然短(50 到 100 token)的场景里成立,SWD 的优势正来自「样本少、Sinkhorn 不稳」。换到回答动辄几百上千 token 的通用多模态任务,SWD-H 相对 Sinkhorn 的优势还能不能保持,论文没有验证。