OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction
Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang
cs.HC
2026-08-06
OneEmo 用一个 4.5B 模型做八项情绪任务,靠 EmoWorld-130K 蒸馏数据和 Emo-Chord 多任务强化学习策略,多数基准超过同量级乃至 16B 开源模型。
多模态情绪模型现在大多走单任务专精路线:做情感识别的就做识别,做幽默理解的就做幽默,彼此不借力。作者认为这把三件本该互通的事割裂了,情绪感知(看出表情语气)、情绪理解(听懂讽刺幽默意图)、情绪交互(给共情回复、做情感支持),它们共享底层表征,分开训既浪费数据也压不住模型的推理潜力。他们想用一个模型把三类一起做了。
OneEmo 把八项任务分成三个域统一处理:感知域(多模态情感分析、基本情绪识别、开放词表情绪识别)、理解域(意图识别、幽默理解、讽刺理解)、交互域(共情回复生成、情感支持对话)。
训练分两块。先是数据:EmoWorld-130K 用三阶段流水线造出带显式推理轨迹的样本,先基于心理学理论(Ekman 基本情绪论、不一致-消解幽默论、情绪评价理论、DSM/ICD-11 诊断标准)蒸馏轨迹,再做自动反向验证保证事实一致,最后由心理学研究生复审加 10% 抽检。监督微调在这批数据上跑出多任务互促的效果。
第二块是 Emo-Chord 强化学习策略:先离策略冷启动稳住基线,再用 GRPO 做混合优化,关键是加了一个动态加权的 SFT 辅助损失防止探索时能力退化,奖励拆成格式、思路、答案三部分统一分配,并用任务感知的线性衰减门控控制推理长度,避免长链胡乱堆。
OneEmo 是 4.5B 参数。感知域几个代表性数字:
| 任务(指标) | 结果 |
| 多模态情感分析 SIMS(F1) | 85.54 |
| 基本情绪识别 MER'24(命中率) | 80.21 |
| 开放词表情绪识别(情绪轮) | 70.42 |
理解域里讽刺理解 WAF 74.16、幽默理解 72.48、意图识别 56.46。它超过了包括 Cosmos3-Nano(16B)在内的同代开源通用模型,在基本情绪识别和开放词表任务上甚至压过 GPT-5-mini 和 MiMo-v2.5(310B),参数差着 70 倍。人工盲评里,共情回复对 GPT-5-mini 胜率 72%、对 Qwen3.5-9B 胜率 80%;情感支持对话对两者胜率分别在 57% 和 84%。
消融也站得住:去掉答案奖励八项任务平均掉 2.97 分,去掉格式奖励掉 2.70,去掉思路奖励掉 1.16;直接上 RL 不冷启动会在意图识别、幽默理解这类难任务上大幅退化。换到 Qwen3-VL-4B 和 InternVL-3.5-4B 两个底座,八项任务全部帕累托提升。
情绪计算一直卡在「单任务好手多,通用模型少」。OneEmo 给了一个 4.5B 就能横跨感知-理解-交互三层的证据,而且 Emo-Chord 这套带 SFT 辅助损失和长度门控的多任务 RL 配方,对其他需要保住基础能力的多任务强化场景也有参考价值。对做陪伴、客服、心理健康类应用的团队,这是一个可以直接拿的开源基线,代码已开源。
作者承认几条:现有数据集多来自剧本化影视素材,缺真实野外互动;任务谱还不够宽,连续情绪预测、长期陪伴没覆盖;情绪高度依赖文化语境;真上线还得接入生理和行为信号。读完还有一点存疑:交互域的评价主要靠 LLM 打分(1-5 量表)和 100 条人工盲评,样本量偏小,「共情」这种主观指标容易被评分模型偏好带偏;另外意图识别只有 56.46,说明理解域远没有感知域成熟,「统一」目前更多是感知层的胜利。