因果推理图当思维链,多模态幽默理解最高相对提升约20%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

cs.CL, cs.CV

2026-08-24

CaRGo-T让VLM先把图文笑点写成代码形式的因果图再作答,幽默理解相对基线提升约1%–20%,检测只高1%–3%,讽刺检测准确率仍在45%上下。

这篇在解决什么

讽刺图、梗图、图文讽刺靠的是实体、事件和隐含关系之间的错位,线性思维链经常把它们压成一句字面描述。已有评测显示,即便是强 VLM,对讽刺、反讽、梗图也经常认错情绪、漏掉物件和动作的冲突。CoT 在主观、带情绪的题目上容易塌回先验,自反思又会写出对不齐画面的理由。缺的是一种能把「谁导致了什么」显式写出来、再据此作答的中间表示。

方法

CaRGo-T(Causal Reasoning Graph-of-Thought)让模型先生成一份代码风的因果推理图,再给最终答案。图是因果图的一个瘦子集:只保留因果边,外加对象、概念、事件、参与者的轻量属性,没有概率参数。例子:为了时髦穿上高跟鞋,高跟鞋导致脚不舒服。提示把任务拆成两步:先出 Code,再出 Final Answer。

零样本直接要模型写图。ICL 则从训练集抽样本,用 GPT-4o 按标准答案草拟图,再人工改成统一结构:列出实体与属性,再列出因果对。测试时把 K 个改过的例子塞进提示。模型不训练,只推理。对比 Vanilla、CoT、CoD(Chain-of-Draft)、CCoT(把场景图塞进提示)。理解任务用 BLEU、ROUGE-L、BERTScore 及其平均;检测用 Accuracy 和 macro-F1。骨干是 GPT-4o、GPT-4o-mini 和 MiniCPM-V-2.6。数据集:YesBut 讽刺理解 1079 张、MemeCap 559、YesBut 讽刺检测 2541、MMSD 2.0 讽刺检测 2409。

结果

理解任务上 CaRGo-T 经常是同模型最优,绝对分仍然低,增益高度依赖对照。

设置Vanilla AvgCoT AvgCaRGo-T Avg
MiniCPM 0-shot 讽刺0.34550.34570.3504
GPT-4o-mini 0-shot 讽刺0.33720.30430.3632
GPT-4o 0-shot 讽刺0.35710.33370.3726
GPT-4o 2-shot 讽刺0.36020.35510.3911
GPT-4o 5-shot MemeCap0.32660.33280.3461

相对 CoT,GPT-4o-mini 零样本讽刺平均分的升幅接近论文所说的约 20% 上限;相对 Vanilla 只有几个点。加 shot 有收益递减:GPT-4o 相对 CoT 的升幅从 0-shot 11.66% 收到 5-shot 5.86%。检测端更薄。GPT-4o 在 MMSD 2.0 上 0-shot 准确率 49.48%(CoT 48.07%),YesBut 讽刺检测 43.18%(CoT 42.7%),F1 只高零点几个点。二分类准确率停在 50% 附近,这个任务对当前 VLM 仍然很难。

信息分析在 MiniCPM 零样本讽刺理解上做:CaRGo-T 的推理词分布相对 CoT/CoD 的 KL 略高或持平,句子覆盖 LSF 显示它带了更多新语义。GPT-4 当裁判,能从推理推出标准答案的比例:CaRGo-T 45.11,CoT 40.78,CCoT 37.64。

为什么重要

这是推理格式上的渐进改进,不是幽默理解被打穿。把因果图序列化成代码,等于逼模型先点名实体再连因果,对 GPT-4o-mini 这种会写代码、参数知识又没 GPT-4o 厚的模型更有用。想在梗图、讽刺、内容审核上挤一点理解质量,可以当一种零训练的提示骨架来试。别指望检测准确率因此过关。

局限与存疑

没有 Limitations 节。幽默理解的主指标是 BLEU/ROUGE/BERTScore,BERTScore 普遍在 0.85–0.88,对任何通顺英文都高,区分度主要来自很小的词面重叠。检测准确率在 43%–50%,提升 1%–3% 在这种基数上要非常小心。ICL 图依赖人工改写,扩展成本高。零样本几乎只用闭源模型,因为开源 VLM 写代码更弱。没有人类偏好评测「解释好不好笑点」。因果图由同一 VLM 生成,不是 identifiability 意义上的因果发现,叫 causal 更多是图的形状。

术语

原文与代码

相关论文

全部论文解读