GPT-5.5 只解出一半:新基准用成语跨概念解码给多模态模型出难题

Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

Ming Wang, Yuqing Zhang, Tingna Xie, Xiangju Li, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang

cs.AI, cs.CL, cs.MM

2026-08-07

用成语跨概念替换造 221 道看图猜成语题,最强模型 GPT-5.5 仅答对 50.7%;给候选答案准确率大涨,瓶颈是开放检索,不是看图。

这篇在解决什么

多模态大模型(MLLM)的创造力一直难评:开放性任务没有标准答案,没法像算准确率那样打分。这篇挑了一个能精确打分的创造力子能力,跨概念理解。它的原型是中文世界熟悉的「看图猜成语」:出题人把成语里的字,沿着谐音、字形、语义、文化典故等联想路径,替换成别的能画出来的概念(比如把「叶」换成「椰」),画成图;解题人要从这些被挪用的视觉线索,反过来还原出原成语。题目有唯一正确答案,联想路径也人工标注过,于是创造力第一次变得可批量、可打分、可分层。作者把它形式化成「编码」(出题替换)和「解码」(看图还原)两个方向,并造了一套基准 C4-Eval。

方法

基础是一张人工标注、第三方复核的「成语跨概念网络」:47 个成语、168 个可替换字位、758 条去重联想桥。出题时固定一个成语,选若干不重叠字位,沿桥路径把字换成图像化的替身,再生成图片(目标成语本身不出现在图里)。难度由桥的数量和深度定义:L1 一个字位一步桥,L2 两个字位各一步,L3 两字位其一加深,L4 两字位都加深。

C4-Eval 含 184 道合成题(L1 至 L4)加 37 张网上收集的真人创意图,覆盖 84 个成语,共 884 个主评分作答场景。每道题以五种设置呈现:T1 只给图自由作答,T2 加一句跨概念提示,T3 给含答案的四选一,T4 自由作答加结构化解释,T5 给出答案只让模型解释(不计分)。

结果

十个多模态模型(五个 API、五个本地)。最强闭源 GPT-5.5 主准确率 50.7%,Kimi-K2.6 是 48.0%;开源最好的 GLM-4.1V-9B 只有 18.1%,离闭源差一大截。

模型T1 只看图T3 四选一主准确率
GPT-5.535.787.350.7
Kimi-K2.632.685.548.0
GLM-4.1V-9B(开源最强)5.053.418.1

最有信息量的是各任务之间的落差。给四选一候选(T3)后,准确率比三种开放设置(T1/T2/T4)的平均值高出 17.3 到 56.0 个百分点。图里的视觉线索其实够用,模型能在一小撮候选里认出答案,问题出在「开放检索」这一步。桥提示(T2)只列出可能的联想类型、不点明具体线索,帮助很小。难度上,字位数量比桥深度影响大得多:从 L1 到 L2(加一个字位)的准确率跌幅,约是 L2 到 L3(加深一层)的三倍,再深几乎没有额外难度。

221 道题里有 83 道在所有开放设置下没有任何模型解出;即便给了候选,仍有 6 道全军覆没。

为什么重要

这是一个少见的、创造力被变成可精确打分题目的基准。结论对做 MLLM 评测和训练的人都有用:当前模型看得懂图里的线索,卡在无法把线索在开放的成语空间里反推回去。「接得住但想不出」是可以被单独测量和针对性改进的短板。对中文场景,成语只是载体,这套跨概念编码和解码框架可以换到其它「有唯一答案的创意表达」上。

局限与存疑

载体高度依赖中文成语,文化绑定强,跨语言、跨文化泛化未验证。题目靠 GPT Image 2 生成的合成图,视觉风格单一,真实人类创意图的复杂度只用了 37 张代表。开放检索的瓶颈到底更接近「知识检索失败」还是「联想推理失败」,两者在 T3 里被合并掩盖了,论文没拆开。基准只有 221 道题、84 个成语,规模偏小,头部模型之间的细微差距统计上稳不稳没给置信区间。

术语

原文与代码

相关论文

全部论文解读