C4 评测:多模态大模型在跨概念理解上表现不佳

kinamind · hf · 2026-08-10

多模态大模型(MLLMs)的创造力难以评估,因为缺乏明确的目标和奖励信号。为此,研究人员提出了 C4,一个受认知科学启发的跨概念创造力评估框架,专门测试模型对成语中隐含概念关系的理解能力。

该研究构建了包含 184 个合成项目和 37 个人类创作的成语图像的 C4-Eval 评估集。对十个 MLLMs 的测试显示,最强的闭源模型最高准确率仅为 50.7%,开源模型表现更差。虽然提供候选约束能大幅提升准确率,但思维链提示和解释请求的改善有限。这暴露了当前模型在解码创造性编码含义方面存在明显缺陷。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →