C4 评测:多模态大模型在跨概念理解上表现不佳
kinamind · hf · 2026-08-10
多模态大模型(MLLMs)的创造力难以评估,因为缺乏明确的目标和奖励信号。为此,研究人员提出了 C4,一个受认知科学启发的跨概念创造力评估框架,专门测试模型对成语中隐含概念关系的理解能力。
该研究构建了包含 184 个合成项目和 37 个人类创作的成语图像的 C4-Eval 评估集。对十个 MLLMs 的测试显示,最强的闭源模型最高准确率仅为 50.7%,开源模型表现更差。虽然提供候选约束能大幅提升准确率,但思维链提示和解释请求的改善有限。这暴露了当前模型在解码创造性编码含义方面存在明显缺陷。
「研究」频道最新
- ChatGPT 协助代数拓扑研究,复活冷门前沿领域 — AlexKontorovich · 2026-08-10
- 吐槽Yann LeCun生成式建模理念:过度沉迷表征学习 — kalomaze · 2026-08-10
- 开源自主实验室框架 OpenSDL,用 Python 搭建全自动化科研环境 — w1kke · 2026-08-10
- 腾讯 VerseCrafter:支持 4D 几何控制的动态视频世界模型 — tom_doerr · 2026-08-10
- NeurIPS 2026 PTA 研讨会征稿:聚焦预训练到智能体决策 — GeorgiaChal · 2026-08-10
- RLHF 默认对齐,RLVR 沦为回形针工厂? — saurabh_shah2 · 2026-08-10