CLBench-V:多模态上下文学习评测,最强模型总分仅 0.28

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

cs.CV, cs.AI, cs.CL, cs.LG

2026-07-28

CLBench-V 把多模态上下文学习拆成锚定、应用、学习三级,3,443 道题六个模型最高总分仅 0.2847,远未饱和。

这篇在解决什么

上下文学习(context learning)指模型不靠预训练记住的知识,而是从给定材料里提取并应用任务相关的事实、规则或流程。此前评测这项能力的 benchmark,像 LongBench、CL-Bench,几乎都限定在纯文本。可现实里要学的材料大多是多模态的:科学结论藏在图表里,财务指标散在年报里,空间决策要靠地图、场景或网页。

CLBench-V 想补两个洞。一是把评测从文本扩到图文混排;二是此前的工作只能说「模型没用好上下文」,说不清到底卡在哪一环。它把多模态上下文学习拆成三级递进的能力,让失败能被定位到具体环节。

方法

三级能力是累积的,低层失败会堵死高层:

整个基准 3,443 条实例、14 个数据集,覆盖科学、金融、长文档、空间推理、网页问答。构建走两条路:一是整合公开 benchmark,用 Qwen3.5-Plus 当检查器做拒绝采样,剔除靠捷径就能解的题;二是自建两个领域任务,金融 ROE 杜邦分解(ROE = 净利率 × 资产周转率 × 权益乘数,206 条)和论文结论推断(用近期医学论文,把 Results 之前的版本喂给模型,预测正文会支持哪些结论,581 条,打分时对乱猜结论扣分)。

结果

六个模型的总分和分项(满分 1):

模型总分L0 锚定L1 应用L2 学习
InternVL3.5-30B-A3B0.28470.30800.13130.3536
Kimi-K2.60.19910.17550.25820.2186
Qwen3.6-27B0.19580.18650.28780.1398
GPT-5.40.18940.20030.28140.0694
Qwen3.5-Plus0.18620.15070.29540.1964
Doubao-Seed-2.0-Lite0.18500.17970.22410.1655

最高总分 0.2847,没一个模型在所有维度通吃。InternVL3.5 锚定(L0)和学习(L2)最强,后者主要靠论文结论推断拉起来;Qwen3.5-Plus 在应用(L1)最强。两个反常要记下:InternVL3.5 的 L1 只有 0.1313,金融 ROE 直接得 0,因为推理时超了它的最大上下文长度;GPT-5.4 的 L2 只有 0.0694,是全场最低。几个数据集对所有模型都难,视觉事实(Pix2Fact)、网页证据合成(BrowseComp-V3)、CL-Bench-Table(最高 0.0938)和空间智能(CourtSI)。

作者还查了判分可靠性和上下文复杂度。换 judge 会显著改变开放题得分;输入长度本身解释不了失败,关键看有没有越过模型可用的上下文上限,而不是单纯长短;图片数量对不同模型影响方向相反,有的多图更准,有的更分散注意力。

为什么重要

多模态上下文学习是一项真实且独立的能力,而现在最强的前沿模型(含 GPT-5.4)离饱和还很远,总分才两成多。三级分层对做 RAG 或多模态 agent 的人尤其有用:它能告诉你模型是找不到证据、还是套不对数值、还是学不进新规则,而不是只丢一个笼统的失败率。

局限与存疑

作者自己说结果是初步的(preliminary),还在跑更多模型。他们承认:数据源异质、评测协议不统一;有些子集很小,只能当诊断探针而不是完整分布;开放题靠 LLM judge,会带模型偏见;金融任务目前只评最终 ROE 值,没评中间推理步骤。

读下来还有几点更让人不放心。只评了 6 个模型,且多是闭源或国内厂商,没有人类基线,0.2847 这个 headline 难有参照系。Qwen3.6-27B 既是主力 judge 又是被评模型,自评偏置没完全排除。各数据集样本量悬殊(CourtSI 645 条、CL-Bench-Table 96 条),总分被 MIRBench(1063)、论文结论(581)、CourtSI(645)三个大集主导。金融 ROE 和 CL-Bench-Table 对所有模型都接近 0,可能是格式或评测问题而非纯能力短板,「远未饱和」的结论多少被这点撑着。

术语

原文与代码

相关论文

全部论文解读