CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
cs.CV
2026-08-04
CAPEval 把 caption 评分拆成覆盖率与准确率(300 图、约 5 万原子事实),发现理解任务看覆盖、生成任务看精度,选对模型比堆参数更要紧。
caption 是训练视觉语言模型(VLM)和文生图(T2I)模型的主要监督信号,可一直以来大家用一个标量分数(像 BLEU、CIDEr、CLIPScore)来评它,把两件事搅在了一起:一是这张 caption 覆盖了多少图里的真实信息,二是它声称的内容里有多少站得住脚。这两件事方向不同,该往哪边使劲也说不清。CAPEval 要把它们拆开,看清楚到底是覆盖率还是准确率在驱动下游能力。
CAPEval 用人工写的 ground-truth caption 和人工核验的原子事实清单做基准。300 张高清图,每张 GT caption 约 346 词,拆成约 50 条原子事实(覆盖 8 个语义维度),总共 14965 条已核验事实。每张候选 caption 由被测的 captioner 生成,再用 Qwen2.5-72B 当裁判,分别算:
然后做端到端受控实验:选 10 个 captioner(InternVL3.5 的 1B/4B/8B/38B、Qwen3-VL 的 4B/8B/32B、LLaVA-OV-1.5 的 4B/8B、GLM-4.6V-Flash),只让 caption 来源这一个变量变,各喂进两条 VLM 训练管线(CLIP+Vicuna、SigLIP+Qwen3)和两条 T2I 管线(SD3.5M、Qwen-Image),用 OLS 回归看 C 和 P 分别怎么影响下游。
三条结论:
这是个测量学结论,直接能指导造数据:训 VLM 就去抠 caption 的覆盖率,训 T2I 就去抠准确率,别再盯着单一分数。而且小而准的 captioner 可能比大的更好这条,对控制数据成本有实际意义。它也给评测本身提了个醒:把覆盖和准确率混在一个指标里,会掩盖真正在起作用的那个维度。
作者自己列了几条:n 只有 10 个 captioner,p 值不少是边际显著(0.026、0.124),图只有 300 张,而且全部依赖 Qwen2.5-72B 这个裁判,裁判自身的偏好会渗进来。还有一处:回归用的是线性 OLS,覆盖率和准确率之间如果有交互或非线性关系(比如覆盖率到了某个阈值才开始有害),这个模型看不出来。另外端到端实验固定了下游架构,换成别的训练配方结论是否还成立没验证。