让模型答图表题时每步都框出相关区域,7B 反超 GPT-4o

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

cs.CV, cs.AI, cs.CL

2026-08-04

把图表问答拆成「边推理边框选相关区域」的课程训练,Qwen2.5-VL-7B 在合成基准 CCQA 上比 GPT-4o 高 12 个点,真实基准 CharXiv 也涨 4 个点。

这篇在解决什么

图表问答(Chart Question Answering, CQA)让多模态大模型读一张图、回答关于数据的问题。听起来简单,实际很卡。作者先用 GPT-4o 在 60 道 CharXiv 题上做了个对照,把问题暴露出来:直接答题只有 43.3% 正确率;给它人工标好的图中关键信息(把该看的值直接喂进去),升到 61.7%;让它先写推理过程再答题,53.3%;两者都给,86.7%。

这个对照说明两件事:一是 GPT-4o 自己「看不准」图里的值,二是它「想不清」该按什么顺序算。把视觉线索和分步推理都补上,正确率几乎翻倍。CURV 想做的,就是把这两个外挂(人工喂视觉信息、提示推理链)内化进模型本身,让它自己边看边想,而不是靠推理时打补丁。

方法

CURV 把图表问答从「给图和问题、直接吐答案」改成一条链:每一步推理 Rt 都配一个视觉区域 Vt,标出这一步在看图的哪一块。形式上就是 (I,Q) → {(R1,V1),…,(RT,VT)} → A。

训练分两阶段:

锚定方式有三种:applied(直接把预测区域在图上抹高亮)、boxed(画框)、cropped(裁切放大)。关键设计是把视觉锚定当成「推理和视觉之间的桥」,而不是最终目标,消融显示这种显式锚定比隐式的(让模型内部自己学、不输出框)高 8.78 个点。

课程学习由易到难分三级,用「推理深度」D 衡量,即一个问题需要嵌套几层函数 f1(f2(…fD(x))) 就算 D 级。一级是单步运算,二级是嵌套,三级是多子图组合。训练只用单图(1≤D<3),但能泛化到多子图。

配套的 CCQA 数据集是合成的:7 种图(柱状、直方图、散点、折线、热力、饼、雷达)、30 个领域,GPT-4o 生成绘图数据、模板生成问答。亮点是每种图只用 30 张底图,靠模板在每个底图上派生大量「问题-推理-区域-答案」四元组,逼模型学可迁移的看图技能,而不是记住特定长相。

结果

CCQA(作者自己的合成基准)上,两阶段训练最大涨 20.92 个点。CURV@Applied 配 Qwen2.5-VL-7B 是最强配置:

模型Level 1Level 2Level 3(多子图)
GPT-4o57.6434.0422.14
Qwen2.5-VL-7B(原版)54.2128.6819.01
CURV@Applied(Qwen2.5-VL-7B)69.8640.2126.11

(均为 acc@MLLM,由 GPT-4.1-mini 判分。)

7B 模型三级全压过 GPT-4o,最高高 12.22 个点。多子图场景(训练时没见过)也涨 7.1 个点。

真实图表基准上,合成训练的好处缩水但还在:

模型CharXiv(推理)ChartMuseumMMMU-Pro(域外)
Qwen2.5-VL-7B(原版)32.5021.6228.21
CURV@Applied36.7025.1232.08

CharXiv 涨 4 个点,域外的 MMMU-Pro 也涨约 4 个点,说明学到的是通用的「看图-推理对齐」,不是只对合成题有效。换用 RL 训练还能再涨(最高 +17%),但算力开销大得多,作者主推 SFT 的性价比。

为什么重要

对做文档或图表理解的人,这是个可复用的训练配方:不用堆数据量,用 7×30=210 张合成底图加模板,就能让小模型在图表推理上追平甚至超过 GPT-4o。核心洞察是「让每一步推理都显式锚定到图像区域」,这个机制可以套到任何多模态骨干上,作者也在 InternVL3 全系(1B/2B/8B)上验证了。

它也给了诊断多模态模型失败的一个新角度:别只看最终答案对不对,把推理过程和视觉焦点对齐起来看,能更准地定位是「看错了」还是「想错了」。

局限与存疑

术语

原文与代码

相关论文

全部论文解读