CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li
cs.CV, cs.AI, cs.CL
2026-08-04
把图表问答拆成「边推理边框选相关区域」的课程训练,Qwen2.5-VL-7B 在合成基准 CCQA 上比 GPT-4o 高 12 个点,真实基准 CharXiv 也涨 4 个点。
图表问答(Chart Question Answering, CQA)让多模态大模型读一张图、回答关于数据的问题。听起来简单,实际很卡。作者先用 GPT-4o 在 60 道 CharXiv 题上做了个对照,把问题暴露出来:直接答题只有 43.3% 正确率;给它人工标好的图中关键信息(把该看的值直接喂进去),升到 61.7%;让它先写推理过程再答题,53.3%;两者都给,86.7%。
这个对照说明两件事:一是 GPT-4o 自己「看不准」图里的值,二是它「想不清」该按什么顺序算。把视觉线索和分步推理都补上,正确率几乎翻倍。CURV 想做的,就是把这两个外挂(人工喂视觉信息、提示推理链)内化进模型本身,让它自己边看边想,而不是靠推理时打补丁。
CURV 把图表问答从「给图和问题、直接吐答案」改成一条链:每一步推理 Rt 都配一个视觉区域 Vt,标出这一步在看图的哪一块。形式上就是 (I,Q) → {(R1,V1),…,(RT,VT)} → A。
训练分两阶段:
锚定方式有三种:applied(直接把预测区域在图上抹高亮)、boxed(画框)、cropped(裁切放大)。关键设计是把视觉锚定当成「推理和视觉之间的桥」,而不是最终目标,消融显示这种显式锚定比隐式的(让模型内部自己学、不输出框)高 8.78 个点。
课程学习由易到难分三级,用「推理深度」D 衡量,即一个问题需要嵌套几层函数 f1(f2(…fD(x))) 就算 D 级。一级是单步运算,二级是嵌套,三级是多子图组合。训练只用单图(1≤D<3),但能泛化到多子图。
配套的 CCQA 数据集是合成的:7 种图(柱状、直方图、散点、折线、热力、饼、雷达)、30 个领域,GPT-4o 生成绘图数据、模板生成问答。亮点是每种图只用 30 张底图,靠模板在每个底图上派生大量「问题-推理-区域-答案」四元组,逼模型学可迁移的看图技能,而不是记住特定长相。
CCQA(作者自己的合成基准)上,两阶段训练最大涨 20.92 个点。CURV@Applied 配 Qwen2.5-VL-7B 是最强配置:
| 模型 | Level 1 | Level 2 | Level 3(多子图) |
| GPT-4o | 57.64 | 34.04 | 22.14 |
| Qwen2.5-VL-7B(原版) | 54.21 | 28.68 | 19.01 |
| CURV@Applied(Qwen2.5-VL-7B) | 69.86 | 40.21 | 26.11 |
(均为 acc@MLLM,由 GPT-4.1-mini 判分。)
7B 模型三级全压过 GPT-4o,最高高 12.22 个点。多子图场景(训练时没见过)也涨 7.1 个点。
真实图表基准上,合成训练的好处缩水但还在:
| 模型 | CharXiv(推理) | ChartMuseum | MMMU-Pro(域外) |
| Qwen2.5-VL-7B(原版) | 32.50 | 21.62 | 28.21 |
| CURV@Applied | 36.70 | 25.12 | 32.08 |
CharXiv 涨 4 个点,域外的 MMMU-Pro 也涨约 4 个点,说明学到的是通用的「看图-推理对齐」,不是只对合成题有效。换用 RL 训练还能再涨(最高 +17%),但算力开销大得多,作者主推 SFT 的性价比。
对做文档或图表理解的人,这是个可复用的训练配方:不用堆数据量,用 7×30=210 张合成底图加模板,就能让小模型在图表推理上追平甚至超过 GPT-4o。核心洞察是「让每一步推理都显式锚定到图像区域」,这个机制可以套到任何多模态骨干上,作者也在 InternVL3 全系(1B/2B/8B)上验证了。
它也给了诊断多模态模型失败的一个新角度:别只看最终答案对不对,把推理过程和视觉焦点对齐起来看,能更准地定位是「看错了」还是「想错了」。