22万步视觉草稿纸让图任务反超,数学掉到8.5%

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

EMNLP 2026 Findings

cs.CL, cs.CV

2026-08-29

Berkeley用Claude 4.5合成5.19万条视觉草稿纸轨迹。微调Qwen3-VL-8B后交错CoT平均38.2%,图任务62%超过纯文本,数学仅8.5%,整体仍落后最强纯文本51.2%。

这篇在解决什么

文本思维链(chain-of-thought,CoT)在数学证明、写代码这类「中间状态本来就是文字」的任务上很管用。棋盘、迷宫、亲属图、排课表则不然。人会摊开一张草稿纸,模型却被迫把棋局写成一段拗口的代数记号。每走一步都要把邻接关系重新用散文枚举一遍,状态一长就丢。

已有的交错视觉推理数据,大多在「题目里已经有图」的设定下工作。Zebra-CoT 对着输入图像做 grounded observation,Math-VR 画数学专用图。缺的是另一件事:题目只有文字,模型自己从零搭出一张视觉工作台,并在多步推理里维护它。加州大学伯克利分校放出的 CoVA-SFT,就是冲着这个缺口做的数据集,顺带给出评测集 CoVA-Bench。

方法

训练集 51,904 条轨迹、222,046 张中间图,覆盖 5 类视觉抽象、17 项任务。五类对应人常用的外化方式:表格管约束满足,家族树管亲属推理,图管关系与流,布局网格管空间与装箱,几何图管数学。任务分布很偏:Math-VR 独占约 32.4%,迷宫 7.8%、装箱 7.2%,其余包括国际象棋、数独、ARC-AGI、CLUTRR、图着色、GraphInstruct、ProsQA、排座、SpatialEval、三维方块、MathNet、ACP、逻辑谜题、排程。题目一部分由约束求解器程序生成(排座、斑马谜题、三维方块),其余改写自开源集。

配套 CoVA-Bench 从同样 17 项任务各抽 100 条,共 1,700 条,训练时扣住,专门测多步逻辑和视觉状态维护。

合成器是 Claude 4.5 Sonnet,走三段循环。先写清楚为什么需要一张视觉草稿纸、该画什么,再给出问答对。然后逐步写交错推理,每一步用 Matplotlib 把当前工作台画出来,图立刻喂回模型当上下文。最后对照题面检查结构一致性,画错就重画,再往下一步走。

验证基线把 Qwen3-VL-8B-Thinking 在这批数据上做监督微调。训练数据里的中间图是真像素,微调时并不让模型去调画图工具:每张图固定编成 128 个视觉 token,模型要预测的是这串潜向量,外加最终文本答案。文本走常规自回归交叉熵,视觉 token 用余弦相似度对齐真实嵌入,总损失两项相加、权重为 1。视觉编码器没有冻住。训练 2 个 epoch,学习率 5×10⁻⁵,全局 batch 16,最长回复 32,768 token,8 张 H200、FSDP2、bfloat16。对照模型统一卡在 7–8B,只给纯文本题面,零样本作答。答案格式从字母、人名到表格、符号表达式都有,打分用 Gemini-2.5-flash 当 LLM judge。

结果

交错视觉 CoT 这一侧,CoVA-SFT 基线平均 38.2%。下一档 MathCanvas 16.8%,CodePlot-CoT 12.9%,Zebra-CoT 11.2%,TwGI(Thinking with Generated Images)几乎是 0.9%。平均翻了一倍有余。外部画图工具链普遍更差,渲染错误会灌进后续推理、几乎没法回滚;CoVA 把工作台收进模型内部,至少避开了这条工具边界。

纯文本这一侧更强。Qwen3-VL-Thinking 平均 51.2%,Qwen3-Think 45.1%,Qwen3-VL-Instruct 46.0%。视觉草稿纸整体还没追上纯文字。

方法TableLayoutGraphGameMath平均
Qwen3-Think67.369.344.519.325.045.1
Qwen3-VL-Thinking80.376.346.525.527.351.2
MathCanvas14.022.035.30.512.316.8
CoVA-SFT 基线47.253.462.020.08.538.2

唯一明显赢过纯文本的是 Graph:62.0% 对 Qwen3-VL-Instruct 的 57.0%。细项里 CLUTRR 83.6%(纯文本 Thinking 39.0%)、ProsQA 93.8%(31.0%)。迷宫也拉开了:77.0% 对 50.0%。关系结构和网格路径这类「用散文维护邻接表很痛苦」的任务,画出来确实更省事。

数学是反向的。CoVA 8.5%,Qwen3-VL-Thinking 27.3%。MathNet 掉到 4.9%,Math-VR 10.9%。论文的解释:数学中间态本来就是符号,硬塞潜视觉 token 是绕路。国际象棋 0.0%、数独 0.0%、ARC-AGI 3.3%,这三项视觉工作台几乎没学会。排程从纯文本 95.0% 掉到 34.5%。

为什么重要

这是一份数据集论文,不是新架构。贡献是把「从纯文本题自己搭视觉草稿纸」做成了可训、可复现的规模:五万条、十七项任务、带自检循环。谁在做 latent visual token、交错 CoT、统一多模态模型,这是目前较大的从零构图训练资源之一。

能拿走的判断也很清楚。图、亲属、迷宫这类结构跟踪,视觉中间态值得试;数学、棋类、数独别指望这份微调能超过纯文本 CoT。论文还甩了一句归纳:连续潜视觉表示可能比统一多模态模型里的离散出图更合适。这句话目前只被 Graph 上约 5 个百分点撑着,别当定论。

贡献列表里写「不损害通用文本推理」。主文没有 MMLU 一类的通用评测数字,这句话暂时只能当作者自述。

局限与存疑

数据由 Claude 4.5 Sonnet 生成。自检循环能拦住不少结构错误,但文本轨迹和画图代码里的细幻觉会直接蒸馏进训练集,下游准确率的天花板可能就被这些微错误钉住。论文自己把这列为第一局限。

视觉形态被 Matplotlib 卡住了:二维表、拓扑图、布局格、几何坐标图,全是静态示意,没有开放世界空间仿真,也没有连续机器人环境。学到的是符号性示意图,不是感知性视觉。

训练上,文本交叉熵加高维余弦对齐比纯文本微调贵。推理时一条轨迹能叠到 8 段以上视觉状态,上下文和算力都会涨。评测只在 CoVA-Bench 这个同分布 hold-out 上,没有报告分布外任务。LLM judge 是 Gemini-2.5-flash,对结构化表格答案是否稳定,论文没有人评对照。Chess 和 Sudoku 掉到零,说明这份数据在这两项上没教会模型,不能据此否定视觉草稿纸这条路。

术语

原文与代码

相关论文

全部论文解读