图表与代码互译的一致性困局:CoCoEvolve 让两个模型互相当老师,无需标注

Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning

Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang

cs.LG, cs.AI, cs.CL

2026-08-05

同一张图对应多张表、多段代码,标注昂贵又模糊。CoCoEvolve 把图、表、代码放进一个循环,让两个模型互相校验对方产出,把「三方一致」当成无需标注的训练信号,在六个跨表征任务和域外泛化上提升最高约 38%。

这篇在解决什么

图表、数据表、绘图代码,是同一份数据的三种「长相」。AI 系统经常要在它们之间互译:从图里抽表、按图生成绘图代码、把表还原成图。麻烦在于这张映射是一对多的,一张图对应多张同样正确的表,也对应多段都能渲染出它的代码。

现有基准假装这是一对一,标注既贵又不自洽;只在一对固定表示(比如图→表)上做任务训练,模型在反方向(表→图)和没见过的组合(表→代码)上反而退化。用大模型当裁判打 0 到 100 的总分,又不可靠。这篇要找一个不靠标注、能覆盖全部六个方向、还能对全局语义负责的训练信号。

方法

CoCoEvolve 的思路是循环一致性:把图、表、代码放进一个闭环,让两个模型互相校验,把「三方一致」当训练信号。

闭环由三段映射构成:fθ(多模态模型 Mθ,图→表和代码)、gψ(文本模型 Mψ,表→代码)、h(确定性的代码执行器,代码→图)。一圈走下来,如果每一段都对,三份产出应该互相吻合,这个吻合度就是不需要任何标注的监督信号。

具体奖励有几个:代码一致性奖励 Fc 用嵌入算两个模型产出代码的语义相似度;视觉一致性奖励 Fv 比对渲染回来的图和原图;还有每个模型对原图或原表的自对齐项。共同进化的关键是两个模型耦合在一起,每个模型的优势函数依赖对方的产出,一个变好就把更强的监督喂给另一个。这套机制可以挂在 GRPO、DAPO、GSPO 几种 RL 算法上。

训练和推理都能用:CoCoEvolve@Train 是训练时的共同进化;CoCoEvolve@Test 是测试时优化,各采样 K 个候选取一致性得分最高的,不重训就能涨点。有标注时还能挂一个可选的「教师」模块:每个 batch 里 α 比例的样本用真值,α 随训练线性退火,从教师引导逐步过渡到完全自监督。作者还配套发了 CoCoEvolve@Eval,覆盖全部六个跨表征任务,用确定性规则裁判加 LLM 裁判,把评估拆成多个可解释维度。

结果

代码质量上,CoCoEvolve@Train 加 @Test 把沙盒执行成功率顶到 100%,规则裁判 +17.48%、LLM 裁判 +26.57%。图表评估规则裁判 +6.79%、MLLM 裁判 +3.33%;表格评估 +15.64% 和 +24.72%。

最亮眼的数字在域外泛化。ChartMimic 上图→代码 +37.97%、图加数据→代码 +34.65%。Chart2Code 上的提升:

域外任务(Chart2Code)提升
图→代码复现+37.91%
图加图→代码修改+46.88%
图加表→代码修改+27.85%
图加指令→代码修改+45.44%

跨多个领域迁移:ChartNet +35.68%、ChartMimic +37.97%,而非重叠 ChartCoder 测试集上只有 +2.41%。和不同 RL 算法都能搭(GRPO/DAPO/GSPO):执行 +18.71%、代码 +6.96%、图 +12.15%、表 +3.36%。参与对比的基线包括 Qwen3-VL-2B/4B、InternVL3.5-4B、Llama3.2-3B、DeepSeek-1.3B/6.7B、Qwen3-1.7B/4B/8B,主模型是 Mθ=Qwen3-VL-4B、Mψ=Qwen3-4B。

为什么重要

把循环一致性(源自 CycleGAN)这套自监督思路搬到图、表、代码上,是这篇的真贡献:它绕开了又贵又不自洽的一对一标注,天然覆盖全部六个方向,包括任务式训练会崩掉的反向和未见组合。测试时优化是个实用的点,不重训就能改善。对做文档 AI、图表复现 agent 的人有参考价值。

得说清楚:头部那些 37% 到 46% 多是相对提升,且主要落在域外指标上;表里不少绝对分还在 20 到 50 之间,用的也是小模型,绝对质量并不高。

局限与存疑

作者自承:只在小模型上试过,更大的(如 480B)没探索;只处理静态图表,动画或动态可视化没碰。

补一句存疑:框架相当重(双模型、RL 共同进化、多个奖励项、教师退火),值得追问增益里有多少来自一致性信号本身、有多少只是多花了 RL 算力和测试时搜索。最干净的分布内对比(非重叠测试集)只有 +2.41%,而大数字全是域外,这个落差值得注意;六任务评测套件本身是贡献,但指标多,且部分靠 LLM 裁判。

术语

原文与代码

相关论文

全部论文解读