千张科学总览图重建:同一 GPT-5.5 换 Harness,专用流程可涨 3.2 也可跌 2.2 分

ReFigBench: Benchmarking Scientific Figure Reconstruction as Editable PowerPoint Artifacts

Liyang Fan, Chi Wei, Yitai Li, Xinping Bi, Guhong Chen, Chenghao Sun, Haoxiang Yang, Qingwen Li, Kai Yan, Hong Li, Bo Li

cs.CL, cs.CV

2026-09-16

ReFigBench 用 1000 张 arXiv 总览图,让编码 agent 重建可编辑 PPTX。同一 GPT-5.5 的专用流程在 Codex 上 +3.2、在 Claude Code 上 −2.2;专用路径还会把原生连接线中位数打到 0。

这篇在解决什么

多模态编码 agent 现在被要求把图变成能用的文件。它们跑在 Claude Code、Codex 这类 Harness 里,工具、上下文、执行环境都由这层决定。现有评测常常切成短工具调用、API 轨迹,或截图像不像。分低了,分不清是没看清图、没规划好,还是外壳把模型坑了。

科学论文的总览图把这件事钉死。模块是框,虚线是梯度,重复符号是共享参数,网上流传的却是一张栅格图。要把它还原成一页可编辑的 PowerPoint,既要像素级像,也要文本框、形状、连接线、编组这些原生对象还在。只看截图会放过整页贴图;只数对象会放过箭头反了的「可编辑垃圾」。ReFigBench 问的是:模型看走眼、agent 能力不够,还是 Harness 不对。

方法

任务合同很硬。输入只有挂载的源图。输出必须是单页 PPTX 加生成程序。打不开、多页、渲不出,门控直接记零。

两条工作流。直接路径让 agent 用通用 PPTX 库写代码拼幻灯片。专用路径走一套围绕 PPTX 的文档工具链,中间可以渲染对照。Claude Opus 4.6、MiMo-v2.5、MiniMax-M3 跑在 Claude Code 里;GPT-5.5 同时跑 Claude Code 和 Codex,推理力度都钉在 xhigh。模型、Harness、工作流凑出十套配置,每套 1000 张图,一共 10000 份产物。

数据用 ORBIT 从 2017 年 6 月起的 cs.AI、cs.CL、cs.CV、cs.LG 里按图注检索总览图。严门槛收下 5146 张,人工抽查 98% 真是总览;发布的 1000 张是打乱后的可复现前缀,来自 1000 篇不同论文。中位解码面积 1.50 百万像素,980 种分辨率,没有统一画布。cs.CV 独占 464 张。

过门之后,GPT-5.4 按五轴打分:文本 20、语义结构 30、版式 15、可编辑性 25、视觉细节 10。整页栅格贴图且原生对象很少,分数封顶 50。主实验量是成对工作流效应:同一模型同一 Harness 上,专用减直接。人类评委做盲比,拟合 Bradley-Terry,Elo 均值为 1000。Qwen3.6-27B 作为第二家族裁判整表重打三遍。

结果

十套配置全部过门,门控不影响排名。GPT-5.4 第一轮均分如下。

配置直接专用
GPT-5.5 + Codex74.277.4
GPT-5.5 + Claude Code75.673.4
Claude Opus 4.6 + Claude Code69.466.4
MiniMax-M3 + Claude Code66.166.1
MiMo-v2.5 + Claude Code63.461.0

同一笔专用投入,在 Codex 里给 GPT-5.5 带来 +3.2,bootstrap 区间大约 +2.5 到 +3.9;在 Claude Code 里是 −2.2。字面完全相同的直接 prompt 下,GPT-5.5 在 Claude Code 里比 Codex 高 1.4 分,区间 [0.7, 2.2]。模型身份本身就能拉开 16 分以上,四套 GPT-5.5 包揽前四。领先配置的文本分大约只拿到五分之四的额度,视觉细节更低,迭代渲染补了一截感知亏空,补不完。

结构审计更刺眼。专用工作流下,所有配置的连接线中位数都是 0,91.8% 到 100% 的幻灯片没有任何原生连接线;直接路径中位数还在 15 到 42。可编辑性五对全部下跌。语义失败(结构分不到一半)最弱配置超过四分之一,最强的 GPT-5.5 Codex 专用降到 0.5%。

账也清楚。专用路径在五对里有四对把中位回合数乘到约 2 到 3 倍,单份成本乘 1.4 到 3.5 倍。只有 Codex 上的 GPT-5.5 把多花的钱换成了分,它也是最贵的一套,约 3.57 美元/份。全套生成大约 1.5 万美元。固定预算下,五对里有四对更该走直接路径。

人类盲比和自动分的 Pearson 相关是 0.958。人类在五对里有四对更喜欢专用路径的渲染,其中两对和量表方向相反:量表扣的是被拆掉的原生结构,人眼奖的是更像的像素。第二裁判 Qwen3.6-27B 更松,排序 Spearman 0.988,连「Claude Code 直接高于 Codex 直接」这种细序也复现了。10 分以上的分差,裁判和人类方向一致率到 91%;人类彼此只有 59%。

一个 GPT-5.5 Codex 直接路径的案例把风险写死:视觉词汇几乎完美,箭头几乎全反,可编辑性拿了 22/25,语义结构只有 10/30。贴图检测 10000 份里只触发 2 次,真正的坑是可编辑但算反了。

为什么重要

做文档 agent 的人如果只报模型名、不报 Harness 和工作流,这个基准会说你报了一半系统。专用工具链能补一点感知,文本分五对全涨,但会把文档做成图画。人类更买账渲染,量表更惩罚结构丢失。两者必须拆开看。

对要落地的人,直接用 python-pptx 写对象树,目前仍是更稳的默认;只有在 Codex 这类能把中间渲染兑成分数的壳里,专用流程才值那笔加倍账单。天花板仍在 77.4/100。更好的像素单独解决不了科学总览图重建,结构得一起活下来。

局限与存疑

任务锁在单页 PPTX。ORBIT 不按领域配额抽样,cs.CV 占了近一半。Harness 对照只覆盖 GPT-5.5。成对 Δ 把库、prompt、工具链捆在一起,分不清是哪一层在起作用。主裁判和最强被评模型同属 OpenAI 家族;论文用第二家族、三轮重复和人类盲比来压这件事,单题分仍有大约 3 分抖动,2 分以内当平局。

量表权重也是自由参数。把可编辑性从 25 改到接近一半,Codex 上那 +3.2 才会翻号。人类和量表在「像不像」和「能不能改」脱钩的地方公开分道,系统排序稳,近邻对没有那么稳。

术语

原文与代码

社区讨论

相关论文

全部论文解读