A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images
Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden
cs.AI, cs.CV, cs.DL
2026-08-14
德国 TIB 联合六国团队发布 ALD/E-ImageMiner 基准与 ICDAR 2026 竞赛:205 篇论文的 1951 张图按 49 类专家标注,分分类、数据表抽取、摘要、VQA 四关,并把「从图像做科学概念理解」立为长期目标。
论文里的图是实验证据的第一载体:谱线、显微照片、工艺流程、多面板拼图,一个数字都不在正文里。数字图书馆检索这类内容基本只剩标题和 caption,多模态模型读它们也靠不住。MaCBenz 一类评测已经给出结论:模型认得出轴和图例,能做直接数字抽取,一到空间推理、跨模态综合、多步推断就掉链子;真实散点图评测里,模型给出的表不完整、数值不准,图越密掉得越狠。
已有的图表理解基准补不上这个缺口。ChartQA 有 20882 张真实图表,但来源是经济、社会、调查类的网络图,和论文里的谱图、反应机理图、装置示意图是两种语言;FigureQA、DVQA、PlotQA 更是程序生成的合成图。材料科学侧最接近的 PolyCompChartIE 只覆盖散点图的图转表。缺的是一个领域扎实、任务互补的科学图像基准,这篇就是冲这个缺口去的。
ALD/E-ImageMiner 的选域是原子层沉积/刻蚀(ALD/E),一类用循环表面反应精确控制薄膜生长或去除的材料工艺。选它有讲究:图里的信息都挂在工艺条件上,前驱体脉冲、吹扫、每循环生长量,读图绕不开领域知识,没法靠纯视觉套路过关。
基准本体:205 篇实验与模拟论文里抽出 1951 张图,人工归入 49 个类别,覆盖折线图、谱图、散点图、热图、分子结构图、反应机理图、装置图、工艺流程、多面板拼图。数据制备先用 MinerU 抽结构化文本与高清图,再对多面板图逐面板人工标 bounding box(x、y、宽、高),让每条标注都能对准具体的图像区域,不靠模型自己从整图里猜目标框。
四个任务按能力递进设计:
VQA 的设计花了不少心思,骨架是 Bloom 修订版教育目标分类学,把问题难度从记忆一路铺到评价。四个问题族:工艺类问循环流程的步骤与条件变化;对比/趋势类问温度、脉冲长度、循环数怎么影响结果;结构-性能类问前驱体化学与薄膜结构如何决定材料性质;应用/性能类问材料行为对器件意味着什么。答案分四种格式:是非、事实型、列表、段落。段落答案专门用来考推理过程是否科学自洽,不只考结论对错。
论文给了一个完整实例:一张五面板的 PbI₂ 蓝宝石外延生长图,四个问题横跨三个问题族、三种答案格式。问「PbI₂ 能否在蓝宝石上外延生长」考的是非判断;问「为什么极图测在 25.95°」要给出外延关系的完整晶向解释;问「什么暗示薄膜存在无序」要报出两个扫描的半高宽 13° 与 9°。同一个图,考的深度可以差出好几级。
这是篇展望型论文,正文不载竞赛系统成绩,完整结果放在同套 proceedings 的竞赛报告里。本文给出的硬数字是基准本体:
| 对象 | 数值 |
| 收录图表 | 1951 张 |
| 来源论文 | 205 篇 |
| 图类别 | 49 类 |
| 任务数 | 4(分类/抽表/摘要/VQA) |
| 问题族 | 4(工艺/对比趋势/结构-性能/应用性能) |
| 答案格式 | 4(是非/事实型/列表/段落) |
对比之下,ChartQA 收 20882 张网络来源图表,PolyCompChartIE 与 MetalThermoChartIE 限定在聚合物与金属热物性的散点图转表。ALD/E-ImageMiner 是首个在同一批图上四任务并行、带面板级坐标标注的材料科学基准,数据在 Hugging Face 公开,四个任务各挂一个 Codabench 竞赛页。
对做多模态评测的人,这是一份现成的领域压力测试。合成图表基准逼近饱和后,科学图像是下一块硬骨头,而这份数据带面板级坐标,能定位模型到底败在哪一块图区。
对材料与化学方向的从业者,任务二的图转表直接对应文献数字化:把几十年的谱图工艺图变成可检索的结构化数据。论文还给了更远的用处,检索可比条件的实验、跨材料类比较制备路线、构建工艺-结构-性能网络。
路线图部分对设计 agent 评测的人最有分量。假设检验轨道让模型生成竞争解释、选出区分性测量、看到新证据后修正结论;反事实轨道删面板、改数值、换标签,检查模型是跟着证据变还是死守原答案;影子挑战赛给 agent 一个未发表研究的问题和一批带图表的文献,让它产出经领域专家评审的研究提案。这几条正打在当前 agent 评测的软肋上:案例研究显示 agent 能干研究工程的活,却栽在实验判断、证据选择、回溯和判断问题是否真正解决上。
作者自己摆的位置:本文是视角文,不载系统成绩,基准细节与竞赛结果都在姊妹篇竞赛报告里,单读这篇拿不到模型横评数字。
读到的方法论瑕疵:Bloom 分类学这里被用作题库设计的脚手架,作者也承认问题族与 Bloom 层级没有严格对应,同一张图可以同时出事实题和分析题。这让「认知深度递进」的设计意图打了个折扣,难度分层实际靠问题族与答案格式的组合近似,不保证每一题的层级标注可靠。
更大的现实约束是标注成本。1951 张图、49 类、逐面板坐标加四族问题的专家标注,是八个机构十二位作者的投入。路线图里列的跨文档综合、假设检验、影子挑战赛每一项都要更重的领域标注与专家评审,这条路线能不能按增量方式走下去,取决于持续投入,不是技术问题。Bloom 方向的 Create 层目前只有一个假设性示例,不在现有标注里,也佐证了这一步还没落地。