ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures
Fahad Ahmed, Sören Auer, Jennifer D'Souza
Science series (Springer Nature
cs.CV
2026-07-29
ICDAR 2026 竞赛拿 205 篇 ALD 材料学论文的 1951 张图、专家标注成四项任务。68 个队参赛:分类、摘要能打,数据提取和视觉问答仍是短板,最强队 VQA 加权分也只 0.31。
科学论文里大量知识只在图里,不在正文:能带图、相图、光谱、能带图。多模态大模型号称已经会「看图」,但它们真懂领域专属的科学图吗?现有基准要么是通用图像,要么是纯文档解析(把 PDF 里的文字抠出来),都不考科学家真正需要的那套端到端能力:判别图型、提取图里的数值、概括、看图答题。
团队选的考域很硬:ALD/ALE(原子层沉积与刻蚀),这是芯片和材料制造里逐原子层铺/削材料的工艺,图全是专业图(能带图、相图、多光谱图),比通用图像难啃得多。
他们造了 Sci-ImageMiner 数据集:205 篇 ALD/ALE 论文、1951 张图,由 10 位领域专家(硕博与博士后)标注,定义了一套 49 类的图型分类法,按 1180/201/570 切训练/开发/测试。文档解析用 MinerU,预标注用 Qwen2.5-VL-7B。标注者一致性 Fleiss' Kappa 只有 0.46,属「中等一致」。
四项任务层层递进:
竞赛跑在 2026 年 1 月到 4 月,68 个活跃队伍、1263 次提交。基线是 Gemma、Qwen3-VL、GLM-4.6V、InternVL 3.5、Molmo2 这类 8B 级开源视觉语言模型。
四项任务,最好队伍对比最强基线:
| 任务 | 最强基线 | 第一名 | 差距说明 |
| 分类(F1) | Gemma 0.68 | RicohSRCB 0.81 | 看标签,模型能打 |
| 数据提取 | Qwen3-VL 35.97 | TeleOCR-VL 41.81 | 读数值,差距不大且都低 |
| 摘要 | InternVL 0.48 | DeepVitminC 0.56 | 复述类,接近能用 |
| VQA | Molmo2 0.20 | DeepVitminC 0.31 | 推理类,天花板很低 |
规律很清楚:分类和摘要(答案是标签或复述)能做;数据提取和 VQA(要读出精确数值或在图上推理)明显掉档。VQA 最差,最强队加权分也才 0.31,而其中的「列表」型回答几乎归零(0.09)。没有任何一个基线在四项上都强。
对做多模态和 Agent 的人,这是个很实的测量尺:它把「概括这张图」(行)和「图里这个点标的值是多少」(不行)之间的差距量出来了,而这恰恰是科学家最想要的能力。任何想做文献阅读、数据抽取、科研 Agent 的团队都该看看自己栽在哪一档。
要泼一盆冷水:考域(半导体制造)很窄,标注一致性只有中等,绝对分数也低到这份基准更像诊断工具,而不是一个值得刷的榜单。
作者承认:标注一致性中等(0.46)、没有一个基线全面强、VQA 基线远低于顶尖队伍。
更值得追问的是:专家之间都只「中等一致」,那 VQA 的低分里有多少是标签本身的问题、多少是模型的问题,根本分不清。「列表」型回答只拿 0.09,很可能是任务定义本身没说清,而不是模型读不懂。205 篇论文对一个自称「全面」的基准偏小,ALD/ALE 又窄到结论未必能搬到生物医学的图上。