ExtractBench:长文档成企业抽取分水岭,千行表格上 VLM 全部不足 10%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

cs.AI

2026-08-01

ExtractBench 用 370 份企业文档、4869 页评测 14 个抽取系统:短文档差距小,长文档和千行表上通用大模型全线崩盘,来源追溯远未解决。

这篇在解决什么

企业要把业务文档(发票、保险单、政府表单、财务报表)变成结构化数据,过去靠人工录入。现在交给 agent 做,但有个硬要求:不能只给一个 JSON,还得能说清每个值是从原文哪一页、哪个词框出来的,否则审计无法追溯。现有评测要么只看数值准不准、要么只看短文档、要么根本不测成本,没有一个把「数值准确、长文档记录完整、来源可溯、成本可控」四件事一起量。ExtractBench 就是来补这个洞的。

短文档谁都能做好,真正拉开差距的是长文档里成百上千行记录会不会被偷偷截断、以及能不能把每个数字精确锚回原文。这两个恰恰是现有 benchmark 不测的。

方法

任务定义很直接:给一份文档和一份用户写的 JSON Schema(字段名、类型、描述),系统要吐出符合 schema 的 JSON,每个值附上来源页和词级边界框。

数据集 370 份企业文档、4869 页、8 个行业、67 种文档类型,挂在 13 个挑战标签上。Ground truth 的构造分三类,各有各的道理。真实文档用多个独立系统抽取、取共识,分歧才交人裁,因为单系统会把自己的偏差固化成「标准答案」。超长清单(上千行)人工标不动,就先生成数据再渲染成 PDF,真值构造时就是已知的。扫描件和手写件歧义大,每个字段都由人核验,84% 的字段带人工放置的边界框。

评测指标三套:order-insensitive 的 value F1(记录顺序打乱后用匈牙利算法对齐,日期归一成 ISO、空格压缩、缺字段记为显式 null)、词级 grounding F1、页级 grounding F1。grounding 的判定很严:只有值判对、且预测框与真值框 IoU≥0.5 才算 grounded。

结果

14 个系统同台测:8 个 VLM、2 个 coding agent(Claude Code Opus 4.8、Codex GPT-5.5)、4 个专用抽取 API。整体 value F1 排名,LlamaExtract Agentic Plus 以 95.6% 第一,Codex GPT-5.5 93.6% 第二,Reducto Deep Extract 90.4% 第三。成本差异巨大:

系统整体 F1每页成本
LlamaExtract Cost-Effective86.8%1.0¢
LlamaExtract Agentic89.5%3.1¢
LlamaExtract Agentic Plus95.6%8.1¢
Codex GPT-5.593.6%27.8¢
Claude Code Opus 4.887.1%15¢

Agentic Plus 准确率与 coding agent 持平甚至更高,成本却不到 Codex 的三分之一。

最分化的是长文档和超大表。文档长度上,Gemini 3.5 Flash 从短文档 87.9% 掉到长文档 27.9%,Qwen3.6 掉到 26.8%。超过一千行的表(S4)更极端,所有 VLM 全在 10% 以下,最低跌到 1% 出头,而 Agentic Plus 95.9%、Reducto 95.3%、Claude Code 87.8%。原因论文点得很明白:多数系统没法一次吃完整份长文档,又没有分页迭代的策略,就直接提前停了,后面的记录全丢。

grounding 是另一个公开问题。VLM 和 coding agent 默认不返回证据,两级 grounding 都是 0。返回证据的系统里,页级还行(Agentic Plus 84.9%),词级全军覆没,最好的 Agentic Plus 也只有 46.4%。把数字精确锚到某个词,比找到正确页难得多。

为什么重要

如果企业要的只是短文档把字段填对,闭源 VLM 已经够用又便宜。但凡涉及长清单、超大表或审计可追溯,通用 VLM 现阶段基本不可用,得选带分页迭代和 grounding 的专用系统。这篇的价值不在推荐某一家,而在给了一把能区分「短文档玩具分」和「企业级可用」的尺子。

对做 RAG 和文档 agent 的人,它把「上下文窗口够大不等于能处理长文档」这件事量化了:同一个模型,长文档上能掉 60 个点。

局限与存疑

grounding 上限太低,连第一名的词级 F1 都不到 50%,说明这个评测维度对现有系统普遍过难,是不是该分档报告值得商榷。成本数据按公开报价估算,各家实际成交价和企业自部署成本可能差很远。评测方 LlamaIndex 自己就是 LlamaExtract 的出品方,Agentic Plus 在自家 benchmark 上拿了全项第一,这个利益相关需要读者打折看。合成长清单虽保证真值精确,但渲染出的 PDF 排版复杂度未必能代表真实世界最乱的扫描件。

术语

原文与代码

社区讨论

相关论文

全部论文解读