2.1B 比 1.0B 还快:把版面拆成并行分支,文档解析吞吐翻倍

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

cs.AI

2026-08-06

把文档版面预测拆成共享前缀上的并行分支,同骨架吞吐最高翻倍、P95 延迟砍近半,OmniDocBench 端到端质量保持第一梯队。

这篇在解决什么

把一张文档页面图变成结构化的版面加文字、公式、表格,叫文档解析。现在的端到端做法用一个多模态大模型(MLLM)把整页所有内容按一条顺序吐出来:先版面框、再每个区域的内容,串成一条自回归序列。问题是页面上很多区域彼此独立(左上角的标题和右下角的公式没有依赖关系),却必须一个等一个排着解码,解码长度等于全页内容总长,页里区域越多越慢。

另一条路是裁剪式两阶段:先检测版面,再把每个区域裁出来单独送进模型识别。它确实能在区域间并行,但每个裁剪块都要重新跑一遍图像编码,页面级上下文也被切碎了。

PaDoc 想要鱼和熊掌兼得:保留整页上下文(像端到端那样一次性看整页),又能在区域之间并行解码(像两阶段那样)。

方法

核心观察是文档的依赖结构其实是一棵树,不是一条链。版面框 Bk 把页面切成区域,每个区域的内容 Yk 只依赖页面图 X 和它自己的版面 Bk,不强依赖其他区域的内容。论文把这叫 region-sufficiency assumption(区域充分性假设),意思是给定页面和版面,识别一个区域不需要先看完别的区域。

在这个假设下,整页的联合概率可以因式分解:版面流预测下一个版面框 B(k+1),内容分支预测当前区域 Yk,两者都从共同前缀(页面图 X 加上到 k 为止的版面)出发。既然互不依赖,就可以同时解码。关键收益在解码深度:顺序解码的深度是全页内容总长,PaDoc 把它退化成最长的一条「版面前缀加内容」路径。

这套因式分解在一个 MLLM 里就能学,不用额外的检测头或草稿模型:

一句话:不换模型架构、不加辅助头,把串行解码改成基于版面的并行分支,落地端直接吃 vLLM 已有的前缀缓存。

结果

布局分析(OmniDocBench,表 1):PaDoc 整体 F1 91.1,追平两阶段里最好的 PaddleOCR-VL 1.5(91.2),整体精确率 93.3 是全表最高。表格区域的布局检测尤其强,IoU 92.7、F1 97.0,四项表格指标全列第一。

端到端解析质量(表 2,OmniDocBench v1.6 Full):

系统参数量OverallText Edit ↓Formula CDMTable TEDS
MinerU2.5-Pro(两阶段)1.2B95.690.03697.2993.42
HunyuanOCR 1.5(端到端)1.0B94.740.03994.5093.67
Qianfan-OCR(端到端)4.7B93.900.04095.0890.53
PaDoc(端到端)2.1B94.240.03895.5990.94

PaDoc 的 Overall 94.24 在端到端里排第二,落后 HunyuanOCR 1.5(94.74)半个百分点,但 Text Edit 和 Formula CDM 是端到端最好。表格内容识别(Table TEDS 90.94)是它相对弱的项,落后 HunyuanOCR 近 3 分。一个旁证:通用大模型在这套基准上落后明显,GPT-5.2 只有 86.52,文档解析仍是专门模型的地盘。

服务效率(384 页子集,单张 A800,表 3):对比同骨架的 Sequential SFT 基线,吞吐提升 67.4% 到 118%,P95 延迟下降 39.2% 到 54.9%,64 并发时达到 1.722 页每秒。服务评测里还有个反直觉的结果:2.1B 的 PaDoc 在所有并发档位上,吞吐和延迟都优于只有 1.0B 的 HunyuanOCR 1.5,也大幅快过 0.7B 的 MonkeyOCRv2。

为什么重要

文档解析是 RAG 数据注入、OCR 流水线、文档数字化的基础工序,延迟和吞吐直接决定服务成本。PaDoc 的价值不在分数最高,而在证明一件事:基于版面的并行解码能在不动模型架构、不加辅助头、不引入草稿模型的前提下,把端到端解析器的服务成本压下来一大截,而且直接跑在主流的 vLLM 上。

对要做大规模文档处理的团队,实际意义是单卡能多扛接近一倍的页,质量同时保持端到端第一梯队。它还没追上最好的两阶段系统(MinerU2.5-Pro),但端到端省掉了两阶段那次额外的图像编码往返。

局限与存疑

region-sufficiency 假设是个近似,不是定理。论文自己在附录里承认,它采用的 prefix-conditioned 形式是「严格更弱」的,无法恢复完整的 region-specific 因式分解。真实文档里的跨区域依赖(阅读顺序的暗示、跨表格的引用、合并单元格)理论上可能违反这个假设,论文没有给出假设被破坏时的误差分析。

质量上也不是最优。Overall 94.24 落后两阶段的 MinerU2.5-Pro(95.69)和 GLM-OCR(95.15),在端到端里也落后 HunyuanOCR 1.5。表格内容识别(Table TEDS)是明确短板。

效率对比的基线是「同骨架的顺序 SFT」,这是为了干净地剥离并行解码的贡献,合理,但也意味着翻倍的吞吐主要归功于并行解码本身,不是模型更强。所有服务评测都在单卡单副本上跑,没有张量并行,真实多节点集群的行为没有验证。

术语

原文与代码

相关论文

全部论文解读