PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan
cs.AI
2026-08-06
把文档版面预测拆成共享前缀上的并行分支,同骨架吞吐最高翻倍、P95 延迟砍近半,OmniDocBench 端到端质量保持第一梯队。
把一张文档页面图变成结构化的版面加文字、公式、表格,叫文档解析。现在的端到端做法用一个多模态大模型(MLLM)把整页所有内容按一条顺序吐出来:先版面框、再每个区域的内容,串成一条自回归序列。问题是页面上很多区域彼此独立(左上角的标题和右下角的公式没有依赖关系),却必须一个等一个排着解码,解码长度等于全页内容总长,页里区域越多越慢。
另一条路是裁剪式两阶段:先检测版面,再把每个区域裁出来单独送进模型识别。它确实能在区域间并行,但每个裁剪块都要重新跑一遍图像编码,页面级上下文也被切碎了。
PaDoc 想要鱼和熊掌兼得:保留整页上下文(像端到端那样一次性看整页),又能在区域之间并行解码(像两阶段那样)。
核心观察是文档的依赖结构其实是一棵树,不是一条链。版面框 Bk 把页面切成区域,每个区域的内容 Yk 只依赖页面图 X 和它自己的版面 Bk,不强依赖其他区域的内容。论文把这叫 region-sufficiency assumption(区域充分性假设),意思是给定页面和版面,识别一个区域不需要先看完别的区域。
在这个假设下,整页的联合概率可以因式分解:版面流预测下一个版面框 B(k+1),内容分支预测当前区域 Yk,两者都从共同前缀(页面图 X 加上到 k 为止的版面)出发。既然互不依赖,就可以同时解码。关键收益在解码深度:顺序解码的深度是全页内容总长,PaDoc 把它退化成最长的一条「版面前缀加内容」路径。
这套因式分解在一个 MLLM 里就能学,不用额外的检测头或草稿模型:
一句话:不换模型架构、不加辅助头,把串行解码改成基于版面的并行分支,落地端直接吃 vLLM 已有的前缀缓存。
布局分析(OmniDocBench,表 1):PaDoc 整体 F1 91.1,追平两阶段里最好的 PaddleOCR-VL 1.5(91.2),整体精确率 93.3 是全表最高。表格区域的布局检测尤其强,IoU 92.7、F1 97.0,四项表格指标全列第一。
端到端解析质量(表 2,OmniDocBench v1.6 Full):
| 系统 | 参数量 | Overall | Text Edit ↓ | Formula CDM | Table TEDS |
| MinerU2.5-Pro(两阶段) | 1.2B | 95.69 | 0.036 | 97.29 | 93.42 |
| HunyuanOCR 1.5(端到端) | 1.0B | 94.74 | 0.039 | 94.50 | 93.67 |
| Qianfan-OCR(端到端) | 4.7B | 93.90 | 0.040 | 95.08 | 90.53 |
| PaDoc(端到端) | 2.1B | 94.24 | 0.038 | 95.59 | 90.94 |
PaDoc 的 Overall 94.24 在端到端里排第二,落后 HunyuanOCR 1.5(94.74)半个百分点,但 Text Edit 和 Formula CDM 是端到端最好。表格内容识别(Table TEDS 90.94)是它相对弱的项,落后 HunyuanOCR 近 3 分。一个旁证:通用大模型在这套基准上落后明显,GPT-5.2 只有 86.52,文档解析仍是专门模型的地盘。
服务效率(384 页子集,单张 A800,表 3):对比同骨架的 Sequential SFT 基线,吞吐提升 67.4% 到 118%,P95 延迟下降 39.2% 到 54.9%,64 并发时达到 1.722 页每秒。服务评测里还有个反直觉的结果:2.1B 的 PaDoc 在所有并发档位上,吞吐和延迟都优于只有 1.0B 的 HunyuanOCR 1.5,也大幅快过 0.7B 的 MonkeyOCRv2。
文档解析是 RAG 数据注入、OCR 流水线、文档数字化的基础工序,延迟和吞吐直接决定服务成本。PaDoc 的价值不在分数最高,而在证明一件事:基于版面的并行解码能在不动模型架构、不加辅助头、不引入草稿模型的前提下,把端到端解析器的服务成本压下来一大截,而且直接跑在主流的 vLLM 上。
对要做大规模文档处理的团队,实际意义是单卡能多扛接近一倍的页,质量同时保持端到端第一梯队。它还没追上最好的两阶段系统(MinerU2.5-Pro),但端到端省掉了两阶段那次额外的图像编码往返。
region-sufficiency 假设是个近似,不是定理。论文自己在附录里承认,它采用的 prefix-conditioned 形式是「严格更弱」的,无法恢复完整的 region-specific 因式分解。真实文档里的跨区域依赖(阅读顺序的暗示、跨表格的引用、合并单元格)理论上可能违反这个假设,论文没有给出假设被破坏时的误差分析。
质量上也不是最优。Overall 94.24 落后两阶段的 MinerU2.5-Pro(95.69)和 GLM-OCR(95.15),在端到端里也落后 HunyuanOCR 1.5。表格内容识别(Table TEDS)是明确短板。
效率对比的基线是「同骨架的顺序 SFT」,这是为了干净地剥离并行解码的贡献,合理,但也意味着翻倍的吞吐主要归功于并行解码本身,不是模型更强。所有服务评测都在单卡单副本上跑,没有张量并行,真实多节点集群的行为没有验证。