HPD-Parsing 以层级并行解码把解析提速到 4,752 tokens/s
PaddlePaddle · hf · 2026-07-22
HPD-Parsing 用层级并行解码替代整页自回归
这篇工作针对统一式 VLM 文档解析器的顺序瓶颈提出新方案。
- 现有解析器虽然会把整页一起处理,但输出仍然走单一路径的 token-by-token 自回归,文档越长越慢。
- 作者认为文档解析其实有两层需求:一层是 全局布局分析,另一层是 块级内容并行解析。
- 为此他们提出 HPD-Parsing:用一个 主布局分支 组织整页结构,再把块级内容动态分配给多个并发解码分支。
- 另外再加上 progressive multi-token prediction(P-MTP),进一步减少每个分支需要的解码步数。
- 在公开基准上,系统达到 4,752 tokens/s,比最快的已有文档解析模型快 2.62 倍,比原始自回归基线快 3.06 倍。
- 同时解析精度仍保持有竞争力,说明层级并行解码可以成为整页自回归之外的一条可行路线。
所属事件:HPD-Parsing 层级并行解码实现极速文档解析(2 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27