OvisOCR2登顶文档解析榜

Littlepharaoh · reddit · 2026-07-15

作者分享了对 OvisOCR2(0.8B) 的实测,它是一个端到端文档解析 VLM,基于 Qwen3.5-0.8B 继续预训练,Apache 2.0 许可,可在 vLLM 0.22.1 上运行。模型在 OmniDocBench v1.6 上拿到 96.58,并且是第一个登顶该榜单的端到端模型,以前榜首基本都是“检测 + 裁切 + OCR + 重组”的流水线方案。

作者解释了端到端的优势:流水线 OCR 的问题往往出在版面检测阶段,一旦漏掉区域,文字就直接丢失;而端到端方案没有这个单点失败。也因此,部署更简单,只需一个模型和一套 serving stack。

随后作者给出自己用 827 份真实扫描医疗文档做的对比测试:OvisOCR2 相比 GLM-OCR pipeline,在 word-level F1 上整体更好,尤其尾部分位数提升明显,很多 pipeline 的失败案例都来自 layout detector 漏检。作者还记录了单卡 RTX 5090 的吞吐测试、DPI 取舍、重复输出 loop 的修复经验,以及 mm-processor-cache、ninja 等部署细节。

所属事件:OvisOCR2登顶文档解析榜并发布技术报告(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →