端到端文档解析模型OvisOCR2

Shiyin Lu · hf · 2026-07-16

这是一个 0.8B 文档解析模型 OvisOCR2 的技术报告,目标是把单页文档图像直接转成按自然阅读顺序排列的 Markdown,并覆盖文本、公式、表格和视觉区域。

作者构建了一条数据引擎:

训练流程包含:

结果上,OvisOCR2 在 OmniDocBench v1.6 上拿到 96.58 的总体分数,达到当时榜首;在 PureDocBench 上也取得 75.06 的最高 Avg3。作者还在自建的长尾和困难场景基准上做了评估,结果同样领先,说明它不仅在公开榜单上强,在泛化和鲁棒性上也表现不错。

所属事件:OvisOCR2登顶文档解析榜并发布技术报告(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →