端到端文档解析模型OvisOCR2
Shiyin Lu · hf · 2026-07-16
这是一个 0.8B 文档解析模型 OvisOCR2 的技术报告,目标是把单页文档图像直接转成按自然阅读顺序排列的 Markdown,并覆盖文本、公式、表格和视觉区域。
作者构建了一条数据引擎:
- 使用过滤后的真实文档标注
- 再加入由同一 HTML 源渲染出的合成页面,保证图像与 Markdown 目标一致
训练流程包含:
- supervised fine-tuning
- 在 4B 分支上做强化学习,奖励设计由多个组件构成
- on-policy distillation 回到 0.8B 模型
- model fusion
结果上,OvisOCR2 在 OmniDocBench v1.6 上拿到 96.58 的总体分数,达到当时榜首;在 PureDocBench 上也取得 75.06 的最高 Avg3。作者还在自建的长尾和困难场景基准上做了评估,结果同样领先,说明它不仅在公开榜单上强,在泛化和鲁棒性上也表现不错。
所属事件:OvisOCR2登顶文档解析榜并发布技术报告(2 条相关)→
「多模态」频道最新
- H3 长视频实验:int8 32步渲染7小时,吃满192GB内存 — SIR_NVAX_A_LOT · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- RunningHub 开源 H3Lightning:MiniMax H3 视频生成提速约 12 倍 — 智东西 · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11