OvisOCR2登顶文档解析榜
Littlepharaoh · reddit · 2026-07-15
作者分享了对 OvisOCR2(0.8B) 的实测,它是一个端到端文档解析 VLM,基于 Qwen3.5-0.8B 继续预训练,Apache 2.0 许可,可在 vLLM 0.22.1 上运行。模型在 OmniDocBench v1.6 上拿到 96.58,并且是第一个登顶该榜单的端到端模型,以前榜首基本都是“检测 + 裁切 + OCR + 重组”的流水线方案。
作者解释了端到端的优势:流水线 OCR 的问题往往出在版面检测阶段,一旦漏掉区域,文字就直接丢失;而端到端方案没有这个单点失败。也因此,部署更简单,只需一个模型和一套 serving stack。
随后作者给出自己用 827 份真实扫描医疗文档做的对比测试:OvisOCR2 相比 GLM-OCR pipeline,在 word-level F1 上整体更好,尤其尾部分位数提升明显,很多 pipeline 的失败案例都来自 layout detector 漏检。作者还记录了单卡 RTX 5090 的吞吐测试、DPI 取舍、重复输出 loop 的修复经验,以及 mm-processor-cache、ninja 等部署细节。
所属事件:OvisOCR2登顶文档解析榜并发布技术报告(2 条相关)→
「多模态」频道最新
- H3 长视频实验:int8 32步渲染7小时,吃满192GB内存 — SIR_NVAX_A_LOT · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- RunningHub 开源 H3Lightning:MiniMax H3 视频生成提速约 12 倍 — 智东西 · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11