OvisOCR2:0.8B 本地文档解析模型
Sad_External6106 · reddit · 2026-07-13
Reddit 用户介绍了 OvisOCR2,一款本地可跑的 0.8B 端到端文档解析模型,基于 Qwen3.5-0.8B。
它的目标是把整页文档直接转换成结构化 Markdown,覆盖:
- 纯文本
- 表格
- 公式
- 阅读顺序
帖子提到模型卡上的结果:
- OmniDocBench v1.6:96.58
- PureDocBench:75.06
此外,权重以 Apache 2.0 开源,并且支持 vLLM。作者认为它在体量这么小的情况下表现很亮眼,但也强调仍需要更多真实场景测试,并询问大家是否和 GLM-OCR、PaddleOCR-VL、MinerU、Chandra 做过对比。
所属事件:阿里发布本地文档解析模型 OvisOCR2(4 条相关)→
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11