MonkeyOCRv2 将文档 OCR 压到 0.7B 参数并反超 3B 开源模型
量子位 · wechat · 2026-07-26
MonkeyOCRv2 把文档 OCR 继续推向“小模型时代”:0.6B 版本在 MDPBench 上拿到 82.5 分,0.7B 版本达到 83.3 分,双双超过此前 3B 的开源领先模型 dots.mocr(80.5)。
- 核心思路不是单纯缩参数,而是重新分配职责:让更强的视觉编码器尽量把字符、公式和版面看清,再让更小的语言模型负责组织和理解。
- 训练上同时用了 图像到文本生成 和 像素级文档重建,目的是让视觉 token 保留足够的笔画、符号和版面结构证据,减少后端“猜字/补字”。
- 团队还开源了 MonkeyDocv2:共 1.13 亿张文档图像、覆盖 17 种语言,并放出了代码、权重、Demo 和部署示例,许可证为 Apache 2.0。
- 文章还提到,同一套视觉编码器迁移到文字识别、公式识别、文档篡改检测、分割、解析和理解等任务后,整体都有稳定提升。
所属事件:MonkeyOCRv2 以不足 1B 参数刷新文档解析纪录(2 条相关)→
「Infra」频道最新
- 论文展示 460 Gbit/s 悬空钽酸锂 MZM 调制器 — jwt0625 · 2026-07-26
- 微调框架对比忽略关键前提,EP 和 SP 组合能跑到 2M 上下文 — StasBekman · 2026-07-26
- BYOK 模型服务陷入价格战,中转站最后变成客服 — yangyi · 2026-07-26
- Reddit 讨论 RTX PRO 4500 是否只适合低功耗长跑 — meikawaii · 2026-07-26
- 企业 AI 用量风向变了:从 token maxxing 转向 budget maxxing — 0xsachi · 2026-07-26
- 对比 Google TPU、Gemini 与 xAI 的 10T 训练说法 — imjustnewatai · 2026-07-26