MonkeyOCRv2 受控实验显示文档视觉编码器能拉开 13.2 分
机器之心 · wechat · 2026-07-26
为什么文档视觉编码器这么重要
MonkeyOCRv2 做了一个很“硬”的受控实验:把语言模型、训练数据、优化设置和解码流程全部锁死,只替换视觉编码器。结果在 8 个文档理解基准上,MonkeyOCRv2-B 拿到 57.2 分,比最强对照 OpenVision-B 高出 13.2 分。
论文想证明什么
- 文档任务里,真正关键的是字符、数字、公式、版面和阅读顺序等细粒度证据,不能像自然图像那样过度追求语义不变性。
- 论文把 重建(reconstruction) 解释为一种“视觉记忆”测试:如果编码后的表示还能帮助恢复页面,就说明它保留了更多有用信息。
- 相比纯文本生成,加入重建目标后,模型在语言捷径被削弱时更稳。
关键实验
- 在字符顺序打乱、分辨率降低的设置下,不用重建的模型识别率为 55.4%,加入重建后提升到 72.1%。
- 在让视觉证据与语言常识冲突的 CHAOS-Bench 上,重建版本在同模型消融里把页面级召回从 12.1 提到 14.7。
- 把 MonkeyOCRv2 视觉编码器替换进不同下游任务后,OCR、公式识别、文字检测、文档篡改检测、重叠文字分割等任务都能稳定提升。
更大的结果
系统在 17 种语言的 MDPBench 上拿到 83.3,作者还发布了 MonkeyDocv2:一个包含 1.13 亿张文档图像 的公开数据集,目标是让后续比较更可复现。
所属事件:MonkeyOCRv2 以不足 1B 参数刷新文档解析纪录(2 条相关)→
「多模态」频道最新
- Reddit 展示一段 AI 生成的健身操视频 — fox-and-grapes6732 · 2026-07-26
- Fable 把塞尚风城市建造成了可试玩手势游戏 — emollick · 2026-07-26
- Opus 5 被称 3D 表现惊艳,但并非全能更强 — TAbrodi · 2026-07-26
- 横滨街景用 1018 张照片重建成 400 万点 3DGS — janusch_patas · 2026-07-26
- AI 图像工具开始擅长把复合照片改成新构图 — RachelVT42 · 2026-07-26
- 创作者分享 Midjourney 新风格与完整提示词参数 — azed_ai · 2026-07-26