MonkeyOCRv2 创开源 SOTA,超越 Qwen3-VL-235B
jiqizhixin · x · 2026-08-07
华中科技大学与金山办公联合提出文档 AI 基础模型 MonkeyOCRv2。该模型基于 1.13 亿张、覆盖 17 种语言的文档图像进行训练,能从像素级理解文字及其笔画形态。
实验显示,其识别准确率从 58.7% 提升至 67.3%,在 MDPBench 上创下开源新纪录,并在文档解析与理解任务上超越了 Qwen3-VL-235B 等参数量远大于它的模型。
「研究」频道最新
- 4B开源模型结合Castform,搜索成本降百倍匹敌GPT-5.6 — petrusenko_max · 2026-08-07
- 顶尖学者发文:构建 AI 驱动的“智能实验室”,加速科学发现 — MengdiWang10 · 2026-08-07
- Gary Marcus 激辩神经符号 AI 定义:工具调用不算数 — GaryMarcus · 2026-08-07
- GraphRAG 进军房地产:分层知识图谱重塑物业管理 — adnan_hashmi · 2026-08-07
- 无需语言的思考:什么是 AI 的潜在推理能力? — mikeflache · 2026-08-07
- GPT Codex 多智能体协作,已在 Lean 中封印超 1.5 万个定理 — GiorgioPatrini · 2026-08-07