WeVisDoc-4B 端到端领先,但优势集中在公式与表格解析

xiaohu · x · 2026-09-19

腾讯微信视觉团队的 WeVisDoc 开源后,作者补充评测细节:4B 版在端到端模型中整体领先,优势主要来自公式和表格解析;处理以文字为主的文档时,文字识别成绩需单独查看。技术报告显示其在 OmniDocBench v1.6 与 PureDocBench 三个赛道(干净/算法退化/真实采集)的端到端类别居首,但在全部模型横向对比中并非全面第一:PureDocBench 综合分第一主要靠公式与表格,纯文字识别不是最强,OmniDocBench 输给 MinerU 等两个流水线系统,真实拍摄页输给两个通用大模型。模型基于 Qwen3-VL 2B/4B 底座,训练采用先广覆盖、再按残差区分缺数据还是练得少的两段式方法。

所属事件:腾讯开源 WeVisDoc 文档解析模型登顶 OmniDocBench(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →