腾讯开源微信端到端文档解析模型 WeVisDoc,整页图直出 Markdown

xiaohu · x · 2026-09-19

腾讯微信视觉团队开源端到端文档解析模型 WeVisDoc,提供 2B 与 4B 两个版本:输入一张文档页面图,单模型一次输出完整 Markdown——正文为 Markdown、公式转 LaTeX、表格转 HTML,并自动恢复阅读顺序,无需额外部署版面检测器或 OCR 引擎。2B 适合资源受限和清晰页面场景,4B 在拍照、翻拍等退化页面上更有优势。

所属事件:腾讯开源 WeVisDoc 文档解析模型登顶 OmniDocBench(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →