腾讯开源微信端到端文档解析模型 WeVisDoc,整页图直出 Markdown
xiaohu · x · 2026-09-19
腾讯微信视觉团队开源端到端文档解析模型 WeVisDoc,提供 2B 与 4B 两个版本:输入一张文档页面图,单模型一次输出完整 Markdown——正文为 Markdown、公式转 LaTeX、表格转 HTML,并自动恢复阅读顺序,无需额外部署版面检测器或 OCR 引擎。2B 适合资源受限和清晰页面场景,4B 在拍照、翻拍等退化页面上更有优势。
所属事件:腾讯开源 WeVisDoc 文档解析模型登顶 OmniDocBench(3 条相关)→
「多模态」频道最新
- ComfyMax 音乐视频导演工作流:AI 生成 MV 制作进行中 — DanielVeres · 2026-09-19
- Jina AI 发布 jina-ocr-v1 文档理解模型,冲上 Hugging Face 热榜 — jinaai · 2026-09-19
- Reddit 求助:能否用 Agent 自动搭建 ComfyUI 视频工作流 — Hopeful-Election-783 · 2026-09-19
- 单词提示词系列:用苏格兰词 Aefauld 生成诚意肖像 — tisch_eins · 2026-09-19
- Awwwards-mcp:把获奖网站变成agent可读的设计参考库 — _insane7 · 2026-09-19
- 开源工具 Story Illustrator:本地 LLM + ComfyUI 自动为小说配插图 — Natrimo · 2026-09-19