百度开源长文档OCR模型
TheTimHayden · x · 2026-07-20
百度开源了 Unlimited-OCR,一个面向整份文档的 OCR 模型,主打一次处理长文档而不是按页切分。
它参数量 30 亿,但推理时只激活 5 亿参数;支持本地运行,拥有 32K 上下文窗口,能更好保留跨页的文本、公式、表格和阅读顺序,并直接输出结构化 Markdown。
作者给出的数据包括:标准基准 93% 准确率、比基线高 6 个点,且在超过 40 页后错误率仍低于 0.11。同时它支持多语言,Hugging Face 上月下载量达 212 万,GitHub 星标 1.46 万。
所属事件:百度开源Unlimited-OCR长文档识别模型(4 条相关)→
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11