百度开源长文档OCR模型

TheTimHayden · x · 2026-07-20

百度开源了 **Unlimited-OCR**,一个面向整份文档的 OCR 模型,主打一次处理长文档而不是按页切分。 它参数量 30 亿,但推理时只激活 5 亿参数;支持本地运行,拥有 32K 上下文窗口,能更好保留跨页的文本、公式、表格和阅读顺序,并直接输出结构化 Markdown。 作者给出的数据包括:标准基准 **93% 准确率**、比基线高 **6 个点**,且在超过 40 页后错误率仍低于 **0.11**。同时它支持多语言,Hugging Face 上月下载量达 **212 万**,GitHub 星标 **1.46 万**。

所属事件:百度开源Unlimited-OCR长文档识别模型(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →