百度开源长文档OCR模型
TheTimHayden · x · 2026-07-20
百度开源了 **Unlimited-OCR**,一个面向整份文档的 OCR 模型,主打一次处理长文档而不是按页切分。 它参数量 30 亿,但推理时只激活 5 亿参数;支持本地运行,拥有 32K 上下文窗口,能更好保留跨页的文本、公式、表格和阅读顺序,并直接输出结构化 Markdown。 作者给出的数据包括:标准基准 **93% 准确率**、比基线高 **6 个点**,且在超过 40 页后错误率仍低于 **0.11**。同时它支持多语言,Hugging Face 上月下载量达 **212 万**,GitHub 星标 **1.46 万**。
所属事件:百度开源Unlimited-OCR长文档识别模型(4 条相关)→
「多模态」频道最新
- 拆解 AI 图像生成:主体、环境与镜头三要素决定画面动态感 — GPU_FieldNotes · 2026-07-21
- MiniCPM-V 4.6 已可在 iPhone 本地运行,无需云端依赖 — amos_gyamfi · 2026-07-21
- AI 动作图像为何仍显静态:姿势、动势和镜头要一起到位 — Jaded-Term-8614 · 2026-07-21
- 他不再用相机拍摄,而是直接用提示词“出片” — taherdhanera · 2026-07-21
- PixVerse 做出一支完整火星科幻黑色喜剧短片 — aliscodes · 2026-07-21
- 阿里 Qwen-Audio-3.0-TTS-Plus 登顶 Speech Arena 榜单 — airesearch12 · 2026-07-21