Unlimited-OCR 一次读完整份 PDF
Shruti_0810 · x · 2026-07-20
中国团队开源了 **Unlimited-OCR**,一个 30 亿参数的 OCR 模型,主打“一次读完整份文档”。 - 使用 **32K 上下文窗口**,不再按页切分处理 - 能保留**跨页上下文**,对表格、引用、长文档更友好 - 在标准 OCR 基准上做到 **93%**,比基线高约 **6 分** - 40 页以上的错误率据称 **低于 0.11** - 支持 **Transformers、vLLM、Ollama、Docker、llama.cpp** 等,本地即可运行 原帖强调,这种做法比很多仍按页处理的企业 OCR 系统更可靠,而且下载后本地使用不需要按页付费。
所属事件:百度开源Unlimited-OCR长文档识别模型(4 条相关)→
「多模态」频道最新
- 拆解 AI 图像生成:主体、环境与镜头三要素决定画面动态感 — GPU_FieldNotes · 2026-07-21
- MiniCPM-V 4.6 已可在 iPhone 本地运行,无需云端依赖 — amos_gyamfi · 2026-07-21
- AI 动作图像为何仍显静态:姿势、动势和镜头要一起到位 — Jaded-Term-8614 · 2026-07-21
- 他不再用相机拍摄,而是直接用提示词“出片” — taherdhanera · 2026-07-21
- PixVerse 做出一支完整火星科幻黑色喜剧短片 — aliscodes · 2026-07-21
- 阿里 Qwen-Audio-3.0-TTS-Plus 登顶 Speech Arena 榜单 — airesearch12 · 2026-07-21