Unlimited-OCR 一次读完整份 PDF
Shruti_0810 · x · 2026-07-20
中国团队开源了 Unlimited-OCR,一个 30 亿参数的 OCR 模型,主打“一次读完整份文档”。
- 使用 32K 上下文窗口,不再按页切分处理
- 能保留跨页上下文,对表格、引用、长文档更友好
- 在标准 OCR 基准上做到 93%,比基线高约 6 分
- 40 页以上的错误率据称 低于 0.11
- 支持 Transformers、vLLM、Ollama、Docker、llama.cpp 等,本地即可运行
原帖强调,这种做法比很多仍按页处理的企业 OCR 系统更可靠,而且下载后本地使用不需要按页付费。
所属事件:百度开源Unlimited-OCR长文档识别模型(4 条相关)→
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27