PatSnap 用 0.3B OCR 模型做专利识别,基准接近 MinerU 2.5
Brilliant_Rich3746 · reddit · 2026-07-28
PatSnap 发布了面向专利文档的 MOSS-OCR,这是一个 0.3B 参数的 OCR 模型。
- 训练数据超过 5000 万样本,且以专利领域数据为核心,重点解决专利场景里常见的表格结构丢失、化学式损坏、CJK/拉丁混排公式错乱等问题。
- 这个模型只做块级识别,默认布局检测和阅读顺序已经由外部流程处理,因此能保持更小、更快。
- 在 OmniDocBench v1.6 上,它以约 25% 的参数量,做到与 MinerU 2.5 接近的整体分数 94.46。
- 在自建的 patent-bench 上,它排到第一,得分 93.49;官方还报告单张 RTX 4090 上约 59 QPS,吞吐约为 MinerU 2.5 的两倍。
- 项目采用 Apache 2.0 开源许可,另外还提供了把布局检测和 OCR 封装到一起的 Hiro-Smart-Doc 服务。
「应用」频道最新
- PostHog 把刺猬吉祥物做成了“产品自动驾驶”梗图 — thedealdirector · 2026-07-28
- Codex 自动化每小时盯房源,先一步抢到旧金山公寓 — nickbaumann_ · 2026-07-28
- Google AI Overviews 一年内占比从 15% 升至 43% — HaktanSuren · 2026-07-28
- LM Studio 上线 Kimi K3:2.8T 参数支持百万上下文 — gnukeith · 2026-07-28
- Neo4j Aura 支持一键 PDF 转知识图谱 — JeremyCMorgan · 2026-07-28
- 一个原型把 Agent 编程改成协调式并行工作流 — Wattenberger · 2026-07-28