仅 1590 万参数的 Kraken OCR 模型,历史文本识别超越大数百倍 VLM
vanstriendaniel · x · 2026-09-03
开源历史文献识别系统 Kraken 的专用 OCR 模型 PP-OCRv6 只有 15.9M 参数,却在 2165 页历史文献评测集上排名阅读字符错误率(CER)第 4,并在保留长 s、连字和大小写信息时排名第一,胜过许多体积大数百倍的通用视觉语言模型。
- Kraken 是面向人文学科的开源自动文本识别(ATR)系统,专为历史文献与非拉丁文字设计
- 支持可训练的版面分析、阅读顺序与字符识别,以及从右到左、双向、竖排文字
- 提供 CLI 与 Python API,输出 ALTO、PageXML、abbyyXML、hOCR 等格式,模型仓库 HTRMoPo 公开可用
- 作者还透露因模型表现太好,不得不调整绘图逻辑才能让结果正常显示
对小参数专用模型在低资源语言与长尾数字化场景的潜力是很好的印证。
所属事件:1590万参数专用OCR模型击败数百倍大的VLM(2 条相关)→
「模型」频道最新
- 博主对比发现海外模型订阅均价远低于国内 token 套餐 — yihui_indie · 2026-09-03
- 实测排名:Fable 5.1超Claude Opus,RL环境生成最强 — HarveenChadha · 2026-09-03
- 哲学家称 Fable 5.1 找出 Arrhenius 不可能性定理并不成立 — willmacaskill · 2026-09-03
- Reddit 用户称 OpenAI 大规模封号:付了费却被禁用服务 — Existing-Slide7395 · 2026-09-03
- 实测 Gemini 语音转写模型出色,作者开源 Windows 听写工具 AivoRelay — lvvy · 2026-09-03
- Meta 新模型 Muse 突吐中文字符,网友猜蒸馏自中国模型 — zsakib_ · 2026-09-03