VLM/LLM 时代的 OCR 错误没有变少,只是变得更安静了
Early-Sir-932 · reddit · 2026-09-24
作者指出一个被低估的工程事实:从 Tesseract 类传统 OCR 迁移到 VLM/LLM 抽取后,错误模式从「响亮失败」变成了「安静失败」。老 OCR 输出乱码和逐字符置信度可供阈值过滤;而大模型在视觉证据不足时会用最可能的 token 补全,产出通顺但错误的文本——表格掉一行不留空洞,账号或日期悄悄漂移成更常见的值。
要点:
- logprobs 是对 token 而非页面字形而言的,高置信只说明语言上通顺,不代表与图像一致,置信度指标失效;
- 已有专门的探测研究和跨模态错误率指标来捕捉 VLM 文本幻觉;
- 主流 OCR 榜单 94%+ 但已饱和且多为干净文档,悄悄排除了真正易错的财务表格、法律文件、手写体;有基准显示杂乱企业文档上的内容忠实度最好也只有约 90%,相当于每 10 页错 1 页——而这正是厂商用来宣传的数字;
- 可行对策:把每个值绑定回 bbox/页面 span 以便对照像素校验(docling、LlamaParse 会返回框,但很多管线直接丢弃);对总数/校验和对账;以及用只会说「不/不支持」的廉价二次检查代替重新抽取。
核心问题是:如何在不为全部文档双倍付费的前提下,在持续工作流中抓住这些静默错误。
「编程与Agent」频道最新
- GitHub 推新设置助维护者应对 agent 编码洪流, keyof 演讲公开 — marlene_zw · 2026-09-24
- Next.js 预告 9 月 30 日安全更新:一次修复 9 个漏洞 — cramforce · 2026-09-24
- 观点:Agent 时代的核心是学会描述目标而非下达任务 — manosaie · 2026-09-24
- 开源 WorkSwarm:5 人共享一个 Agent 跑 189 轮,SWE-bench Lite 提升至 87% — HeyZoyaKhan · 2026-09-24
- 开发者自建 44 个专有工具,称工具组合让 agent 远超裸模型 — D3VAUX · 2026-09-24
- 开源项目用 AI 逐个逆向解构老游戏,首批已覆盖 7 款 C64 经典 — Vjeux · 2026-09-24