Jerry Liu 提出"Just-in-Time OCR":Agent 两遍式文档处理模式
solyarisoftware · x · 2026-09-15
LlamaIndex 创始人 Jerry Liu 将主流 agent harness(Cowork、Codex、Grok 等)处理用户上传文档时的通用做法命名为 "Just-in-Time OCR",并总结了它的两遍式模式:
- 第一遍(快而轻):用免费/开源文档解析工具(如 pypdf、LiteParse)对全部文档做布局感知的快速解析——提取空间文本、标题、表格、边界框,并为每页打上复杂度标记。LlamaIndex 称可在 32 秒内解析完整个 data room。
- 第二遍(just-in-time):仅对 agent 真正要读的少数页面,调用专门的 OCR 工具(如 LlamaParse)做精确转写,返回单元格级表格、边界框和置信度分数,其余页面留在后台。
- 该模式适用于 10100 份文档的小中型批次,以成本和延迟换精度;不能替代大规模离线索引与检索。
- 他指出前沿 agent harness 的"默认"做法(pypdf + 原生 VLM 第二遍)既贵又不准。
- 传统 pypdf/pdftotext 甚至无法胜任第一遍的布局解析,绝大多数被解析的页面其实永远不会被阅读。
这是对 agent 文档工作流中一种正在形成的实践的模式化总结,对构建文档处理 agent 很有参考价值。
所属事件:LlamaIndex 提出 Just-in-Time OCR 两段式文档处理(2 条相关)→
「编程与Agent」频道最新
- 最小可用编码 Agent 只需 5 个工具函数:读写、目录、执行、搜索 — Al_Grigor · 2026-09-15
- 实测两月后禁掉 agent 自写测试:从未抓到真 bug 还烧时间 — it_beaver · 2026-09-15
- 开发者用 Astra 重做 Chain Lightning 技能,动画与伤害自动对齐 — Dimillian · 2026-09-15
- DuckDB 扩展 FlockMTL:在 SQL 里直接调用 LLM 与 RAG 做分析 — _reachsumit · 2026-09-15
- 国内首款 Claude Tags 类产品:飞书×豆包发布「豆包工作伙伴」实测 — APPSO · 2026-09-15
- 第一手检索定成败:Question's Gambit 把 agent 答题准确率提至 90.5% — _reachsumit · 2026-09-15