LlamaIndex 提出两段式即时 OCR:数据室解析从全量前置改为按需深入
llama_index · x · 2026-09-15
LlamaIndex 官方推文介绍「just-in-time OCR」两段式处理模式,指出传统管线在任何人提问前就解析全部页面,对 agent 处理临时数据室来说又慢又贵,且大量页面永远不会被读。
推荐的两遍方案:
- 第一遍:用 LiteParse(免费开源、Rust 编写、支持 50+ 格式)做快速布局感知解析,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据室 32 秒完成。
- 第二遍:LlamaParse 只对标记为复杂的页面按页号深入解析,返回单元格级表格、边界框和置信度分数,其余页面留作背景信息。
作者认为 pypdf 和 pdftotext 做不好第一遍,而全量前置解析则做不到低成本,两遍方案兼得速度与精度。
「编程与Agent」频道最新
- 开源 Codex skill「Relay」:线程驱动的轻量多智能体编排 — daniel_mac8 · 2026-09-15
- 开源项目 Relay:让 Codex 主任务派发子任务,一条消息回报结果 — daniel_mac8 · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- 从零手写 Agent Harness:资深研究者的入门指南 — omarsar0 · 2026-09-15
- 从零构建 Agent Harness 入门指南:LLM 模块、工具模块与主循环三件套 — ryunuck · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15