用 agent 解析 PDF 到 JSON,大家怎么做才稳

Slothilism · reddit · 2026-07-21

楼主在问:用 agent 处理 PDF 时,大家到底怎么做预处理/后处理,才能稳定抽取信息?

他的场景是把不同供应商的 PDF 报告解析成可供下游工具使用的有效 JSON,比如提取报告中的邮箱、MD5 hash 等字段。最初他尝试直接抽 PDF 文本再配合正则,但遇到了很多典型问题:

因此他想请教社区:大家是靠 OCR、直接把 PDF 原文件交给模型,还是先做某种预处理/后处理管线?他也想知道有没有现成的 GitHub 工具可用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →