用 agent 解析 PDF 到 JSON,大家怎么做才稳
Slothilism · reddit · 2026-07-21
楼主在问:用 agent 处理 PDF 时,大家到底怎么做预处理/后处理,才能稳定抽取信息?
他的场景是把不同供应商的 PDF 报告解析成可供下游工具使用的有效 JSON,比如提取报告中的邮箱、MD5 hash 等字段。最初他尝试直接抽 PDF 文本再配合正则,但遇到了很多典型问题:
- PDF 排版导致邮箱被拆开
- hash 因换行或空格被破坏
- 有些文档是图片,直接抽文本根本不行
因此他想请教社区:大家是靠 OCR、直接把 PDF 原文件交给模型,还是先做某种预处理/后处理管线?他也想知道有没有现成的 GitHub 工具可用。
「编程与Agent」频道最新
- 一个 MCP 服务器把 AI agent 每次工具调用都签进可验证 Merkle 链 — Funky_Chicken_22 · 2026-07-22
- Claude Code 团队访谈逐字稿已整理公开 — trq212 · 2026-07-22
- 10 条 Markdown 规则把 Claude Code 改成 ADHD 友好输出 — alex_verem · 2026-07-22
- BUZZ 发布开源群聊平台,主打人机团队协作 — Scobleizer · 2026-07-22
- 一个基于 Firecracker 的平台称可在 256 GB 服务器上跑 6000 个 AI agent — maritime_sh · 2026-07-22
- 智能体自治别急着放权,先跑波次找摩擦点 — JnBrymn · 2026-07-22