前沿多模态模型会吞掉 Docling/Marker 这类 PDF 解析层吗?
lucasbennett_1 · reddit · 2026-09-23
Reddit 上一场关于文档提取管线的讨论:目前多数流程仍先用 Docling、Marker、LlamaParse、Surya 等专用解析器把 PDF 转成干净文本/Markdown,再喂给 LLM,但前沿多模态模型正在直接读页面且越来越便宜,这条解析层会不会被吸收?
模型吞并解析器的理由
- 能力持续攀升,原生 PDF/视觉输入已成标配
- 去掉解析器就少一个需要维护的依赖,管线更简单
解析层仍会留存的理由
- 版面、表格、以及「值属于哪个单元格」这类 grounding(能指回页面上具体区域)是不同于读文本的问题,相关 benchmark 仍有争议
发帖人未站队,想听各方判断,整体是关于 RAG/文档管线架构走向的开放讨论。
「编程与Agent」频道最新
- 社区把 kev 移植到 LiquidAI 的 LFM2.5-350M,取名 lev — helloiamleonie · 2026-09-23
- 开发者晒「软件工厂」:32 个 AI 编码智能体日吞 50-100 亿 token — BLUECOW009 · 2026-09-23
- 开发者分享用 Jev 构建 AI 内容审核应用实战 — amos_gyamfi · 2026-09-23
- 韩语开发者吐槽:无法验证 AI 产出是否合格才是真问题 — algo_diver · 2026-09-23
- Xeophon:$/task 才是该看的指标,输出 token 不到用量 5% — xeophon · 2026-09-23
- 多人共用的 AI Agent 该长什么样?共享画布或优于群聊框 — max__drake · 2026-09-23