企业文档解析流水线开源:单张 H200 每分钟啃 118 页 PDF
Low_Acanthisitta7686 · reddit · 2026-09-02
作者为企业(航空、金融、10 万+文档库)构建智能体与文档 AI 系统,曾基于 10.8 万份 NASA 技术报告搭建搜索系统,现以 Apache 2.0 开源其反复复用的解析流水线 Meridian(github.com/Rajsuthan/meridian)。
架构与做法
- 六步流水线:Docling 做版面分析与表格/图/公式区域提取;脚本在公式页画编号框,让视觉模型知道你在问哪个;所有表格、图和公式页并发送 VLM(Qwen3-VL-8B on vLLM);VLM 描述按原顺序注回文本块,经 Ollama 嵌入存入 Qdrant。
- 无状态 Celery worker(CPU)通过 HTTP 调用长驻 GPU 服务,模型只加载一次被共享;8 个 Docling 实例用 Redis 原子计数器做负载均衡,带看门狗自动重启,批状态存 Redis 支持暂停/恢复/重试。
实测数字(单张 H200,含 VLM 与嵌入):20 篇论文 118.7 页/分钟;25 份阿波罗时代 NASA 报告首跑 82.9 页/分钟但 5 份触发 9 分钟 Celery 软限需重试;调参后 77.2 页/分钟零失败。单文档约 10 页/分钟——吞吐来自多文档并行处于不同阶段,而非单文档快。
另有纯文本路径(pypdfium2,零 GPU):32 个 CPU worker 不到一分钟处理 1000 份 NASA 文档,但丢失所有表格与图。完整调参表与踩坑记录在 SETUPNOTES.md。
所属事件:企业级文档解析流水线 Meridian 开源,H200 每分钟处理 118 页(2 条相关)→
「编程与Agent」频道最新
- 警示:缺乏纪律地使用 AI 编码正导致灾难性隐患 — bendee983 · 2026-09-02
- NVIDIA 联手 CrowdStrike 测试 AI 智能体防御未知网络攻击 — NVIDIAAI · 2026-09-02
- 开源 Auto-Company:14 个 AI Agent 组队全天候自动开发产品 — tom_doerr · 2026-09-02
- 用双钻模型和 MoSCoW 框架减少 AI 冗余代码 — james_mtc · 2026-09-02
- 微软工程师实测 Omarchy:Copilot 自动修 GPU 与触控板问题 — DanWahlin · 2026-09-02
- 资深 AI 工程面试不考名词解释,考的是「系统在生产环境炸了怎么办」 — imlaleeth · 2026-09-02