pdf-mcp 把技术 PDF 转成结构化文本和可搜索图像
tom_doerr · x · 2026-07-29
pdf-mcp 是一个面向 LLM 的 PDF MCP 服务器,用来读取、渲染和搜索 PDF 文档。
- 基于 PyMuPDF / PyMuPDF4LLM,可将 PDF 内容提取为 JSON、Markdown 或 HTML。
- 支持把页面渲染成可配置的 PNG 图片,便于处理图表、表格和其他视觉内容。
- 提供的工具包括:
- getpdfinfo:读取文件元数据
- gettableofcontents:获取目录/书签
- getpagetext:按页范围抽取文本
- getpageimage:渲染页面图片
- searchtext:跨全文搜索
项目定位很明确:帮助 LLM 自动检索 datasheet、manual 以及其他技术类 PDF。
「编程与Agent」频道最新
- 开发者把编码流程拆成 Opus 5 规划、M3 执行 — truecakesnake · 2026-07-29
- 一个小型 AI agent 用两道看门狗拦截生产前坏动作 — tushaarmehtaa · 2026-07-29
- 50 美元的 DJI 麦克风,让语音编程能在公共场合低声进行 — tdhopper · 2026-07-29
- Coding Agent 正在悄悄锁死项目早期决策 — bibryam · 2026-07-29
- Anthropic 工程师:Agent 要会自己提示自己 — blaizedsouza · 2026-07-29
- Reddit 用户实测对比固定价 AI 编程订阅 — krisurbas · 2026-07-29