开源 MCP 工具 DocSlicer:精准解析长文档,为 Agent 节省 90% Token
Important_Proof5480 · reddit · 2026-08-12
一款名为 DocSlicer 的开源 MCP 工具能有效帮助 AI 智能体处理超长文档(如数百页的 PDF),在提供精确引用的同时节省超过 90% 的 Token 消耗。
- 解决痛点:直接将长文档塞入上下文会导致 Token 爆炸,而传统的 grep 关键词搜索往往因为词不达意而失效,且无法提供准确的页码引用。
- 核心机制:DocSlicer 提供三个核心动作:
- parse:返回文档的标题大纲,并为每个章节标注所需的 Token 成本。
- read:精准提取选定章节的内容,保留表格结构并附带页码,确保引用真实可靠。
- search:作为备用方案,用于在标题不明确时定位特定关键词。
- 实测案例:针对长达 372 页、包含 51 万 Token 的汇丰银行年报,Agent 仅通过两次工具调用(先花约 7.2k Token 获取大纲,再花 259 Token 读取目标段落),就精准提取了特定财务数据并附带了准确的页码引用。
「编程与Agent」频道最新
- 观点:AI 消灭了代码的「巴士因子」,重塑软件评估标准 — Elijah_Meeks · 2026-08-12
- oh-my-pi v17.2.14 发布:支持外部思考与禁用推理 — banteg · 2026-08-12
- Sourcegraph:AI生成代码加剧跨仓库安全漏洞蔓延 — glenbeer · 2026-08-12
- 微软新研究:自然语言技能注入,让 Agent 推理成本降 6 倍 — dair_ai · 2026-08-12
- Codex CLI更新:resume与fork实现瞬间加载 — charliermarsh · 2026-08-12
- 放弃手写代码:重度依赖 AI 编程一年后的实战反思 — UAP44 · 2026-08-12