Grounded Document Agent:长 PDF 问答带页码引用,全本地跑通
Roger_M_Taylor · x · 2026-09-22
一个开源的 Grounded Document Agent 项目(GitHub 3.7k star):对长 PDF 提问,答案附带编号引用,可追溯到具体页面的原文。
- 核心观点:很多文档 agent 的失败不是检索问题,而是解析阶段就丢了信息——表格被拍平、图表失去结构、阅读顺序错乱,再好的 embedding 也救不回来
- 技术栈:LlamaParse 做 layout-aware 的 Markdown 转换并保留页码元数据;LlamaIndex 负责索引与检索;Ollama 本地跑 embedding 和 qwen3:4b-instruct 模型
- 流程:检索最相关段落→生成带 [1][2] 编号引用的答案→可逐条查看引用来源原文
配套文章讲解了完整构建思路,代码在 Sumanth077/Hands-On-AI-Engineering 仓库。
「编程与Agent」频道最新
- 儿童故事 App 的 agent 记忆难题:哪些细节该进永久记忆? — Miserable-Shock3552 · 2026-09-22
- 开发者用 Gemini Flash Lite 做近实时编辑助手,将开源为 Chrome 扩展 — Saboo_Shubham_ · 2026-09-22
- 本地 MLX 大战托管 API:两个 AI 决策模型对玩 Chrome 恐龙游戏 — usamawahabkhan · 2026-09-22
- 文件监听静默丢事件一个月:一次 agent 日志竞态 bug 的完整复盘 — ClaudeCdGuy · 2026-09-22
- D-RAC 文档切块法省 95.7% token,企业 RAG 摄取成本降 78%~86% — Yellow-AI-NLP · 2026-09-22
- Agent 工具调用超时后动作是否执行?一套确认机制设计方案 — felix_baron · 2026-09-22