为什么执行轨迹看不出 agent 是否真的用了检索内容
PersonalityWhich1780 · reddit · 2026-07-29
这篇长文的核心观点是:执行轨迹(execution trace)只能告诉你 agent 走了哪些节点,不能告诉你它最终有没有真正用上检索结果。
作者把问题拆成两类看起来很像、但修复方式完全不同的失败:
- 检索分数高,但答案没用上:说明检索本身可能没问题,问题出在 prompt 或上下文顺序
- 检索相关性低,但答案却用了:说明模型相信了坏证据
由于控制流 trace 只记录 retriever 跑没跑、返回了什么,无法比较“retriever 输出”和“generator 输出”之间的关系,所以看不出 evidence 是否被消费。作者提了几种“是否使用了检索内容”的近似判定方法:
- leave-one-out:删掉某个 chunk 再生成,比较差异
- 词面重叠:用答案与 chunk 的 lexical overlap 做近似判断
- NLI entailment:可能是折中方案,但作者尚未验证
文中还分享了一个真实工程案例:作者做了一个基于 GitHub 事件的知识图谱检索器,加入类型化加权边、不同类型的 recency half-life 和意图路由后,发现过于连接的 hub 节点会被频繁检索却几乎从不被真正使用。后来他们把抑制逻辑从“按节点”改成“按节点+关系”,否则会误删有用边;先前朴素的按节点策略还会静默丢掉 47% 的 PR。工具名是 GraphSight,MIT 许可,可本地运行并通过 pip 安装。
「编程与Agent」频道最新
- 5 个开源工具让 Claude 和 Codex 智能体少用 60% 到 95% token — CodeByPoonam · 2026-07-29
- Codex Micro 应改成语音优先,Git 和 PR 控件取代批准按钮 — rudrank · 2026-07-29
- Agent 团队评估应先规则校验,再用 LLM judge,最后人工复核 — yoobinray · 2026-07-29
- Matt Pocock 把路径地图做成 Cmd+K 面板规格 — mattpocockuk · 2026-07-29
- GitHub 规格说明把图形编辑器做成 Cmd+K 命令面板 — mattpocockuk · 2026-07-29
- Codex 现在也能做基础视频剪辑:裁切、字幕、打码和标题卡 — gabrielchua · 2026-07-29