当 trace 看起来正常但结果出错:Agent 调试的盲区在哪

Sensitive-Parsnip-12 · reddit · 2026-10-02

作者分享用调查工具筛查可疑 trace 的经验:当证据在 trace 里时,能有效定位状态变更、工具参数改动、缺失步骤、重试、eval 变化、以及「声称完成但未验证」等常见问题。

但更难的是 trace 看起来正常、问题出在别处的情况:配置被改、数据库状态过期、权限、缓存、模型/供应商切换、外部 API 行为、写入假成功、关键信息未被记录等——这时盯着 trace 再久也找不到根因。

作者向社区提问:你们在真实事故中是怎么发现「trace 本身不够」的?最终靠什么暴露问题(数据库查询、infra 日志、加日志重放、生产配置、写后重读、外部 API 日志等)?以及有没有办法提前判断一份 trace 缺失关键证据,而不是一小时后才发现?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →