Agent 出错后如何还原真相:五步搭建 MCP 全链路可观测体系

felix_baron · reddit · 2026-09-25

作者提出一套开源的 agent 可观测性方案,解决「agent 工具调用超时后谎报任务完成」这类事故无从追溯的问题。核心思路:

1. 以任务为单位贯穿全链路

给每个业务任务持久 ID,串联多个会话、多次 agent 运行和人工审核;不维持一个跨越数天的巨型 trace,而是用多个短 trace 关联同一任务,并记录 agent 版本、模型和工具配置。

2. 工具调用两端都可观测

区分「agent 提议动作 → 获批 → 请求发出 → 工具返回结果 → 目标系统状态独立确认」五个阶段;超时应保持「结果未知」,盲目重试写操作可能造成二次伤害。

3. 区分技术错误与无依据回答

HTTP 成功≠工具成功,工具成功≠agent 回答有据。传输错误、工具级错误、回答评估分别采集,尽可能在目标系统验证最终状态(如预订是否真的变更)。

4. 精确定义三种「回放」

浏览器回放(用户看到什么)、执行回放(步骤/响应/失败时间线)、重执行(复现故障,最难且危险)。重放 trace 绝不能静默重复真实的支付、发邮件或数据库写入;建议沙箱 + 录制的工具响应。

5. 复用现有可观测性栈

推荐 Grafana Faro(浏览器信号)+ OpenTelemetry(后端/agent/MCP 埋点)+ Alloy + Tempo(trace)+ Loki(日志)+ Prometheus(指标)+ Grafana(调查视图),可选 rrweb 做浏览器回放。作者提醒常规诊断 trace 可采样,但权威的结果记录须单独完整保留,否则「缺遥测」会被误判为「没干活」。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →