Agent 出错后如何还原真相:五步搭建 MCP 全链路可观测体系
felix_baron · reddit · 2026-09-25
作者提出一套开源的 agent 可观测性方案,解决「agent 工具调用超时后谎报任务完成」这类事故无从追溯的问题。核心思路:
1. 以任务为单位贯穿全链路
给每个业务任务持久 ID,串联多个会话、多次 agent 运行和人工审核;不维持一个跨越数天的巨型 trace,而是用多个短 trace 关联同一任务,并记录 agent 版本、模型和工具配置。
2. 工具调用两端都可观测
区分「agent 提议动作 → 获批 → 请求发出 → 工具返回结果 → 目标系统状态独立确认」五个阶段;超时应保持「结果未知」,盲目重试写操作可能造成二次伤害。
3. 区分技术错误与无依据回答
HTTP 成功≠工具成功,工具成功≠agent 回答有据。传输错误、工具级错误、回答评估分别采集,尽可能在目标系统验证最终状态(如预订是否真的变更)。
4. 精确定义三种「回放」
浏览器回放(用户看到什么)、执行回放(步骤/响应/失败时间线)、重执行(复现故障,最难且危险)。重放 trace 绝不能静默重复真实的支付、发邮件或数据库写入;建议沙箱 + 录制的工具响应。
5. 复用现有可观测性栈
推荐 Grafana Faro(浏览器信号)+ OpenTelemetry(后端/agent/MCP 埋点)+ Alloy + Tempo(trace)+ Loki(日志)+ Prometheus(指标)+ Grafana(调查视图),可选 rrweb 做浏览器回放。作者提醒常规诊断 trace 可采样,但权威的结果记录须单独完整保留,否则「缺遥测」会被误判为「没干活」。
「编程与Agent」频道最新
- 作者用 GPT-6 Astra 做出 X-16 概念引擎 3D 演示并开源 — techartist_ · 2026-09-25
- Parallel 并行搜索内置进 LangChain 托管智能体 — BraceSproul · 2026-09-25
- 同一模型跑不同编码 harness:成功率仅差几个点,成本最高差 5 倍 — JeremyCMorgan · 2026-09-25
- TypeSafe AI 评测模型 Jev 免费上线 Vercel AI Gateway — JohnPhamous · 2026-09-25
- vibe coding 时代还要造新 Web 框架吗?前开源框架作者长文拆解 — rseroter · 2026-09-25
- 用户实测:一下午 5 次,Opus 5.5 承认 Astra 的方案更好 — Ice2jc · 2026-09-25