多智能体观测不是普通APM
Background-Job-862 · reddit · 2026-07-13
作者复盘了一次多步骤 agent 流水线事故:research agent → summarizer agent → notifier agent 交付给客户的摘要与源文档严重矛盾,但每个 agent 单独看日志都“正常”,导致团队花了两天才定位到底是哪一跳引入了错误。
他们认为 agent observability 不是单模型的 LLM observability,也不是传统 APM,而是要能回答“agent A 传给 agent B 了什么、B 又如何处理、语义在哪一步丢失”。
他们总结了需要的能力:
- 跨每一跳都保留同一个 trace id
- 记录每步的原始输入/输出 payload
- 统计每步 token 成本
- 支持按历史运行逐步 replay
后来他们用 Truefoundry 的 tracing/gateway 把这件事从“手工拼三套日志查两天”变成了更容易定位的问题。
「编程与Agent」频道最新
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11