LLM 应用观测为何不同于 APM
Ill_Deer_156 · reddit · 2026-07-13
作者在给 LLM 功能接入现有 APM 后发现效果很差:传统监控擅长发现慢请求,但很难抓到幻觉、错误的 policy 结论,或者 agent 做了不该做的 tool call。
帖子认为,LLM 应用的可观测性需要一套不同于标准 APM 的信号,尤其是:
- 完整的 prompt / response trace
- tool call 参数与执行结果
- RAG 场景下的检索上下文
作者想了解大家是怎么做的:是沿用并扩展现有 APM,还是单独上 LLM observability 工具;以及线上事故时真正有用的是哪些 trace,哪些只是噪音。
「编程与Agent」频道最新
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11