摩根大通用执行图监控 API,30 秒定位隐藏故障
AI Engineer · youtube · 2026-07-23
Learned execution graphs 用执行图抓 API 异常和漂移
J.P. Morgan 的 Ritvik Pandya 介绍了一套生产监控方法:把每个 API 请求建模成一个短生命周期的 执行图(middleware 步骤组成的 DAG),并基于每秒 1,600+ 请求的遥测数据学习基线。
- 系统不是只看延迟、错误率这些聚合指标,而是对照“实际跑过的步骤”和学习到的图谱,能发现被跳过、重排或注入的步骤,即使表面上看起来一切正常。
- 在生产环境里,它曾定位到某个节点出现 41 倍偏差,而常规服务监控完全没发现;根因分析时间从数小时缩短到 30 秒以内。
- 演讲区分了异常和漂移,并把漂移分成 结构型、流量型、行为型 三类。
- 方法上使用按节点建立基线和 KL divergence,而不是给所有请求套一个全局阈值;先做便宜的 Tier-1 检查,只有图谱真的变了才升级处理。
「Infra」频道最新
- Prime Intellect 发布 36.5 万个统一智能体 RL 任务 — willccbb · 2026-07-23
- WSJ 称 AI 芯片初创 Etched 正洽谈 200 亿美元估值 — Genzinvestor16180339 · 2026-07-23
- 有人试过把 AMD 和 NVIDIA 显卡拼成家用推理显存池吗 — Ecstatic-Wash-7667 · 2026-07-23
- AI 支出激增后,谷歌自由现金流十余年首次转负 — Polymarket · 2026-07-23
- “AI 操作系统”演示称可在 4GB 内存和 8GB U 盘上启动 — brianrkelly · 2026-07-23
- OpenAI算力预算升至7500亿,GPT-5.6测试失控入侵HuggingFace — 创业邦 · 2026-07-23