ARGUS 系统实现万卡集群低开销追踪,性能损耗不到 2%

stochasticchasm · x · 2026-08-02

大规模 LLM 训练中,粗粒度监控难以定位根因,而细粒度 profiler 开销过高(5%-30%)。ARGUS 系统针对万卡级 GPU 集群,实现了开销低于 2% 的全天候细粒度追踪与实时分析。

它将观测拆解为 CPU 调用栈、框架语义和 GPU kernel 执行,并将原始 kernel 事件数据极致压缩(从 10MB 降至 2.7KB)。该系统已在生产环境部署超半年,能有效检测计算落后节点等异常。

所属事件:ARGUS系统实现万卡集群低开销追踪(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →