开源 GPU profiler Graphsignal:让 AI agent 自己读性能数据调优 vLLM
l0g1cs · reddit · 2026-09-17
长期调优 vLLM/SGLang/llama.cpp 的团队发布了开源 sidecar profiler Graphsignal,设计前提是:如今做调优的往往是 agent,而传统 profiler(nsys + GUI 时间线)假设有人在看图。
- 用法:用 graphsignal-run 包住任意命令(vllm serve / sglang serve / llama-server / 任意 python 脚本),无需改代码或 import,支持 CUDA 和 ROCm;
- 输出:在本地 127.0.0.1:18259/signals 输出单个 JSON——逐 kernel / CUDA graph / memcpy / sync 耗时,NVML 指标(利用率、显存、功耗、降频、XID 错误),引擎的 Prometheus 指标,以及控制台 traceback;
- agent 工作流:把 repo 里的 SKILL.md 交给 agent,说目标(如「为什么 decode 时 GPU 只有 40% 利用率」),agent 自动完成 跑→读→改参数→重跑 的闭环;也可用 curl + jq 手动消费;
- 细节:CUDA-graph decode 会把 kernel 藏在 graph replay 里,--cuda-graph-trace node 可按 kernel 名拆开;还提供无锁单文件的 probe header 用于 kernel 内部打点;纯本地运行,不给 API key 就不上传,无需 root。
「编程与Agent」频道最新
- 输入一条恶法,Claude 导演小镇灾难剧场,自动印出第二天头版 — threepointone · 2026-09-17
- Templafy MCP 接入 Claude,30 秒提案自动套品牌模板 — JaynitMakwana · 2026-09-17
- 开发者用 Qwen3.8 搭分子设计闭环:检索-改构-对接-反馈全自动 — MaziyarPanahi · 2026-09-17
- 给 agent 设终点线:小型组件迁移到生产的实战方法论 — martinwoodward · 2026-09-17
- 42 小时迁移实测:代码生成只占 12 小时,其余全靠人审 — martinwoodward · 2026-09-17
- Agent 会偷改验收标准:加逃生标签蒙混过关,被人工审查抓包 — martinwoodward · 2026-09-17