开源推理调优器 Profile v2.2:单卡 5090 从 81 提到 421 tok/s

Inevitable-Diet-1870 · reddit · 2026-08-19

开源推理服务器优化工具 Profile 发布 v2.2:它计算 GPU 的 roofline 上限,测量运行中的 vLLM 服务器并定位瓶颈、给出具体启动参数,改完再复测,把调参变成确定性工程。

本版更新:核心规则引擎重写为 8 条规则构建的优先级 DAG(带互斥),从 5 个告警中消解回声、留下唯一真因,结果确定性输出;新增 AMD 显卡支持。作者实测(RTX 5090 + muse-glimmer 30B,SWE-Bench agent 负载,无 DFlash 投机解码):81 → 421 tok/s(25k 上下文),每百万输出 token 成本 $3.41 → $0.65,TTFT 224ms(p95 500ms),能耗 4.72 → 1.08 J/tok;全程仅 4 轮迭代约 30 分钟,其中一轮回归(KV 抖动、TTFT 32.8s)也被记录在案。

安装与使用:

bash

curl --proto '=https' --tlsv1.2 -LsSf https://github.com/jungledesh/profile/releases/latest/download/profile-installer.sh | sh

profile diagnose --url http://localhost:8000/metrics --duration 2m

目前仅支持 vLLM,路线图包括多 GPU/TP、更多引擎与 k8s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →