开源推理调优器 Profile v2.2:单卡 5090 从 81 提到 421 tok/s
Inevitable-Diet-1870 · reddit · 2026-08-19
开源推理服务器优化工具 Profile 发布 v2.2:它计算 GPU 的 roofline 上限,测量运行中的 vLLM 服务器并定位瓶颈、给出具体启动参数,改完再复测,把调参变成确定性工程。
本版更新:核心规则引擎重写为 8 条规则构建的优先级 DAG(带互斥),从 5 个告警中消解回声、留下唯一真因,结果确定性输出;新增 AMD 显卡支持。作者实测(RTX 5090 + muse-glimmer 30B,SWE-Bench agent 负载,无 DFlash 投机解码):81 → 421 tok/s(25k 上下文),每百万输出 token 成本 $3.41 → $0.65,TTFT 224ms(p95 500ms),能耗 4.72 → 1.08 J/tok;全程仅 4 轮迭代约 30 分钟,其中一轮回归(KV 抖动、TTFT 32.8s)也被记录在案。
安装与使用:
bash
curl --proto '=https' --tlsv1.2 -LsSf https://github.com/jungledesh/profile/releases/latest/download/profile-installer.sh | sh
profile diagnose --url http://localhost:8000/metrics --duration 2m
目前仅支持 vLLM,路线图包括多 GPU/TP、更多引擎与 k8s。
「Infra」频道最新
- 实测百度提供 DeepSeek V4 Flash 极速且低价 — NielsRogge · 2026-08-19
- AI 定价两极分化:均价涨 3 年,上下限差 2 万倍 — move-size123 · 2026-08-19
- HarnessRouter 开源:首个 Agent Harness 统一接口 — ycombinator · 2026-08-19
- 推理路由存在“滑点”效应,亟需开放数据与基准测试 — AccBalanced · 2026-08-19
- 高维数据训练存储与聚类优化思路 — cephaloform · 2026-08-19
- vphone-cli:在 macOS 上启动虚拟 iPhone — tom_doerr · 2026-08-19