NVIDIA 开源 AIPerf:高并发下压测 LLM 推理性能
NVIDIAAI · x · 2026-09-19
NVIDIA 发布技术博客介绍 AIPerf,替代 GenAI-Perf 的 LLM 推理基准测试工具:
- 多进程架构:避免 Python GIL 和单进程瓶颈,高并发压测时客户端不再成为瓶颈。
- 支持 15+ 端点类型:内置 ShareGPT 等公开数据集,支持 Mooncake、Baseten、WEKA AgentX 的 trace replay 格式,模拟真实生产流量。
- 可配置到达模式:constant、Poisson、gamma 分布及可调 burstiness,可塑造贴近生产特征的负载。
- 指标:报告 TTFT、ITL、请求延迟、输出 token 吞吐量的百分位分布,并在有 DCGM/pynvml 时附带 GPU 遥测。
「Infra」频道最新
- Qwen 27B 在双 5090 上跑出 1253 tok/s,成本仅为 API 价 1/8 — me_broke · 2026-09-19
- 全球约20%芯片设计工程师在印度,美系大厂大量设计团队落地当地 — bookwormengr · 2026-09-19
- HBM 市场 2027 年或达千亿美元,美光锁 5 年长约改写内存周期 — Beth_Kindig · 2026-09-19
- Reddit 用户开源本地模型硬件 ROI 计算器,按内存带宽估性能 — SnoobieJunes · 2026-09-19
- SemiAnalysis:跑 Kimi K3 时 AMD Mi355X 每吉瓦利润率 53.6%,反超英伟达 — m2saxon · 2026-09-19
- 用 Lambda MicroVM 搭跨设备 AI 编程环境,作者日常使用 — blaizedsouza · 2026-09-19