开源工具 llm-inference-bench 力推本地 LLM 推理测速统一标准
TheZachMueller · x · 2026-10-04
社区成员呼吁为本地 LLM 推理建立统一的 prefill/decode 测速标准,质疑目前各家自报的吞吐数字不可比,并推荐 Local Inference Lab 开源的 llm-inference-bench 作为事实标准候选。
- 该工具用 Rich TUI 仪表盘测量 decode 吞吐,覆盖并发数(1/2/4/8…)与上下文长度(0K–128K)组成的完整矩阵
- 包含 prefill、持续 decode、可选 Burst/E2E 三层基准,支持 SGLang 和 vLLM(自动检测),兼容任意 OpenAI 兼容 API(OpenRouter、Together AI 等)
- 可在不同硬件配置间复现,适合横向对比
原推作者 Zach Mueller 表示将提出方案推动标准化,先统一行业术语与本地推理速度的完整数值范围。
「Infra」频道最新
- TPU 每百万 token 成本对比 Blackwell,Google 占优 — cgarciae88 · 2026-10-04
- 跑一次校准解码快 3 倍:16GB 显卡跑 256K 上下文的调优实录 — MoonsvnLyn · 2026-10-04
- 4xB200 实测并发扫描:用 TTFT/ITL/tok/s 看本地模型负载表现 — TheZachMueller · 2026-10-04
- NVIDIA 开源 AIPerf:面向 AI 模型的性能测试工具发布 — TheZachMueller · 2026-10-04
- 一句提示清掉 39.7GB:用 ccmd MCP 让 Claude Code 安全清缓存 — julsimon · 2026-10-04
- 从一张 3090 到 20 台 DGX Spark:家庭本地推理集群的完整进化史 — ciprianveg · 2026-10-04