4xB200 实测并发扫描:用 TTFT/ITL/tok/s 看本地模型负载表现
TheZachMueller · x · 2026-10-04
开发者 TheZachMueller 分享了一套仍在打磨中的本地模型性能评测方法:在不同并发压力下扫描推理服务,并报告 TTFT(首 token 延迟)、ITL(token 间延迟)和 tok/s 三项指标,以此反映模型在特定硬件上的真实负载表现。作者给出了在 4 张 B200 上的实测示例,并表示后续会发布更多本地模型测试报告。
「Infra」频道最新
- Ahmad Osman 带 DGX Station 上直播:谈本地 AI 如何变得有竞争力 — basedjensen · 2026-10-04
- 三台本地机各构建 Miro 克隆五次,tokens/s 指标毫无意义 — julianharris · 2026-10-04
- 内存两年涨近 4 倍,跑 256k 上下文已买不起内存条 — lxfater · 2026-10-04
- 64GB 内存本地部署 Qwen3 千亿参数模型,192K 上下文体验良好 — lxfater · 2026-10-04
- TPU 每百万 token 成本对比 Blackwell,Google 占优 — cgarciae88 · 2026-10-04
- 跑一次校准解码快 3 倍:16GB 显卡跑 256K 上下文的调优实录 — MoonsvnLyn · 2026-10-04