4xB200 实测并发扫描:用 TTFT/ITL/tok/s 看本地模型负载表现

TheZachMueller · x · 2026-10-04

开发者 TheZachMueller 分享了一套仍在打磨中的本地模型性能评测方法:在不同并发压力下扫描推理服务,并报告 TTFT(首 token 延迟)、ITL(token 间延迟)和 tok/s 三项指标,以此反映模型在特定硬件上的真实负载表现。作者给出了在 4 张 B200 上的实测示例,并表示后续会发布更多本地模型测试报告。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →