谷歌工程师实测:LLM 基准测试工具会静默丢请求,200 QPS 只跑出 38
AI Engineer · youtube · 2026-09-20
谷歌工程师 Ashok Chandrasekar 与 Jason Kramberger 在 AI Engineer 演讲中指出,大量已发表的 LLM 推理基准数字不可复现,问题常出在测试工具本身:
- 吞吐虚报:要求 harness 每秒发 200 个请求,受 Python GIL 限制的单进程客户端实际只发出 38 个,却照常打印结果;实测的多款工具上限约 170 QPS 且从不报错。
- 延迟虚高:客户端自身繁忙时会把测到的延迟放大,一次多出 58 秒,看起来像服务端瓶颈,实则服务器正常。
- 温度 0 幻象:某份「吞吐高 20%」的结果是把 temperature 设为 0 得到的,比真实工作负载(0.7)快得多。
- 数据不一致:同一公开数据集喂给两个 harness,产生的输入 token 数不同(采样与截断方式不同)。
解决方案是他们主导的 CNCF 项目 Inference Perf(出自 Kubernetes serving 工作组):主进程按计划(Poisson、恒定速率或固定并发)调度请求并分发到多进程 worker,worker 汇报「实际发出时刻 vs 计划发出时刻」;客户端遥测与服务端指标并列展示,可区分工具故障与系统故障。它在 5000 QPS 下仍能跟上并如实报告;配置声明式,可回放带长度分布的多轮对话;还发布了可被其他工具采用的 workload catalog(agentic 生成、思维树、批量摘要)。最后展示了 llm-d 项目的 UI Prism,在 TPU 上 8 副本对比普通 Kubernetes 服务。
「Infra」频道最新
- CoreWeave 推理负责人拆解:Agent 请求 80-90% 输入重复,缓存决定架构 — AI Engineer · 2026-09-20
- 开发者细数痛点逐一迁移,告别 DigitalOcean — carnevalem · 2026-09-20
- 跑 Emacs 刷 X 的自建主机现比汽车还贵,GPU 涨价梗图走红 — tetsuoai · 2026-09-19
- M4 每周期可执行 10 条指令,超多数竞品,M5 提速另有玄机 — lemire · 2026-09-19
- Apple M6 核心数增至12,作者解析CPU仍在快速进步 — lemire · 2026-09-19
- Apple M2 到 M5 三年性能提升约 50%, gradual 无跳跃式增长 — lemire · 2026-09-19