谷歌工程师实测:LLM 基准测试工具会静默丢请求,200 QPS 只跑出 38

AI Engineer · youtube · 2026-09-20

谷歌工程师 Ashok Chandrasekar 与 Jason Kramberger 在 AI Engineer 演讲中指出,大量已发表的 LLM 推理基准数字不可复现,问题常出在测试工具本身:

解决方案是他们主导的 CNCF 项目 Inference Perf(出自 Kubernetes serving 工作组):主进程按计划(Poisson、恒定速率或固定并发)调度请求并分发到多进程 worker,worker 汇报「实际发出时刻 vs 计划发出时刻」;客户端遥测与服务端指标并列展示,可区分工具故障与系统故障。它在 5000 QPS 下仍能跟上并如实报告;配置声明式,可回放带长度分布的多轮对话;还发布了可被其他工具采用的 workload catalog(agentic 生成、思维树、批量摘要)。最后展示了 llm-d 项目的 UI Prism,在 TPU 上 8 副本对比普通 Kubernetes 服务。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →