Emmy 降低 RTX 5090 上 Gemma 4-12B 首 token 延迟,但吞吐几乎不变

NoVibeCoding · reddit · 2026-08-04

作者介绍了 Emmy:一个面向 RTX GPU 的 vLLM 插件和部署/benchmark 工具,目标是提升 LLM 推理性能。

核心结论是:编译器生成的 GEMM 和 FlashAttention 内核可以降低首 token 延迟(TTFT),但不会提高持续生成速度,因为 TPOT 仍然受内存带宽限制。帖子用 Gemma 4-12B 在 RTX 5090 上,对 stock vLLM、vLLM + Emmy、启用 FASTMATH 的 Emmy,以及 llama.cpp 做了多组不同输入长度和并发度的对比。

主要结果包括:

作者同时给出了仓库和 Docker 镜像,方便复现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →