Emmy 降低 RTX 5090 上 Gemma 4-12B 首 token 延迟,但吞吐几乎不变
NoVibeCoding · reddit · 2026-08-04
作者介绍了 Emmy:一个面向 RTX GPU 的 vLLM 插件和部署/benchmark 工具,目标是提升 LLM 推理性能。
核心结论是:编译器生成的 GEMM 和 FlashAttention 内核可以降低首 token 延迟(TTFT),但不会提高持续生成速度,因为 TPOT 仍然受内存带宽限制。帖子用 Gemma 4-12B 在 RTX 5090 上,对 stock vLLM、vLLM + Emmy、启用 FASTMATH 的 Emmy,以及 llama.cpp 做了多组不同输入长度和并发度的对比。
主要结果包括:
- 在若干场景下 TTFT 明显改善,FASTMATH 尤其有效。
- 稳态 token 吞吐多数时候接近 stock vLLM,部分场景因插件开销略慢。
- 还做了 MTP 的 smoke test,用来检查 speculative decoding 是否带来质量或性能退化。
作者同时给出了仓库和 Docker 镜像,方便复现。
「Infra」频道最新
- 核能初创公司 Valar 获红杉领投 10 亿美元融资 — kleffew94 · 2026-08-04
- 2025 图表显示,AI API 收入仍远落后于云厂商 capex — SurpriseDog9000 · 2026-08-04
- 美国中部对 AI 数据中心的反弹正在升温 — altryne · 2026-08-04
- 半导体和数据中心的扩张,远慢于 AI 需求 — robleclerc · 2026-08-04
- Gemma 4 31B 的 KV Cache 内存开销比 DeepSeek V4 Flash 高 13 倍 — teortaxesTex · 2026-08-04
- 面向嵌入式板卡的 MCP 服务器支持结构化编译刷写调试 — Historical_Court795 · 2026-08-04