实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍
bodonoghue85 · x · 2026-09-06
一位研究者指出 DiffusionGemma 论文未说明测吞吐量时用的 batch size,于是自己按近似设置做了 sweep:单张 H200、PG19 数据、每 forward 17.56 tokens、1k 输入 8k 输出、vLLM 推理。结果显示:
- 峰值吞吐在 fp8 下约 3k tok/s,bf16 下约 2.7k tok/s,比 uno 论文报告的数字高约 3 倍
- 论文声称的 1k tok/s 峰值吞吐不成立,论文数据需要更新
- 作者还指出,论文在 bf16 而非 fp8 下宣称推理优势并不寻常,因为大规模推理几乎没人用 bf16;实测 fp8 确实带来进一步提升
作者表示 vLLM 还可进一步调优,实际吞吐只会更高,并拒绝继续与论文作者争论。
「Infra」频道最新
- Polygres 把 Postgres 变成 AI agent 的混合检索上下文层 — Scobleizer · 2026-09-06
- TCS 联手 TPG 拟投 74 亿美元,在印度建 1GW AI 园区 — emmanuelvivier · 2026-09-06
- 实测 vLLM 广告 KV cache 注水,压力测试工具揭示真实保留率 — t4a8945 · 2026-09-06
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- 做一个比价面板,帮你找到跑 MiniMax H3 最便宜的 GPU — CategoryFew5869 · 2026-09-06
- 16GB 显存跑 Qwen3.8 本地模型做村庄模拟游戏,75 t/s 出字 — Fancy-Snow7 · 2026-09-06