DiffusionGemma 实测单卡 97 tok/s,vLLM 补丁数日内合入

GlennCameronjr · x · 2026-09-23

开发者 mmastrac 分享了 DiffusionGemma 的推理实验结果:并发为 1 时达到 97 tok/s,并发 32 时达到 317 tok/s——而这仅用了一块 Spark 设备。作者感叹这种扩散式语言模型的速度长期被忽视,vLLM 的相关补丁将在接下来几天内合入。

这意味着扩散式解码思路可能在小设备端侧推理上有实际价值,配合 vLLM 支持后值得持续关注。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →