自定义融合采样器 kernel 让 DiffusionGemma 在 vLLM 上再快 15%

imjustnewatai · x · 2026-09-23

开发者 mmastrac 报告,在 vLLM 上为 DiffusionGemma 编写了一个自定义融合采样器(fused sampler)kernel,使常规文本生成的吞吐再提升约 15% tokens/s。该优化针对普通文本解码路径,而非 DiffusionGemma 的 Jev 用法,说明采样器 kernel 融合仍是大模型推理栈中可挖掘的性能空间。

所属事件:自定义融合采样 kernel 助 vLLM 吞吐再涨 15%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →