自定义融合采样算符让 vLLM 吞吐再涨 15%

generativist · x · 2026-09-23

开发者 mmastrac 为 DiffusionGemma 在 vLLM 上实现了一个自定义融合采样(fused sampler)kernel,常规文本推理吞吐量再提升 15% tok/s(该数字针对普通文本场景,非 DiffusionGemma-as-Jev 模式)。这是推理服务栈持续优化的又一实例。

所属事件:自定义融合采样 kernel 助 vLLM 吞吐再涨 15%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →