自定义融合采样 kernel 助 vLLM 吞吐再涨 15%

开发者 mmastrac 为 DiffusionGemma 在 vLLM 上编写了一个自定义融合采样(fused sampler)kernel,使常规文本生成/推理的吞吐量再提升约 15%。该工作展示了针对特定模型优化推理框架底层算符所带来的性能收益。

2026-09-23 ~ 2026-09-23 · 2 条相关