自定义融合采样器 kernel 让 DiffusionGemma 在 vLLM 上再快 15%
imjustnewatai · x · 2026-09-23
开发者 mmastrac 报告,在 vLLM 上为 DiffusionGemma 编写了一个自定义融合采样器(fused sampler)kernel,使常规文本生成的吞吐再提升约 15% tokens/s。该优化针对普通文本解码路径,而非 DiffusionGemma 的 Jev 用法,说明采样器 kernel 融合仍是大模型推理栈中可挖掘的性能空间。
所属事件:自定义融合采样 kernel 助 vLLM 吞吐再涨 15%(2 条相关)→
「Infra」频道最新
- SemiAnalysis 实测 Engram DRAM offloading 性能提升最高 50% — bookwormengr · 2026-09-23
- liuliu 提醒:宣称比 MLX/llama.cpp 快 4-10 倍的定制推理引擎多为噪声 — teortaxesTex · 2026-09-23
- 测算:DeepSeek DSec 集群单套物料约 2000 万美元,10 亿美元可建 50 套 — teortaxesTex · 2026-09-23
- B200 租赁价创新高,GPU 时租均价升至 7.88 美元 — sudoraohacker · 2026-09-23
- ASML 欧洲客户新设备交付为零,韩国独占 43% — FinanceYF5 · 2026-09-23
- 装机实测:一个风扇方向错了,双 GPU 从 85°C 降到 78°C — HankYeomans · 2026-09-23