自定义融合采样算符让 vLLM 吞吐再涨 15%
generativist · x · 2026-09-23
开发者 mmastrac 为 DiffusionGemma 在 vLLM 上实现了一个自定义融合采样(fused sampler)kernel,常规文本推理吞吐量再提升 15% tok/s(该数字针对普通文本场景,非 DiffusionGemma-as-Jev 模式)。这是推理服务栈持续优化的又一实例。
所属事件:自定义融合采样 kernel 助 vLLM 吞吐再涨 15%(2 条相关)→
「Infra」频道最新
- 曝 Anthropic 洽租阿波罗系数据中心至多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 曝 Anthropic 拟向 Apollo 旗下数据中心租赁最多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 推理服务创业实测:能持续改进模型的训练能力才能留住客户 — ypatil125 · 2026-09-23
- M6 芯片 ANE 内存带宽超 150GB/s,可媲美 GPU/CPU — AIFlow_ML · 2026-09-23
- 报道称 Anthropic 谈判锁定更多数据中心算力 — pstAsiatech · 2026-09-23
- 网友算账:MiMo 论文 127 万条 rollout 轨迹,或只需 10 小时算力 — teortaxesTex · 2026-09-23