gemma 3 31B 跑分遇阻,开发者 fork vLLM 自写补丁突破速度

abhijithneil · x · 2026-09-04

开发者 abhijithneil 在对 31B 级 Gemma 模型做基准测试时,发现 flashinfer 的 attention 后端不支持 512 的 headdim,于是 fork 了 vLLM 项目并应用自定义补丁,成功突破基准测试速度限制。他感叹推理框架领域还有大量工作可做。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →