gemma 3 31B 跑分遇阻,开发者 fork vLLM 自写补丁突破速度
abhijithneil · x · 2026-09-04
开发者 abhijithneil 在对 31B 级 Gemma 模型做基准测试时,发现 flashinfer 的 attention 后端不支持 512 的 headdim,于是 fork 了 vLLM 项目并应用自定义补丁,成功突破基准测试速度限制。他感叹推理框架领域还有大量工作可做。
「Infra」频道最新
- Gimlet Labs 获 3 亿美元 B 轮融资,估值 30 亿押注异构推理云 — stuffyokodraws · 2026-09-05
- 开发者用 Rust 打造新 SSR 框架,性能基准数字「有点离谱」 — mohamedmansour · 2026-09-05
- 大模型服务集体宕机后,网友重提本地私有部署的价值 — Kyrannio · 2026-09-05
- 96GB Strix Halo 跑 Qwen Flash Next 262k 上下文,求提速方案 — Forward_Jackfruit813 · 2026-09-05
- 2004 年的索尼 PSP 跑起 90M 对话模型,每秒仅 0.5 token — liright · 2026-09-05
- 双 7900XTX 跑 Qwen 3.8 仅 11 token/秒,网友求解性能之谜 — Nota_ReAlperson · 2026-09-05