众包优化使 Qwen 27B FP8 在单卡 H200 上较 vLLM 原生快 3.5 倍
const_reborn · x · 2026-09-07
Paretonai 报告其矿工社区通过竞赛方式,把 Qwen3.8-27B-FP8 在单张 H200 上端到端推理速度做到原生 vLLM 的 3.5 倍(基于 SWE-agent 轨迹中位数):
- 单请求中位延迟 727ms → 190ms,吞吐 58.7 → 221.8 tok/s
- inter-token 延迟 p99 从 93ms 降到 38ms;满足严格服务 SLA 的请求占比从 3% 提升到 100%
- 输出与原版一致(贪心解码 token 匹配率 ≥0.99)
- 获胜补丁:启用 checkpoint 自带的 MTP 头做自投机解码(γ=8),加上为 GDN 线性注意力层写的融合 Triton 内核,仅在 vLLM 内改动 1090 行
- 第一周共 25 轮、74 次提交、31 名矿工参与
「Infra」频道最新
- M.2-Oculink 显卡链路暗降 PCIe 1x,附 lspci 排查命令 — El_90 · 2026-09-11
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11