纯 Triton W4A16 GEMM 宣称 decode 比 cuBLAS 快 1.1 到 1.3 倍
bassrehab · reddit · 2026-07-22
一位开发者表示,他写了一个 纯 Triton 的 W4A16 GEMM 内核,在 A100-SXM4-80GB 上的 decode 场景中,能比 cuBLAS FP16 快约 1.1x–1.3x。
实现要点
- 使用 FP16 activations,结合 GPTQ/AWQ 风格的 group quant,group size 为 128。
- 在 GEMM 循环内部用寄存器完成反量化。
- 针对窄形状 decode 使用 split-K。
作者给出的结果
- qwen2-72b-ffn (8192, 29568):M=1 时快 1.28x,M=8 时快 1.21x
- llama3-8b-attn-qkv (4096, 4096):M=1 时快 1.33x,M=8 时快 1.14x
- llama3-8b-ffn-up (4096, 14336):M=1 时快 1.18x,M=8 时快 1.10x
作者也提醒,token 多起来后 cuBLAS 仍会反超,但他认为 decode 才是按 token 计费时的关键路径。由于实现是纯 Triton,理论上对 AMD 也更具可移植性,只是 MI300X 验证还没做。帖子还附了详细博客、代码仓库和 HF Kernel Hub 链接。
「Infra」频道最新
- AMD 与 Anthropic 达成数百亿美元级 AI 服务器交易 — ctjlewis · 2026-07-22
- Qdrant 将在 Bellevue 讨论 AI 记忆与视频检索 — qdrant_engine · 2026-07-22
- 推理能力正变成代币化商品,一张图看懂 onchain AI 市场 — 0xJeff · 2026-07-22
- Google DeepMind 为美国能源部科研项目投入 4000 万美元 — GoogleDeepMind · 2026-07-22
- 黄仁勋称中国开源模型应被使用而非恐惧 — hyhieu226 · 2026-07-22
- AWS 19 年老将离职,被解读为人才外流信号 — DavidLinthicum · 2026-07-22