纯 Triton W4A16 GEMM 宣称 decode 比 cuBLAS 快 1.1 到 1.3 倍

bassrehab · reddit · 2026-07-22

一位开发者表示,他写了一个 纯 Triton 的 W4A16 GEMM 内核,在 A100-SXM4-80GB 上的 decode 场景中,能比 cuBLAS FP16 快约 1.1x–1.3x。

实现要点

作者给出的结果

作者也提醒,token 多起来后 cuBLAS 仍会反超,但他认为 decode 才是按 token 计费时的关键路径。由于实现是纯 Triton,理论上对 AMD 也更具可移植性,只是 MI300X 验证还没做。帖子还附了详细博客、代码仓库和 HF Kernel Hub 链接。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →