两台 DGX Spark 跑 GLM-5.3-Flash:自研内核让专家 GEMM 提速约 40%

EAccelerate_42 · x · 2026-09-03

Reederey 发布 glm53-flash-exl3-2x-dgx-spark v1.4.0,在两台 DGX Spark 上以 EXL3 量化运行 320B MoE 的 GLM-5.3-Flash。此版本对 CUDA 侧做了完全重写,不再是原版 exllamav3:胖专家 GEMM 内核加入 3 级 cp.async 流水线,在生产形状(M=3584,K=2048/4096/8192)下实测提速 38.6%–41.4%,达到约 73.5 TFLOP/s,且与原内核逐位一致(56 组对比验证),compute-sanitizer 三项检查零错误;机器上 prefill 保持约 1k tok/s,decode 与接受率不变,另引入 ticket scheduler。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →