两台 DGX Spark 跑 GLM-5.3-Flash:自研内核让专家 GEMM 提速约 40%
EAccelerate_42 · x · 2026-09-03
Reederey 发布 glm53-flash-exl3-2x-dgx-spark v1.4.0,在两台 DGX Spark 上以 EXL3 量化运行 320B MoE 的 GLM-5.3-Flash。此版本对 CUDA 侧做了完全重写,不再是原版 exllamav3:胖专家 GEMM 内核加入 3 级 cp.async 流水线,在生产形状(M=3584,K=2048/4096/8192)下实测提速 38.6%–41.4%,达到约 73.5 TFLOP/s,且与原内核逐位一致(56 组对比验证),compute-sanitizer 三项检查零错误;机器上 prefill 保持约 1k tok/s,decode 与接受率不变,另引入 ticket scheduler。
「Infra」频道最新
- fchollet 晒出 #TPU 玩梗图,惊到 Hesamation 直呼离谱 — algo_diver · 2026-09-03
- Nvidia CoWoS 份额 2027 或降至 45.6%,AMD 翻倍至 19.8% — tengyanAI · 2026-09-03
- 弗州 Loudoun 县20年变迁,预言美国数据中心未来 — suchenzang · 2026-09-03
- 数据中心轰鸣不停:前 Scale AI CEO 调侃反建 NIMBY — suchenzang · 2026-09-03
- Beff Jezos:生物基底的每瓦算力被严重低估,硅基与生物走向共同复杂化 — beffjezos · 2026-09-03
- AMD 官方 Qwen3.8 MXFP4 量化无法在 llama.cpp 加载 — mailto_devnull · 2026-09-03