Horace He 解析怪现象:数据「可预测」时 GPU 矩阵乘法跑得更快
goyal__pramod · x · 2026-09-25
Horace He 在 thonking.ai 上的短文复盘一个反直觉发现:8192³ 大矩阵乘法上 CUTLASS profiler 显示比 PyTorch/CuBLAS 快 10%(288 vs 258 TFLOPS),但绑定进 Python 后优势消失。逐项消融后找到根因——CUTLASS profiler 默认只用整数初始化输入。实验证实:全零输入跑出 295 TFLOPS,而 randn 输入只有 257 TFLOPS,矩阵元素的取值分布竟直接影响运行时间,文章从第一性原理出发探究这一现象。
「Infra」频道最新
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25
- 开源 Jev 玩法:SGLang Radix Cache 助 Qwen3.6-35B-A3B 一秒跑完 64 个决策 — multiply_matrix · 2026-09-25
- Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍 — multiply_matrix · 2026-09-25
- 高通骁龙峰会主打'手机是 AI 中枢',欲造安卓版苹果式跨设备体验 — BenBajarin · 2026-09-25
- 5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存 — nirurin · 2026-09-25
- 开发商仅付1美元押金,Exelon拒为200亿美元数据中心供电 — SumitGup · 2026-09-25