H100 显存研究勘误:从 DeepSeek V3 开源 trace 反推 SwiGLU 量化内核细节

ezyang · x · 2026-09-02

PyTorch 核心维护者 ezyang 确认已修复 H100 显存研究中被指出的问题并发布勘误。起因是 Vlad Savinov 指出专家层图示有误:SwiGLU 并不直接消费 e4m3,因为 DeepGEMM 输出 bf16,量化很可能被融合进 SwiGLU 内核。

Vlad 进一步引用 DeepSeek 2025 年初开源的 V3 perfetto trace(GitHub 上的 profile-data 仓库,1.2k star)做验证:SwiGLU 耗时与 topK×seqlen×intermediate×7 / 2.8e12 的计算吻合(约 0.16ms)。他推测内核读取两个 bf16 张量、输出三个 fp8 张量——其中两个是量化输入,第三个是量化后的 silu(a)b,供下一次 DeepGEMM 调用使用(2.8e12 约为 Hopper 3.35 TB/s 带宽的 85%)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →