H100 显存研究勘误:从 DeepSeek V3 开源 trace 反推 SwiGLU 量化内核细节
ezyang · x · 2026-09-02
PyTorch 核心维护者 ezyang 确认已修复 H100 显存研究中被指出的问题并发布勘误。起因是 Vlad Savinov 指出专家层图示有误:SwiGLU 并不直接消费 e4m3,因为 DeepGEMM 输出 bf16,量化很可能被融合进 SwiGLU 内核。
Vlad 进一步引用 DeepSeek 2025 年初开源的 V3 perfetto trace(GitHub 上的 profile-data 仓库,1.2k star)做验证:SwiGLU 耗时与 topK×seqlen×intermediate×7 / 2.8e12 的计算吻合(约 0.16ms)。他推测内核读取两个 bf16 张量、输出三个 fp8 张量——其中两个是量化输入,第三个是量化后的 silu(a)b,供下一次 DeepGEMM 调用使用(2.8e12 约为 Hopper 3.35 TB/s 带宽的 85%)。
「Infra」频道最新
- 戴尔 COO:推理 token 需求 2030 年将增长 87 倍至 3600 千万亿 — Beth_Kindig · 2026-09-03
- SkyPilot 推出 Agent Sessions:断线后编码 Agent 继续跑在自家 K8s 上 — skypilot_org · 2026-09-03
- 游戏显卡跑赢 hipBLASLt:博客详解 GPU 矩阵乘法优化 — Moist_Weird_42067 · 2026-09-03
- Modal 实习生复盘:环境级预算设计与 agent RL 后训练实践 — dejavucoder · 2026-09-03
- 边缘 AI 杀不死云端 Capex:五大论据反驳云杀手论 — yangastas_paradise · 2026-09-03
- 用自托管 Immich 替代 Google Photos,博主详解省钱方案 — speckx · 2026-09-03