NanoGPT 竞速新纪录 68 秒:QK 维度砍到 96 叠加 FP8 注意力
kellerjordan0 · x · 2026-09-18
modded-nanogpt 迎来 Track 1 新世界纪录:在 8xH100 上将训练时间压到 68.0 秒(同节点提速 5.15%,快约 5.8 秒),由 Nvidia 工程师 Glitchfix 通过一个超千行 Triton 代码的重磅 PR 达成。
核心技术改动:
- 将 Q/K 头维度从 128 降到 96,而 V 和残差流保持 128 维——路由向量不必与承载内容的值向量同宽,归一化后的 Q/K 用更小几何即可,减少投影计算而不伤及 V 与残差;
- 把 QKV 投影打包进共享的 FP8 投影,并配套写了布局、归一化、RoPE 和反向传播的 Triton kernel;
- 将 [QK Norm、RoPE、KeyOffset、paired head layout] 融合成单个 Triton kernel,MLP 反向与 QKV 前向/反向迁移到 FP8,共用了 4 种不同的 FP8 缩放方案,外加精细的寄存器感知 epilogue 布局。
Keller Jordan 转发时给出两点观察:一是如果在 nano 尺度 QK 维度小于 128 反而更好,那么在更大规模(Hero scale)上或许大于 128 才是最优;二是这位 Nvidia 工程师的工程实力相当硬核。
「Infra」频道最新
- 开发者实测:AI 20 分钟完成移植工作,CUDA 护城河正在被侵蚀 — BringTea_666 · 2026-09-18
- 新半导体政策推出数月,印度获 120 亿美元投资承诺 — pstAsiatech · 2026-09-18
- 百度智能云押注具身「能力量产」,已服务50多家具身企业 — 量子位 · 2026-09-18
- 对冲基金经理:Anthropic 每 token 成本远低于 OpenAI — rohanpaul_ai · 2026-09-18
- 工程师爆料:企业根本数不清自己有多少台服务器,有人干脆藏机器 — irth7 · 2026-09-18
- SK 海力士旗下 Solidigm 拟在美国建 NAND 闪存厂 — zephyr_z9 · 2026-09-18