ThunderKittens 登上 Vera Rubin:NVFP4 GEMM 跑出 22 PFLOPS

togethercompute · x · 2026-09-11

Together AI 内核团队获得 NVIDIA NVL72 早期访问,翻阅新 ISA 后将 NVFP4 与 FP8 GEMM 内核移植到 Vera Rubin,分别推过 22 和 12 PFLOPS,性能可与 cuBLAS + CUTLASS DSL 竞争。团队称 Rubin 上最大的变化是张量核心取操作数的速度翻倍,但仅加宽 MMA 不够,还需提高数据复用、加深流水线等才喂得饱核心,最终把 16k NVFP4 GEMM 推至 22.4 PFLOPS。

所属事件:Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →