Together AI 把 ThunderKittens 移植上 Vera Rubin,达 22 PFLOPS
Together AI 内核团队获得 NVIDIA Vera Rubin NVL72 系统的早期访问权限,在几天内研读新 ISA,将 ThunderKittens 框架的 NVFP4 与 FP8 GEMM 内核移植到 Rubin GPU 上,分别跑出超过 22 和 12 PFLOPS 的成绩,性能可与 cuBLAS、CUTLASS 等官方方案相当。团队同时发布技术博客详解移植过程,是首批公开的第三方 Rubin 内核优化实践之一。
已确认
- Together AI 获得早期访问,几天内完成新 ISA 研读与移植,NVFP4 GEMM 达 22 PFLOPS、FP8 达 12 PFLOPS,16k 规模 NVFP4 GEMM 最高推至 22.4 PFLOPS。
- 博客从原始 B200 GEMM 出发,逐步叠加 Rubin 新特性:更宽的 MMA step、更多张量内存/共享内存、B-side collectors、early A release 等。
- 性能与 cuBLAS、CUTLASS 相当。
为什么重要
- 团队指出 Rubin 最大的变化是张量核心消费操作数的速度翻倍,但仅加宽 MMA 并不足以喂饱核心;只有同时提升数据复用、加深流水线等,才能让 16k NVFP4 GEMM 达到 22.4 PFLOPS——这对其他准备适配 Rubin 的内核开发者具有直接参考价值。
- 作者明确表示这些内核仍处早期阶段,接下来还有 LUT 等进一步优化,说明 Rubin 的性能上限尚未被充分挖掘。
2026-09-11 ~ 2026-09-11 · 6 条相关
一手来源
- ThunderKittens 登上 Vera Rubin:NVFP4 GEMM 跑出 22 PFLOPS — togethercompute ·
- 喂饱 Rubin 张量核心:加宽数 MMA 不够,还要提复用加深流水线 — togethercompute ·
- 【源头】ThunderKittens 登上 Vera Rubin:NVFP4 GEMM 跑出 22 PFLOPS — togethercompute · 2026-09-11
- 【源头】喂饱 Rubin 张量核心:加宽数 MMA 不够,还要提复用加深流水线 — togethercompute · 2026-09-11
- Together AI 详解 Rubin 内核博客:从 B200 逐步叠加新特性 — togethercompute · 2026-09-11
- Together Compute 发布首批 Rubin GPU 优化 kernel,逐步启用新硬件特性 — togethercompute · 2026-09-11
另有 2 条近重复转述:simran_s_arora · HazyResearch